Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1001

Privileged Self-Practice (PSP) для многошаговых LLM-агентов (arXiv:2609.29051v1)

В препринте на arXiv показан дефект на-политики самоструктурации (OPSD) для многошаговых агентов — модель становится уверенной, но без реальной информации, — и предложен метод Privileged Self-Practice (PSP). PSP сохраняет привилегированную информацию (PI) в подсказке/семплере: при неудачных откатах анализатор добавляет короткую инструкцию в контекст, задачу пересэмплируют и обучают по тому же GRPO-объективу; на AppWorld и SWE-bench Verified (с тремя студент-моделями) PSP стабильно опережает OPSD и обычный GRPO, повышая достижение целей задач до 65% на AppWorld и долю решённых задач до 61% на SWE-bench Verified.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В препринте на arXiv показан дефект на-политики самоструктурации (OPSD) для многошаговых агентов — модель становится уверенной, но без реальной информации, — и предложен метод Privileged Self-Practice (PSP).
  2. PSP сохраняет привилегированную информацию (PI) в подсказке/семплере: при неудачных откатах анализатор добавляет короткую инструкцию в контекст, задачу пересэмплируют и обучают по тому же GRPO-объективу; на AppWorld и SWE-bench Verified (с тремя студент-моделями) PSP стабильно опережает OPSD и обычный GRPO, повышая достижение целей задач до 65% на AppWorld и долю решённых задач до 61% на SWE-bench Verified.
  3. Это важно, потому что выявляет критическое ограничение OPSD в многошаговых сценариях и предлагает простое, эмпирически эффективное решение, которое стабильно превосходит предшественников и базовый RL на бенчмарках.

ПОЧЕМУ ЭТО ВАЖНО

Это важно, потому что выявляет критическое ограничение OPSD в многошаговых сценариях и предлагает простое, эмпирически эффективное решение, которое стабильно превосходит предшественников и базовый RL на бенчмарках.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1