Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

ТЕМА · ENTITY #8440

analyzer model

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

1

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Privileged Self-Practice (PSP) для многошаговых LLM-агентов (arXiv:2609.29051v1)

В препринте на arXiv показан дефект на-политики самоструктурации (OPSD) для многошаговых агентов — модель становится уверенной, но без реальной информации, — и предложен метод Privileged Self-Practice (PSP). PSP сохраняет привилегированную информацию (PI) в подсказке/семплере: при неудачных откатах анализатор добавляет короткую инструкцию в контекст, задачу пересэмплируют и обучают по тому же GRPO-объективу; на AppWorld и SWE-bench Verified (с тремя студент-моделями) PSP стабильно опережает OPSD и обычный GRPO, повышая достижение целей задач до 65% на AppWorld и долю решённых задач до 61% на SWE-bench Verified.

7.0