Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

КОМПАНИЯ · ENTITY #13393

9B model

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

1

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Когда обучение конечного агента застревает — arXiv:2610.02405v1

В статье на arXiv анализируются сбои при обучении конечных агентов с использованием моделей уровня Claude Opus в роли мета‑агентов для генерации задач и верификаторов; выделены три класса ошибок: недействительность бенчмарка, хрупкость окружения и несогласованность вознаграждения. Авторы показывают, что переработка подсказок и расширение контекста повышают решаемость в 5,6 раза; модель с 9 млрд параметров достигает насыщения на 81,3% mean pass@2 за 20 шагов на задачах, сгенерированных Claude Opus, а добавление тяжёлых задач снижает mean pass@2 до 20,6% при неизменной конфигурации обучения, и делают вывод о необходимости калибровки «полосы решаемости», аудитов верификаторов и учёта ошибок инфраструктуры.

7.0