ИССЛЕДОВАНИЕ · RESEARCH · #1343
Статья AREX-2 предлагает обучение с длинной цепочкой отражений для самоулучшающихся LLM-агентов
AREX-2 (arXiv:2609.38288v1) описывает обучение агентов на базе Qwen3.8-27B с синтезированными длинными траекториями улучшения из задач машинного обучения и алгоритмического программирования для обучения рефлексии и устойчивой итеративной оптимизации. В статье представлены высокие результаты (MLE-bench Lite 81.8; Frontier-CS 70.7) и перенос на исследовательские бенчмарки (BrowseComp 84.0; HLE 52.6; GAIA 92.2; DeepSearchQA 93.8), причём качество продолжает расти с увеличением числа итераций.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- AREX-2 (arXiv:2609.38288v1) описывает обучение агентов на базе Qwen3.8-27B с синтезированными длинными траекториями улучшения из задач машинного обучения и алгоритмического программирования для обучения рефлексии и устойчивой итеративной оптимизации.
- В статье представлены высокие результаты (MLE-bench Lite 81.8; Frontier-CS 70.7) и перенос на исследовательские бенчмарки (BrowseComp 84.0; HLE 52.6; GAIA 92.2; DeepSearchQA 93.8), причём качество продолжает расти с увеличением числа итераций.
- Работа демонстрирует, что обучение на длинных траекториях отражений может дать LLM-агентов, способных итеративно самоулучшаться в разных доменах, что является практическим шагом к более надёжному обучению на этапе тестирования.
ПОЧЕМУ ЭТО ВАЖНО
Работа демонстрирует, что обучение на длинных траекториях отражений может дать LLM-агентов, способных итеративно самоулучшаться в разных доменах, что является практическим шагом к более надёжному обучению на этапе тестирования.