Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1343

Статья AREX-2 предлагает обучение с длинной цепочкой отражений для самоулучшающихся LLM-агентов

AREX-2 (arXiv:2609.38288v1) описывает обучение агентов на базе Qwen3.8-27B с синтезированными длинными траекториями улучшения из задач машинного обучения и алгоритмического программирования для обучения рефлексии и устойчивой итеративной оптимизации. В статье представлены высокие результаты (MLE-bench Lite 81.8; Frontier-CS 70.7) и перенос на исследовательские бенчмарки (BrowseComp 84.0; HLE 52.6; GAIA 92.2; DeepSearchQA 93.8), причём качество продолжает расти с увеличением числа итераций.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. AREX-2 (arXiv:2609.38288v1) описывает обучение агентов на базе Qwen3.8-27B с синтезированными длинными траекториями улучшения из задач машинного обучения и алгоритмического программирования для обучения рефлексии и устойчивой итеративной оптимизации.
  2. В статье представлены высокие результаты (MLE-bench Lite 81.8; Frontier-CS 70.7) и перенос на исследовательские бенчмарки (BrowseComp 84.0; HLE 52.6; GAIA 92.2; DeepSearchQA 93.8), причём качество продолжает расти с увеличением числа итераций.
  3. Работа демонстрирует, что обучение на длинных траекториях отражений может дать LLM-агентов, способных итеративно самоулучшаться в разных доменах, что является практическим шагом к более надёжному обучению на этапе тестирования.

ПОЧЕМУ ЭТО ВАЖНО

Работа демонстрирует, что обучение на длинных траекториях отражений может дать LLM-агентов, способных итеративно самоулучшаться в разных доменах, что является практическим шагом к более надёжному обучению на этапе тестирования.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1