ИССЛЕДОВАНИЕ · RESEARCH · #591
Статья предлагает «checkpoint handoff» для разделения эффектов REACH и SOLVE в агентном RL
Статья на arXiv (2609.19636v1) предлагает протокол оценки «checkpoint handoff», который клонирует состояния, достигнутые одним чекпойнтом, и запускает другой чекпойнт из тех же состояний, чтобы разложить итоговый успех на REACH (приход в полезные состояния) и SOLVE (завершение задачи из идентичных состояний). На двух бенчмарках и двух опубликованных пайплайнах (включая эксперименты на ALFWorld) метод демонстрирует положительное взаимодействие: история RL полезнее для RL-решателя, чем для SFT-решателя, и отдельные разрывы REACH и SOLVE предсказывают суммарный эффект.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Статья на arXiv (2609.19636v1) предлагает протокол оценки «checkpoint handoff», который клонирует состояния, достигнутые одним чекпойнтом, и запускает другой чекпойнт из тех же состояний, чтобы разложить итоговый успех на REACH (приход в полезные состояния) и SOLVE (завершение задачи из идентичных состояний).
- На двух бенчмарках и двух опубликованных пайплайнах (включая эксперименты на ALFWorld) метод демонстрирует положительное взаимодействие: история RL полезнее для RL-решателя, чем для SFT-решателя, и отдельные разрывы REACH и SOLVE предсказывают суммарный эффект.
- Протокол даёт простой способ выяснить, связаны ли улучшения RL с приходом в лучшие состояния или с лучшим решением задач в этих состояниях, что улучшает интерпретацию прироста в агентном RL и оценку долгих эпизодов.
ПОЧЕМУ ЭТО ВАЖНО
Протокол даёт простой способ выяснить, связаны ли улучшения RL с приходом в лучшие состояния или с лучшим решением задач в этих состояниях, что улучшает интерпретацию прироста в агентном RL и оценку долгих эпизодов.