Tech Meridian ← К ЛЕНТЕ
EN

ИССЛЕДОВАНИЕ · RESEARCH · #591

Статья предлагает «checkpoint handoff» для разделения эффектов REACH и SOLVE в агентном RL

Статья на arXiv (2609.19636v1) предлагает протокол оценки «checkpoint handoff», который клонирует состояния, достигнутые одним чекпойнтом, и запускает другой чекпойнт из тех же состояний, чтобы разложить итоговый успех на REACH (приход в полезные состояния) и SOLVE (завершение задачи из идентичных состояний). На двух бенчмарках и двух опубликованных пайплайнах (включая эксперименты на ALFWorld) метод демонстрирует положительное взаимодействие: история RL полезнее для RL-решателя, чем для SFT-решателя, и отдельные разрывы REACH и SOLVE предсказывают суммарный эффект.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Статья на arXiv (2609.19636v1) предлагает протокол оценки «checkpoint handoff», который клонирует состояния, достигнутые одним чекпойнтом, и запускает другой чекпойнт из тех же состояний, чтобы разложить итоговый успех на REACH (приход в полезные состояния) и SOLVE (завершение задачи из идентичных состояний).
  2. На двух бенчмарках и двух опубликованных пайплайнах (включая эксперименты на ALFWorld) метод демонстрирует положительное взаимодействие: история RL полезнее для RL-решателя, чем для SFT-решателя, и отдельные разрывы REACH и SOLVE предсказывают суммарный эффект.
  3. Протокол даёт простой способ выяснить, связаны ли улучшения RL с приходом в лучшие состояния или с лучшим решением задач в этих состояниях, что улучшает интерпретацию прироста в агентном RL и оценку долгих эпизодов.

ПОЧЕМУ ЭТО ВАЖНО

Протокол даёт простой способ выяснить, связаны ли улучшения RL с приходом в лучшие состояния или с лучшим решением задач в этих состояниях, что улучшает интерпретацию прироста в агентном RL и оценку долгих эпизодов.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1