Статья предлагает «checkpoint handoff» для разделения эффектов REACH и SOLVE в агентном RL
Статья на arXiv (2609.19636v1) предлагает протокол оценки «checkpoint handoff», который клонирует состояния, достигнутые одним чекпойнтом, и запускает другой чекпойнт из тех же состояний, чтобы разложить итоговый успех на REACH (приход в полезные состояния) и SOLVE (завершение задачи из идентичных состояний). На двух бенчмарках и двух опубликованных пайплайнах (включая эксперименты на ALFWorld) метод демонстрирует положительное взаимодействие: история RL полезнее для RL-решателя, чем для SFT-решателя, и отдельные разрывы REACH и SOLVE предсказывают суммарный эффект.