PROOF-Gen: от оптимизированных данных к лучшей дистилляции для вызова инструментов
Статья представляет PROOF-Gen — подход, который генерирует оптимизированные тренировочные данные для улучшения supervised fine-tuning студентских моделей, дистиллируемых из траекторий, сгенерированных «учителем», чтобы преодолеть ограничение распространённого конвейера generate-and-filter, оставляющего трудные случаи без обработки. Авторы отмечают, что на τ 2-bench 57% попыток «учителя» завершаются неудачей, и примерно две трети этих неудач — «близкие промахи» (большинство вызовов инструментов было правильным, но затем отменено), что обосновывает необходимость использования сигналов из ошибок вместо их отбрасывания.