НОВОСТЬ · RESEARCH · #231
PROOF-Gen: от оптимизированных данных к лучшей дистилляции для вызова инструментов
Статья представляет PROOF-Gen — подход, который генерирует оптимизированные тренировочные данные для улучшения supervised fine-tuning студентских моделей, дистиллируемых из траекторий, сгенерированных «учителем», чтобы преодолеть ограничение распространённого конвейера generate-and-filter, оставляющего трудные случаи без обработки. Авторы отмечают, что на τ 2-bench 57% попыток «учителя» завершаются неудачей, и примерно две трети этих неудач — «близкие промахи» (большинство вызовов инструментов было правильным, но затем отменено), что обосновывает необходимость использования сигналов из ошибок вместо их отбрасывания.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Статья представляет PROOF-Gen — подход, который генерирует оптимизированные тренировочные данные для улучшения supervised fine-tuning студентских моделей, дистиллируемых из траекторий, сгенерированных «учителем», чтобы преодолеть ограничение распространённого конвейера generate-and-filter, оставляющего трудные случаи без обработки.
- Авторы отмечают, что на τ 2-bench 57% попыток «учителя» завершаются неудачей, и примерно две трети этих неудач — «близкие промахи» (большинство вызовов инструментов было правильным, но затем отменено), что обосновывает необходимость использования сигналов из ошибок вместо их отбрасывания.
- Если метод окажется эффективным, PROOF-Gen может повысить эффективность данных в процессах дистилляции и снизить регулярные затраты, превращая ошибки «учителя» в полезный сигнал обучению, а не отбрасывая их.
ПОЧЕМУ ЭТО ВАЖНО
Если метод окажется эффективным, PROOF-Gen может повысить эффективность данных в процессах дистилляции и снизить регулярные затраты, превращая ошибки «учителя» в полезный сигнал обучению, а не отбрасывая их.