Tech Meridian ← К ЛЕНТЕ
EN

НОВОСТЬ · RESEARCH · #231

PROOF-Gen: от оптимизированных данных к лучшей дистилляции для вызова инструментов

Статья представляет PROOF-Gen — подход, который генерирует оптимизированные тренировочные данные для улучшения supervised fine-tuning студентских моделей, дистиллируемых из траекторий, сгенерированных «учителем», чтобы преодолеть ограничение распространённого конвейера generate-and-filter, оставляющего трудные случаи без обработки. Авторы отмечают, что на τ 2-bench 57% попыток «учителя» завершаются неудачей, и примерно две трети этих неудач — «близкие промахи» (большинство вызовов инструментов было правильным, но затем отменено), что обосновывает необходимость использования сигналов из ошибок вместо их отбрасывания.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Статья представляет PROOF-Gen — подход, который генерирует оптимизированные тренировочные данные для улучшения supervised fine-tuning студентских моделей, дистиллируемых из траекторий, сгенерированных «учителем», чтобы преодолеть ограничение распространённого конвейера generate-and-filter, оставляющего трудные случаи без обработки.
  2. Авторы отмечают, что на τ 2-bench 57% попыток «учителя» завершаются неудачей, и примерно две трети этих неудач — «близкие промахи» (большинство вызовов инструментов было правильным, но затем отменено), что обосновывает необходимость использования сигналов из ошибок вместо их отбрасывания.
  3. Если метод окажется эффективным, PROOF-Gen может повысить эффективность данных в процессах дистилляции и снизить регулярные затраты, превращая ошибки «учителя» в полезный сигнал обучению, а не отбрасывая их.

ПОЧЕМУ ЭТО ВАЖНО

Если метод окажется эффективным, PROOF-Gen может повысить эффективность данных в процессах дистилляции и снизить регулярные затраты, превращая ошибки «учителя» в полезный сигнал обучению, а не отбрасывая их.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1