Tech Meridian ← К СУЩНОСТЯМ
EN

ТЕМА · ENTITY #1361

distillation

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

3

RESEARCH · 1 ИСТОЧН. · Apple Machine Learning Research

TS-DFM: направленная энергией дистилляция сокращает дискретный flow-matching до 8 шагов с лучшей перплексией

Trajectory-Shaped Discrete Flow Matching (TS-DFM) заменяет слепые стохастические промежуточные прыжки, используемые при построении траекторий для дистилляции, лёгким «энергетическим компасом», выбирающим более связные продолжения. На языковой модели с 170 млн параметров студент TS-DFM с 8 шагами генерации достигает на 32% лучшей перплексии по сравнению с учителем в 1 024 шага и работает в 128 раз быстрее; улучшения наблюдаются на разных наборах данных и оценщиках, а дополнительная навигация применяется только при обучении.

7.0

RESEARCH · 1 ИСТОЧН. · Apple Machine Learning Research

PROOF-Gen: от оптимизированных данных к лучшей дистилляции для вызова инструментов

Статья представляет PROOF-Gen — подход, который генерирует оптимизированные тренировочные данные для улучшения supervised fine-tuning студентских моделей, дистиллируемых из траекторий, сгенерированных «учителем», чтобы преодолеть ограничение распространённого конвейера generate-and-filter, оставляющего трудные случаи без обработки. Авторы отмечают, что на τ 2-bench 57% попыток «учителя» завершаются неудачей, и примерно две трети этих неудач — «близкие промахи» (большинство вызовов инструментов было правильным, но затем отменено), что обосновывает необходимость использования сигналов из ошибок вместо их отбрасывания.

7.0

RESEARCH · 1 ИСТОЧН. · Google Research

Исследователи Google предлагают «ранние считывания» и «просеиватель признаков» для борьбы со спурриозными признаками и простотной предвзятостью

Авторы из Google Research Ришаб Тивари и Прадеп Шеной описывают два вмешательства — прогнозы из ранних промежуточных слоёв («ранние считывания») и принудительное «забывание признаков» с помощью «просеивателя признаков» — чтобы обнаруживать и снижать зависимость от спурриозных признаков и простотную предвзятость в глубоких сетях. Сигнал от ранних считываний используется для перенастройки вклада учителя при дистилляции, а просеиватель признаков заставляет модель искать более информативные признаки; авторы сообщают об улучшении worst‑group accuracy на бенчмарках (Waterbirds, CelebA, CivilComments, MNLI) и лучшей генерализации на невидимые домены по сравнению с предыдущими подходами.

7.0