ИССЛЕДОВАНИЕ · RESEARCH · #1628
arXiv:2610.07250v1 предлагает D-OPCD для дистилляции улучшений агента в веса диффузионной модели
Статья (arXiv:2610.07250v1) описывает Diffusion On-Policy Context Distillation (D-OPCD) — метод, который рассматривает улучшенные агентом подсказки как привилегированный контекст и дистиллирует знания агентского каркаса в веса диффузионной модели, чтобы генератор сохранял часть преимуществ каркаса при подаче исходного запроса. С текстово-визуальным агентом и предложенным Auto Skill Evolver (ASE) авторы сообщают об увеличении среднего показателя прямой генерации с 60.52 до 65.09 по четырём бенчмаркам и дополнительном приросте 1.83 пункта после второго раунда ASE на обновлённом генераторе по сравнению с каркасом без навыков.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Статья (arXiv:2610.07250v1) описывает Diffusion On-Policy Context Distillation (D-OPCD) — метод, который рассматривает улучшенные агентом подсказки как привилегированный контекст и дистиллирует знания агентского каркаса в веса диффузионной модели, чтобы генератор сохранял часть преимуществ каркаса при подаче исходного запроса.
- С текстово-визуальным агентом и предложенным Auto Skill Evolver (ASE) авторы сообщают об увеличении среднего показателя прямой генерации с 60.52 до 65.09 по четырём бенчмаркам и дополнительном приросте 1.83 пункта после второго раунда ASE на обновлённом генераторе по сравнению с каркасом без навыков.
- При успешной дистилляции улучшения агента становятся доступными без запуска каркаса, что позволяет создавать более эффективные и взаимно развивающиеся text-to-image системы.
ПОЧЕМУ ЭТО ВАЖНО
При успешной дистилляции улучшения агента становятся доступными без запуска каркаса, что позволяет создавать более эффективные и взаимно развивающиеся text-to-image системы.