Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1628

arXiv:2610.07250v1 предлагает D-OPCD для дистилляции улучшений агента в веса диффузионной модели

Статья (arXiv:2610.07250v1) описывает Diffusion On-Policy Context Distillation (D-OPCD) — метод, который рассматривает улучшенные агентом подсказки как привилегированный контекст и дистиллирует знания агентского каркаса в веса диффузионной модели, чтобы генератор сохранял часть преимуществ каркаса при подаче исходного запроса. С текстово-визуальным агентом и предложенным Auto Skill Evolver (ASE) авторы сообщают об увеличении среднего показателя прямой генерации с 60.52 до 65.09 по четырём бенчмаркам и дополнительном приросте 1.83 пункта после второго раунда ASE на обновлённом генераторе по сравнению с каркасом без навыков.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Статья (arXiv:2610.07250v1) описывает Diffusion On-Policy Context Distillation (D-OPCD) — метод, который рассматривает улучшенные агентом подсказки как привилегированный контекст и дистиллирует знания агентского каркаса в веса диффузионной модели, чтобы генератор сохранял часть преимуществ каркаса при подаче исходного запроса.
  2. С текстово-визуальным агентом и предложенным Auto Skill Evolver (ASE) авторы сообщают об увеличении среднего показателя прямой генерации с 60.52 до 65.09 по четырём бенчмаркам и дополнительном приросте 1.83 пункта после второго раунда ASE на обновлённом генераторе по сравнению с каркасом без навыков.
  3. При успешной дистилляции улучшения агента становятся доступными без запуска каркаса, что позволяет создавать более эффективные и взаимно развивающиеся text-to-image системы.

ПОЧЕМУ ЭТО ВАЖНО

При успешной дистилляции улучшения агента становятся доступными без запуска каркаса, что позволяет создавать более эффективные и взаимно развивающиеся text-to-image системы.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1