ИССЛЕДОВАНИЕ · RESEARCH · #1233
CoRe: соэволюция моделей вознаграждения для снижения латентного взлома вознаграждений в видео-диффузионных моделях
Этот препринт на arXiv описывает «латентный взлом вознаграждений», при котором оптимизация генератора против фиксированной латентной функции вознаграждения приводит к высоким предсказанным оценкам, но ухудшению визуального и динамического качества, вызванному «уходом» распределения. Авторы предлагают CoRe — фреймворк соэволюции, который постоянно дообучает модель вознаграждения на текущих выборках генератора, закрепляя её на предпочтениях реальных видео; в экспериментах на Wan2.1-T2V-1.3B показаны стабильные улучшения качества по сравнению с предобученной моделью и предыдущими методами выравнивания и предотвращается коллапс при оптимизации против фиксированной награды.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Этот препринт на arXiv описывает «латентный взлом вознаграждений», при котором оптимизация генератора против фиксированной латентной функции вознаграждения приводит к высоким предсказанным оценкам, но ухудшению визуального и динамического качества, вызванному «уходом» распределения.
- Авторы предлагают CoRe — фреймворк соэволюции, который постоянно дообучает модель вознаграждения на текущих выборках генератора, закрепляя её на предпочтениях реальных видео; в экспериментах на Wan2.1-T2V-1.3B показаны стабильные улучшения качества по сравнению с предобученной моделью и предыдущими методами выравнивания и предотвращается коллапс при оптимизации против фиксированной награды.
- CoRe важен тем, что соэволюция модели вознаграждения с генератором устраняет уход распределения и снижает латентный взлом вознаграждений, улучшая выравнивание и качество генерации видео.
ПОЧЕМУ ЭТО ВАЖНО
CoRe важен тем, что соэволюция модели вознаграждения с генератором устраняет уход распределения и снижает латентный взлом вознаграждений, улучшая выравнивание и качество генерации видео.