CoRe: соэволюция моделей вознаграждения для снижения латентного взлома вознаграждений в видео-диффузионных моделях
Этот препринт на arXiv описывает «латентный взлом вознаграждений», при котором оптимизация генератора против фиксированной латентной функции вознаграждения приводит к высоким предсказанным оценкам, но ухудшению визуального и динамического качества, вызванному «уходом» распределения. Авторы предлагают CoRe — фреймворк соэволюции, который постоянно дообучает модель вознаграждения на текущих выборках генератора, закрепляя её на предпочтениях реальных видео; в экспериментах на Wan2.1-T2V-1.3B показаны стабильные улучшения качества по сравнению с предобученной моделью и предыдущими методами выравнивания и предотвращается коллапс при оптимизации против фиксированной награды.