DACA-GRPO: учет процесса денойзинга улучшает GRPO для диффузионных LLM
Статья представляет DACA-GRPO — лёгкое плагин-улучшение для GRPO-подобного RL в диффузионных языковых моделях, решающее проблему отсутствия временного распределения заслуг и смещения оценки правдоподобия в среднем. Метод вводит Denoising Progress Scores (веса важности для токенов из промежуточных предсказаний) и Stratified Masking Likelihood (разбиение позиций токенов на страты для снижения смещения), демонстрируя стабильные улучшения на семи бенчмарках — до 5.6 п.п. в математике, 7.4 п.п. в генерации кода, 36.3 п.п. в задачах с ограничениями и 5.9 п.п. в соответствии с JSON-схемой.
Почему это важно: Благодаря пошаговому распределению заслуг и снижению смещения оценок правдоподобия DACA-GRPO улучшает RL-оптимизацию для диффузионных LLM и даёт заметный рост на задачах рассуждения и генерации с ограничениями.
ОТКРЫТЬ СОБЫТИЕ →