Tech Meridian ← К СУЩНОСТЯМ
EN

КОМПАНИЯ · ENTITY #4816

JSON schema adherence

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

1

RESEARCH · 1 ИСТОЧН. · Apple Machine Learning Research

DACA-GRPO: учет процесса денойзинга улучшает GRPO для диффузионных LLM

Статья представляет DACA-GRPO — лёгкое плагин-улучшение для GRPO-подобного RL в диффузионных языковых моделях, решающее проблему отсутствия временного распределения заслуг и смещения оценки правдоподобия в среднем. Метод вводит Denoising Progress Scores (веса важности для токенов из промежуточных предсказаний) и Stratified Masking Likelihood (разбиение позиций токенов на страты для снижения смещения), демонстрируя стабильные улучшения на семи бенчмарках — до 5.6 п.п. в математике, 7.4 п.п. в генерации кода, 36.3 п.п. в задачах с ограничениями и 5.9 п.п. в соответствии с JSON-схемой.

7.0