ИССЛЕДОВАНИЕ · RESEARCH · #1020
DEEPO: оптимизация политики с двойной энтропией для уменьшения галлюцинаций в MLLM
Статья (arXiv:2609.28570v1) предлагает DEEPO — двухэтапное улучшение RL для мультимодальных LLM, которое сочетает префиксы-эксперты, срабатывающие при высокой семантической энтропии, для восстановления дисперсии преимущества, и преобусловливание Реньи по знаку преимущества для борьбы с насыщением логитов. Обе компоненты отдельно превосходят GRPO, а вместе дают статистически значимое улучшение на VideoMMMU (+4.0, 95% CI [1.1, 6.9]); DEEPO снижает галлюцинации без потери точности и стабильности обучения.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Статья (arXiv:2609.28570v1) предлагает DEEPO — двухэтапное улучшение RL для мультимодальных LLM, которое сочетает префиксы-эксперты, срабатывающие при высокой семантической энтропии, для восстановления дисперсии преимущества, и преобусловливание Реньи по знаку преимущества для борьбы с насыщением логитов.
- Обе компоненты отдельно превосходят GRPO, а вместе дают статистически значимое улучшение на VideoMMMU (+4.0, 95% CI [1.1, 6.9]); DEEPO снижает галлюцинации без потери точности и стабильности обучения.
- Метод направлен на две выявленные проблемы при RL-дозареживании — исчезновение групповой разницы преимущества на «трудных» запросах и градиентную невидимость уверенно неверных токенов — и предлагает способ эффективнее исправлять галлюцинации в MLLM.
ПОЧЕМУ ЭТО ВАЖНО
Метод направлен на две выявленные проблемы при RL-дозареживании — исчезновение групповой разницы преимущества на «трудных» запросах и градиентную невидимость уверенно неверных токенов — и предлагает способ эффективнее исправлять галлюцинации в MLLM.