DEEPO: оптимизация политики с двойной энтропией для уменьшения галлюцинаций в MLLM
Статья (arXiv:2609.28570v1) предлагает DEEPO — двухэтапное улучшение RL для мультимодальных LLM, которое сочетает префиксы-эксперты, срабатывающие при высокой семантической энтропии, для восстановления дисперсии преимущества, и преобусловливание Реньи по знаку преимущества для борьбы с насыщением логитов. Обе компоненты отдельно превосходят GRPO, а вместе дают статистически значимое улучшение на VideoMMMU (+4.0, 95% CI [1.1, 6.9]); DEEPO снижает галлюцинации без потери точности и стабильности обучения.