Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1020

DEEPO: оптимизация политики с двойной энтропией для уменьшения галлюцинаций в MLLM

Статья (arXiv:2609.28570v1) предлагает DEEPO — двухэтапное улучшение RL для мультимодальных LLM, которое сочетает префиксы-эксперты, срабатывающие при высокой семантической энтропии, для восстановления дисперсии преимущества, и преобусловливание Реньи по знаку преимущества для борьбы с насыщением логитов. Обе компоненты отдельно превосходят GRPO, а вместе дают статистически значимое улучшение на VideoMMMU (+4.0, 95% CI [1.1, 6.9]); DEEPO снижает галлюцинации без потери точности и стабильности обучения.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Статья (arXiv:2609.28570v1) предлагает DEEPO — двухэтапное улучшение RL для мультимодальных LLM, которое сочетает префиксы-эксперты, срабатывающие при высокой семантической энтропии, для восстановления дисперсии преимущества, и преобусловливание Реньи по знаку преимущества для борьбы с насыщением логитов.
  2. Обе компоненты отдельно превосходят GRPO, а вместе дают статистически значимое улучшение на VideoMMMU (+4.0, 95% CI [1.1, 6.9]); DEEPO снижает галлюцинации без потери точности и стабильности обучения.
  3. Метод направлен на две выявленные проблемы при RL-дозареживании — исчезновение групповой разницы преимущества на «трудных» запросах и градиентную невидимость уверенно неверных токенов — и предлагает способ эффективнее исправлять галлюцинации в MLLM.

ПОЧЕМУ ЭТО ВАЖНО

Метод направлен на две выявленные проблемы при RL-дозареживании — исчезновение групповой разницы преимущества на «трудных» запросах и градиентную невидимость уверенно неверных токенов — и предлагает способ эффективнее исправлять галлюцинации в MLLM.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1