Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

КОМПАНИЯ · ENTITY #8605

Renyi preconditioning

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

1

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

DEEPO: оптимизация политики с двойной энтропией для уменьшения галлюцинаций в MLLM

Статья (arXiv:2609.28570v1) предлагает DEEPO — двухэтапное улучшение RL для мультимодальных LLM, которое сочетает префиксы-эксперты, срабатывающие при высокой семантической энтропии, для восстановления дисперсии преимущества, и преобусловливание Реньи по знаку преимущества для борьбы с насыщением логитов. Обе компоненты отдельно превосходят GRPO, а вместе дают статистически значимое улучшение на VideoMMMU (+4.0, 95% CI [1.1, 6.9]); DEEPO снижает галлюцинации без потери точности и стабильности обучения.

6.0