Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

ТЕМА · ENTITY #5494

multimodal large language models (MLLMs)

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

2

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

DEEPO: оптимизация политики с двойной энтропией для уменьшения галлюцинаций в MLLM

Статья (arXiv:2609.28570v1) предлагает DEEPO — двухэтапное улучшение RL для мультимодальных LLM, которое сочетает префиксы-эксперты, срабатывающие при высокой семантической энтропии, для восстановления дисперсии преимущества, и преобусловливание Реньи по знаку преимущества для борьбы с насыщением логитов. Обе компоненты отдельно превосходят GRPO, а вместе дают статистически значимое улучшение на VideoMMMU (+4.0, 95% CI [1.1, 6.9]); DEEPO снижает галлюцинации без потери точности и стабильности обучения.

6.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

PolyBridgeBench: бенчмарк для MLLM по проектированию мостов с учётом физики

PolyBridgeBench — исполняемый бенчмарк, в котором мультимодальным LLM требуется сгенерировать полную топологию моста (узлы, элементы, материалы) по визуальной сцене и инженерным ограничениям, после чего выполняются детерминированные проверки и динамическая физическая симуляция. Метрики включают детерминированную корректность, динамическую функциональность и восстановление после отказа; тесты шести MLLM на 189 уровнях показывают большой разрыв между формальной корректностью и реальной работоспособностью, высокую чувствительность к бюджетам материалов и ограниченное восстановление после неудач.

6.0