Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

КОМПАНИЯ · ENTITY #5713

Video-MME

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

1

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

RBS-Attention: адаптивный по радиусу двухветвевой разреженный prefill для LLM с длинным контекстом

Препринт arXiv:2609.20971v1 представляет RBS-Attention — обучение-не требующий метод разреженного prefill с двумя ветвями: базовой на центроиде и «спасающей» на основе радиуса, чтобы избежать «усредняющего разведения» при выборе блоков для attention с длинным контекстом. На H100 заявлены ускорения: до 20.65× для standalone prefill-attention, 11.92× для vLLM prefill-attention и 5.97× ускорение времени до первого токена при 128K на Qwen3-30B-A3B-Instruct-2507-FP8 с сохранением близкой плотной точности (88.65 vs 89.52 по RULER на Qwen3-32B); также использованы наборы LongBench-v2, InfiniteBench и Video-MME.

7.0