Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #729

RBS-Attention: адаптивный по радиусу двухветвевой разреженный prefill для LLM с длинным контекстом

Препринт arXiv:2609.20971v1 представляет RBS-Attention — обучение-не требующий метод разреженного prefill с двумя ветвями: базовой на центроиде и «спасающей» на основе радиуса, чтобы избежать «усредняющего разведения» при выборе блоков для attention с длинным контекстом. На H100 заявлены ускорения: до 20.65× для standalone prefill-attention, 11.92× для vLLM prefill-attention и 5.97× ускорение времени до первого токена при 128K на Qwen3-30B-A3B-Instruct-2507-FP8 с сохранением близкой плотной точности (88.65 vs 89.52 по RULER на Qwen3-32B); также использованы наборы LongBench-v2, InfiniteBench и Video-MME.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Препринт arXiv:2609.20971v1 представляет RBS-Attention — обучение-не требующий метод разреженного prefill с двумя ветвями: базовой на центроиде и «спасающей» на основе радиуса, чтобы избежать «усредняющего разведения» при выборе блоков для attention с длинным контекстом.
  2. На H100 заявлены ускорения: до 20.65× для standalone prefill-attention, 11.92× для vLLM prefill-attention и 5.97× ускорение времени до первого токена при 128K на Qwen3-30B-A3B-Instruct-2507-FP8 с сохранением близкой плотной точности (88.65 vs 89.52 по RULER на Qwen3-32B); также использованы наборы LongBench-v2, InfiniteBench и Video-MME.
  3. Быстрый метод разреженного prefill без обучения, сохраняющий релевантные токены, может существенно сократить дорогой этап плотного prefill при инференсе с длинным контекстом, позволяя поддерживать большие контексты или снижать задержку.

ПОЧЕМУ ЭТО ВАЖНО

Быстрый метод разреженного prefill без обучения, сохраняющий релевантные токены, может существенно сократить дорогой этап плотного prefill при инференсе с длинным контекстом, позволяя поддерживать большие контексты или снижать задержку.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1