Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

КОМПАНИЯ · ENTITY #5710

Qwen3-32B

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

2

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Decode-Latency Feedback Prefill (DLFP): безмодельный контроллер для размеров prefill

В статье (arXiv:2609.38386v1) предложен Decode-Latency Feedback Prefill (DLFP) — безмодельный контроллер, реализованный в vLLM, который адаптивно изменяет размеры prefill для работы, перекрывающейся с активной генерацией. На Qwen3-0.6B (BF16) на одной NVIDIA A100 80 GB авторы за три пары из 100 запросов сообщили среднее сокращение P99 межтокенной задержки на 27.7% (парный 95% ДИ 21.0%–34.3%) при точном совпадении вывода и без нарушения SLO, но при увеличении P99 времени до первого токена на 34.8%; метод не обобщился на Qwen3-8B, Qwen3-32B или двух GPU в тензорном параллелизме, что авторы связывают с использованием асинхронного интервала планировщика как прокси для времени завершения итерации на GPU.

6.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

RBS-Attention: адаптивный по радиусу двухветвевой разреженный prefill для LLM с длинным контекстом

Препринт arXiv:2609.20971v1 представляет RBS-Attention — обучение-не требующий метод разреженного prefill с двумя ветвями: базовой на центроиде и «спасающей» на основе радиуса, чтобы избежать «усредняющего разведения» при выборе блоков для attention с длинным контекстом. На H100 заявлены ускорения: до 20.65× для standalone prefill-attention, 11.92× для vLLM prefill-attention и 5.97× ускорение времени до первого токена при 128K на Qwen3-30B-A3B-Instruct-2507-FP8 с сохранением близкой плотной точности (88.65 vs 89.52 по RULER на Qwen3-32B); также использованы наборы LongBench-v2, InfiniteBench и Video-MME.

7.0