НОВОСТЬ · RESEARCH · #368
Calibrate, Then Route: обучение маршрутизатора повышает пропускную способность при разъединённом обслуживании LLM (arXiv:2609.16206v1)
Статья «Calibrate, Then Route» (arXiv:2609.16206v1) исследует обучаемый маршрутизатор для разъединённого обслуживания LLM, который оценивает время завершения на каждом инстансе по длинам промпта/вывода, давлению KV-кэша и классу SLO. В моделировании с последующей валидацией на восьми NVIDIA A40 с vLLM и NIXL маршрутизатор с калибровкой показал наивысшую среднюю пропускную способность (0.864) по трём смешанным трассам по сравнению с 0.835–0.847 у round robin, least-loaded и эвристики по длине, с меньшей дисперсией; калибровка дала основную часть преимущества по хвостовым задержкам и позволила сопоставить пропускную способность round robin при шести вместо семи GPU.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Статья «Calibrate, Then Route» (arXiv:2609.16206v1) исследует обучаемый маршрутизатор для разъединённого обслуживания LLM, который оценивает время завершения на каждом инстансе по длинам промпта/вывода, давлению KV-кэша и классу SLO.
- В моделировании с последующей валидацией на восьми NVIDIA A40 с vLLM и NIXL маршрутизатор с калибровкой показал наивысшую среднюю пропускную способность (0.864) по трём смешанным трассам по сравнению с 0.835–0.847 у round robin, least-loaded и эвристики по длине, с меньшей дисперсией; калибровка дала основную часть преимущества по хвостовым задержкам и позволила сопоставить пропускную способность round robin при шести вместо семи GPU.
- Это важно, потому что калиброванный обучаемый маршрутизатор заметно повышает эффективность обслуживания LLM и сокращает хвостовые задержки, что может снизить потребность в GPU в продакшн-развёртываниях.
ПОЧЕМУ ЭТО ВАЖНО
Это важно, потому что калиброванный обучаемый маршрутизатор заметно повышает эффективность обслуживания LLM и сокращает хвостовые задержки, что может снизить потребность в GPU в продакшн-развёртываниях.