Tech Meridian ← К ЛЕНТЕ
EN

НОВОСТЬ · RESEARCH · #368

Calibrate, Then Route: обучение маршрутизатора повышает пропускную способность при разъединённом обслуживании LLM (arXiv:2609.16206v1)

Статья «Calibrate, Then Route» (arXiv:2609.16206v1) исследует обучаемый маршрутизатор для разъединённого обслуживания LLM, который оценивает время завершения на каждом инстансе по длинам промпта/вывода, давлению KV-кэша и классу SLO. В моделировании с последующей валидацией на восьми NVIDIA A40 с vLLM и NIXL маршрутизатор с калибровкой показал наивысшую среднюю пропускную способность (0.864) по трём смешанным трассам по сравнению с 0.835–0.847 у round robin, least-loaded и эвристики по длине, с меньшей дисперсией; калибровка дала основную часть преимущества по хвостовым задержкам и позволила сопоставить пропускную способность round robin при шести вместо семи GPU.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Статья «Calibrate, Then Route» (arXiv:2609.16206v1) исследует обучаемый маршрутизатор для разъединённого обслуживания LLM, который оценивает время завершения на каждом инстансе по длинам промпта/вывода, давлению KV-кэша и классу SLO.
  2. В моделировании с последующей валидацией на восьми NVIDIA A40 с vLLM и NIXL маршрутизатор с калибровкой показал наивысшую среднюю пропускную способность (0.864) по трём смешанным трассам по сравнению с 0.835–0.847 у round robin, least-loaded и эвристики по длине, с меньшей дисперсией; калибровка дала основную часть преимущества по хвостовым задержкам и позволила сопоставить пропускную способность round robin при шести вместо семи GPU.
  3. Это важно, потому что калиброванный обучаемый маршрутизатор заметно повышает эффективность обслуживания LLM и сокращает хвостовые задержки, что может снизить потребность в GPU в продакшн-развёртываниях.

ПОЧЕМУ ЭТО ВАЖНО

Это важно, потому что калиброванный обучаемый маршрутизатор заметно повышает эффективность обслуживания LLM и сокращает хвостовые задержки, что может снизить потребность в GPU в продакшн-развёртываниях.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1