НОВОСТЬ · RESEARCH · #420
Cohere представляет hardware-aware Dynamic Speculative Decoding (DSD) для адаптации числа черновых токенов к ограничениям GPU
Cohere описывает Dynamic Speculative Decoding (DSD) — расширение speculative decoding, которое выбирает число черновых токенов K в зависимости от режима аппаратуры (узкое место — пропускная способность памяти или вычисления) и типа модели (плотная или MoE). DSD опирается на офлайн-профилирование Acceptance Length (AL) и Inter-Token Latency (ITL) для подбора оптимального K в разных условиях, чтобы сохранить выигрыш в скорости в продакшене и при масштабных RL-роллаутах.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Cohere описывает Dynamic Speculative Decoding (DSD) — расширение speculative decoding, которое выбирает число черновых токенов K в зависимости от режима аппаратуры (узкое место — пропускная способность памяти или вычисления) и типа модели (плотная или MoE).
- DSD опирается на офлайн-профилирование Acceptance Length (AL) и Inter-Token Latency (ITL) для подбора оптимального K в разных условиях, чтобы сохранить выигрыш в скорости в продакшене и при масштабных RL-роллаутах.
- Это важно, потому что DSD делает speculative decoding применимым при меняющихся размерах батчей и для MoE‑архитектур, повышая загрузку GPU и сохраняя ускорение инференса в продакшене и при RL-роллаутах.
ПОЧЕМУ ЭТО ВАЖНО
Это важно, потому что DSD делает speculative decoding применимым при меняющихся размерах батчей и для MoE‑архитектур, повышая загрузку GPU и сохраняя ускорение инференса в продакшене и при RL-роллаутах.