Tech Meridian ← К ЛЕНТЕ
EN

НОВОСТЬ · RESEARCH · #420

Cohere представляет hardware-aware Dynamic Speculative Decoding (DSD) для адаптации числа черновых токенов к ограничениям GPU

Cohere описывает Dynamic Speculative Decoding (DSD) — расширение speculative decoding, которое выбирает число черновых токенов K в зависимости от режима аппаратуры (узкое место — пропускная способность памяти или вычисления) и типа модели (плотная или MoE). DSD опирается на офлайн-профилирование Acceptance Length (AL) и Inter-Token Latency (ITL) для подбора оптимального K в разных условиях, чтобы сохранить выигрыш в скорости в продакшене и при масштабных RL-роллаутах.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Cohere описывает Dynamic Speculative Decoding (DSD) — расширение speculative decoding, которое выбирает число черновых токенов K в зависимости от режима аппаратуры (узкое место — пропускная способность памяти или вычисления) и типа модели (плотная или MoE).
  2. DSD опирается на офлайн-профилирование Acceptance Length (AL) и Inter-Token Latency (ITL) для подбора оптимального K в разных условиях, чтобы сохранить выигрыш в скорости в продакшене и при масштабных RL-роллаутах.
  3. Это важно, потому что DSD делает speculative decoding применимым при меняющихся размерах батчей и для MoE‑архитектур, повышая загрузку GPU и сохраняя ускорение инференса в продакшене и при RL-роллаутах.

ПОЧЕМУ ЭТО ВАЖНО

Это важно, потому что DSD делает speculative decoding применимым при меняющихся размерах батчей и для MoE‑архитектур, повышая загрузку GPU и сохраняя ускорение инференса в продакшене и при RL-роллаутах.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1