Cohere представляет hardware-aware Dynamic Speculative Decoding (DSD) для адаптации числа черновых токенов к ограничениям GPU
Cohere описывает Dynamic Speculative Decoding (DSD) — расширение speculative decoding, которое выбирает число черновых токенов K в зависимости от режима аппаратуры (узкое место — пропускная способность памяти или вычисления) и типа модели (плотная или MoE). DSD опирается на офлайн-профилирование Acceptance Length (AL) и Inter-Token Latency (ITL) для подбора оптимального K в разных условиях, чтобы сохранить выигрыш в скорости в продакшене и при масштабных RL-роллаутах.