Tech Meridian ← К ЛЕНТЕ
EN

НОВОСТЬ · CODING · #407

Cohere опубликовала megakernel-сервер для North Mini Code с ускорением декодирования на H100

Cohere описывает сервер на основе megakernel для модели North Mini Code (30B), работающий в BF16 на одной NVIDIA H100 и демонстрирующий ускорение 1.25×–1.41× в энд‑ту‑энд сравнении с vLLM; при batch=1 заявлены 292 ток/с (62% от теоретического предела), что примерно в 1.58× быстрее vLLM. Система поддерживает необходимые для продакшна функции (непрерывное батчирование, постраничное внимание, неравные длины), совместима с OpenAI API, реализована в одном CUDA‑файле, код опубликован на GitHub.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Cohere описывает сервер на основе megakernel для модели North Mini Code (30B), работающий в BF16 на одной NVIDIA H100 и демонстрирующий ускорение 1.25×–1.41× в энд‑ту‑энд сравнении с vLLM; при batch=1 заявлены 292 ток/с (62% от теоретического предела), что примерно в 1.58× быстрее vLLM.
  2. Система поддерживает необходимые для продакшна функции (непрерывное батчирование, постраничное внимание, неравные длины), совместима с OpenAI API, реализована в одном CUDA‑файле, код опубликован на GitHub.
  3. Показывает, что megakernel для декодирования можно довести до продакшна, заметно повысив пропускную способность LLM при малых батчах на H100 и ближе приблизиться к пределам пропускной способности HBM.

ПОЧЕМУ ЭТО ВАЖНО

Показывает, что megakernel для декодирования можно довести до продакшна, заметно повысив пропускную способность LLM при малых батчах на H100 и ближе приблизиться к пределам пропускной способности HBM.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1