НОВОСТЬ · CODING · #407
Cohere опубликовала megakernel-сервер для North Mini Code с ускорением декодирования на H100
Cohere описывает сервер на основе megakernel для модели North Mini Code (30B), работающий в BF16 на одной NVIDIA H100 и демонстрирующий ускорение 1.25×–1.41× в энд‑ту‑энд сравнении с vLLM; при batch=1 заявлены 292 ток/с (62% от теоретического предела), что примерно в 1.58× быстрее vLLM. Система поддерживает необходимые для продакшна функции (непрерывное батчирование, постраничное внимание, неравные длины), совместима с OpenAI API, реализована в одном CUDA‑файле, код опубликован на GitHub.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Cohere описывает сервер на основе megakernel для модели North Mini Code (30B), работающий в BF16 на одной NVIDIA H100 и демонстрирующий ускорение 1.25×–1.41× в энд‑ту‑энд сравнении с vLLM; при batch=1 заявлены 292 ток/с (62% от теоретического предела), что примерно в 1.58× быстрее vLLM.
- Система поддерживает необходимые для продакшна функции (непрерывное батчирование, постраничное внимание, неравные длины), совместима с OpenAI API, реализована в одном CUDA‑файле, код опубликован на GitHub.
- Показывает, что megakernel для декодирования можно довести до продакшна, заметно повысив пропускную способность LLM при малых батчах на H100 и ближе приблизиться к пределам пропускной способности HBM.
ПОЧЕМУ ЭТО ВАЖНО
Показывает, что megakernel для декодирования можно довести до продакшна, заметно повысив пропускную способность LLM при малых батчах на H100 и ближе приблизиться к пределам пропускной способности HBM.