Tech Meridian ← К СУЩНОСТЯМ
EN

КОМПАНИЯ · ENTITY #1730

BF16

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

3

MODELS · 1 ИСТОЧН. · Cohere

Cohere выпустила open-source модель распознавания речи "Transcribe Arabic" с претензией на лучшую точность среди открытых моделей

Cohere выпустила Transcribe Arabic — open-source модель автоматического распознавания арабской речи (лицензия Apache 2.0), основанную на их 2‑миллиардной ASR-модели. Компания утверждает, что модель достигает WER 25.87 на Hugging Face Arabic ASR Leaderboard, опережая OmniASR-LLM-7B и Whisper Large V3, и в ~96% человеческих оценок предпочтение отдавали ей перед Whisper; веса доступны на Hugging Face и через Cohere API/Model Vault.

8.0

CODING · 1 ИСТОЧН. · Cohere

Cohere опубликовала megakernel-сервер для North Mini Code с ускорением декодирования на H100

Cohere описывает сервер на основе megakernel для модели North Mini Code (30B), работающий в BF16 на одной NVIDIA H100 и демонстрирующий ускорение 1.25×–1.41× в энд‑ту‑энд сравнении с vLLM; при batch=1 заявлены 292 ток/с (62% от теоретического предела), что примерно в 1.58× быстрее vLLM. Система поддерживает необходимые для продакшна функции (непрерывное батчирование, постраничное внимание, неравные длины), совместима с OpenAI API, реализована в одном CUDA‑файле, код опубликован на GitHub.

7.0

RESEARCH · 1 ИСТОЧН. · Google Research

Google Research описывает программные оптимизации смешанных входных матричных умножений для NVIDIA Ampere (CUTLASS)

В блоге Google Research (автор — Маниш Гупта) описаны программные приёмы для реализации смешанных входных матричных умножений (например, входы F16 × веса U8) на тензорных ядрах NVIDIA Ampere через преобразование типов данных и согласование макета; решения опубликованы в репозитории NVIDIA/CUTLASS и, по заявлению авторов, добавляют минимальные накладные расходы и близки к пиковой аппаратной производительности. Работа ориентирована на ресурсоёмкие LLM‑нагрузки и поддерживает схемы квантования только весов для уменьшения объёма памяти модели.

7.0