Tech Meridian ← К СУЩНОСТЯМ
EN

КОМПАНИЯ · ENTITY #2453

NVIDIA H100

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

4

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Pareto‑атлас инференса (arXiv:2609.17863v1) картирует компромиссы стоимости, качества и задержки

В статье представлен Pareto‑атлас, который отображает компромиссы между стоимостью, качеством и задержкой инференса LLM: авторы измерили 54 конфигурации Qwen2.5-7B-Instruct на vLLM 0.12 для GPU L4, A100 и H100 и откалибровали симулятор с воспроизведением опорных замеров с дрейфом <1,5%. Основные выводы: на калиброванной сетке 18 из 36 конфигураций попадают на Парето‑фронт; комбинации оптимизаций чаще превосходят одиночные методы; AWQ 4bit снижает задержку до 0,34×, но теряет ~5,9% точности GSM8K; FP8‑веса сохраняют ~99,4% точности при 0,61–0,65× задержки; наивный FP8 KV‑кеш не теряет пропускную способность, но даёт 0/200 правильных ответов; H100 выигрывает при жёсткой задержке, A100 — по пропускной способности и стоимости (~$0.106/млн токенов).

7.0

CODING · 1 ИСТОЧН. · AWS Machine Learning

NVIDIA NVRx добавляет отказоустойчивость в обучение PyTorch FSDP на Amazon EKS

NVIDIA описывает интеграцию расширения Resiliency Extension (NVRx) с PyTorch FSDP на Amazon EKS для уменьшения времени простоя при крупномасштабном обучении на нескольких узлах. В публикации показаны асинхронные контрольные точки (TorchAsyncCheckpoint), перезапуск внутри процесса и средство перезапуска внутри задачи (ft_launcher), приведены бенчмарки на H100 для 2–8 узлов и опубликован воспроизводимый код и пакет nvidia-resiliency-ext для pip.

6.0

MODELS · 1 ИСТОЧН. · Cohere

Cohere выпустила open-source модель распознавания речи "Transcribe Arabic" с претензией на лучшую точность среди открытых моделей

Cohere выпустила Transcribe Arabic — open-source модель автоматического распознавания арабской речи (лицензия Apache 2.0), основанную на их 2‑миллиардной ASR-модели. Компания утверждает, что модель достигает WER 25.87 на Hugging Face Arabic ASR Leaderboard, опережая OmniASR-LLM-7B и Whisper Large V3, и в ~96% человеческих оценок предпочтение отдавали ей перед Whisper; веса доступны на Hugging Face и через Cohere API/Model Vault.

8.0

CODING · 1 ИСТОЧН. · Cohere

Cohere опубликовала megakernel-сервер для North Mini Code с ускорением декодирования на H100

Cohere описывает сервер на основе megakernel для модели North Mini Code (30B), работающий в BF16 на одной NVIDIA H100 и демонстрирующий ускорение 1.25×–1.41× в энд‑ту‑энд сравнении с vLLM; при batch=1 заявлены 292 ток/с (62% от теоретического предела), что примерно в 1.58× быстрее vLLM. Система поддерживает необходимые для продакшна функции (непрерывное батчирование, постраничное внимание, неравные длины), совместима с OpenAI API, реализована в одном CUDA‑файле, код опубликован на GitHub.

7.0