Tech Meridian ← К СУЩНОСТЯМ
EN

ТЕМА · ENTITY #835

vLLM

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

5

COMPANIES · 1 ИСТОЧН. · NVIDIA Developer

NVIDIA представляет AIPerf — мультипроцессный инструмент для бенчмаркинга LLM

NVIDIA AIPerf заменяет GenAI-Perf полностью переработанной мультипроцессной архитектурой, чтобы исключить узкие места на стороне клиента при нагрузочном тестировании инференса LLM. Инструмент поддерживает более 15 типов endpoint, публичные наборы данных и форматы воспроизведения трейсoв (ShareGPT, Mooncake, Baseten, WEKA/AgentX), настраиваемые шаблоны загрузки и выводит метрики TTFT, ITL, перцентильные задержки и телеметрию GPU при наличии DCGM или pynvml.

6.0

CODING · 1 ИСТОЧН. · AWS Machine Learning

Hugging Face выпустила шесть open‑source Skills для развёртывания моделей в Amazon SageMaker AI через coding‑агентов

Hugging Face опубликовала шесть open‑source «Skills» (на GitHub), позволяющих coding‑агентам полностью автоматизировать развёртывание моделей Hugging Face в Amazon SageMaker AI. Skills помогают выбрать корректный образ из AWS Deep Learning Containers, создать real‑time или serverless endpoint с автоскейлингом и оповещениями CloudWatch, обеспечивают проверяемый путь удаления ресурсов и работают через Python и AWS CLI, предотвращая дорогостоящие или нестабильные ошибки агентов.

6.0

CODING · 1 ИСТОЧН. · Cohere

Cohere опубликовала megakernel-сервер для North Mini Code с ускорением декодирования на H100

Cohere описывает сервер на основе megakernel для модели North Mini Code (30B), работающий в BF16 на одной NVIDIA H100 и демонстрирующий ускорение 1.25×–1.41× в энд‑ту‑энд сравнении с vLLM; при batch=1 заявлены 292 ток/с (62% от теоретического предела), что примерно в 1.58× быстрее vLLM. Система поддерживает необходимые для продакшна функции (непрерывное батчирование, постраничное внимание, неравные длины), совместима с OpenAI API, реализована в одном CUDA‑файле, код опубликован на GitHub.

7.0

MODELS · 1 ИСТОЧН. · AWS Machine Learning

Развёртывание Qwen3.8-2.4T-A95B на Amazon SageMaker HyperPod с vLLM

AWS Machine Learning опубликовал пошаговую инструкцию по развёртыванию Qwen3.8-2.4T-A95B — открытой модели с 2,4 триллионами параметров — на Amazon SageMaker HyperPod с использованием vLLM. Руководство описывает подготовку кластера, NVFP4-квантизацию и создание совместимого с OpenAI эндпоинта с встроенным рассуждением, вызовом инструментов и нативным MTP speculative decoding.

7.0

MODELS · 1 ИСТОЧН. · Mistral AI

Mistral выпускает Small 4: 119B MoE мультимодальная модель с контекстом 256k (Apache 2.0)

Mistral объявила Mistral Small 4 — гибридную модель Mixture-of-Experts на 119 миллиардов параметров (128 экспертов, 4 активных), поддерживающую текст и изображения, с окном контекста 256k и настраиваемым параметром reasoning_effort; модель выпущена под лицензией Apache 2.0. Компания указывает, что Small 4 объединяет возможности Magistral, Pixtral и Devstral, нацелена на чаты, кодинг/агентов и сложное рассуждение, утверждает значительные улучшения задержки и пропускной способности по сравнению с Small 3 и доступна через vLLM, llama.cpp, SGLang, Transformers и другие среды.

9.0