Tech Meridian ← К СУЩНОСТЯМ
EN

КОМПАНИЯ · ENTITY #837

OpenAI-compatible endpoint

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

3

COMPANIES · 1 ИСТОЧН. · AWS Machine Learning

Amazon SageMaker запускает HyperPod Inference Gateway для маршрутизации LLM с учётом GPU

Amazon представила HyperPod Inference Gateway для SageMaker — Kubernetes-нативный аддон для EKS, который использует реальные показатели GPU (использование KV-кэша, глубина очереди, наличие LoRA и т.д.) для маршрутизации OpenAI-совместимых запросов, снижая задержку первого токена и простои GPU без изменений в приложениях. Система имеет двухуровневую архитектуру с локальным интеллектуальным роутингом и координацией между кластерами и интегрируется через единый ресурс InferenceGatewayConfig с метриками в Prometheus/CloudWatch.

7.0

CODING · 1 ИСТОЧН. · Cohere

Cohere опубликовала megakernel-сервер для North Mini Code с ускорением декодирования на H100

Cohere описывает сервер на основе megakernel для модели North Mini Code (30B), работающий в BF16 на одной NVIDIA H100 и демонстрирующий ускорение 1.25×–1.41× в энд‑ту‑энд сравнении с vLLM; при batch=1 заявлены 292 ток/с (62% от теоретического предела), что примерно в 1.58× быстрее vLLM. Система поддерживает необходимые для продакшна функции (непрерывное батчирование, постраничное внимание, неравные длины), совместима с OpenAI API, реализована в одном CUDA‑файле, код опубликован на GitHub.

7.0

MODELS · 1 ИСТОЧН. · AWS Machine Learning

Развёртывание Qwen3.8-2.4T-A95B на Amazon SageMaker HyperPod с vLLM

AWS Machine Learning опубликовал пошаговую инструкцию по развёртыванию Qwen3.8-2.4T-A95B — открытой модели с 2,4 триллионами параметров — на Amazon SageMaker HyperPod с использованием vLLM. Руководство описывает подготовку кластера, NVFP4-квантизацию и создание совместимого с OpenAI эндпоинта с встроенным рассуждением, вызовом инструментов и нативным MTP speculative decoding.

7.0