РЕЛИЗ · COMPANIES · #624
Amazon SageMaker запускает HyperPod Inference Gateway для маршрутизации LLM с учётом GPU
Amazon представила HyperPod Inference Gateway для SageMaker — Kubernetes-нативный аддон для EKS, который использует реальные показатели GPU (использование KV-кэша, глубина очереди, наличие LoRA и т.д.) для маршрутизации OpenAI-совместимых запросов, снижая задержку первого токена и простои GPU без изменений в приложениях. Система имеет двухуровневую архитектуру с локальным интеллектуальным роутингом и координацией между кластерами и интегрируется через единый ресурс InferenceGatewayConfig с метриками в Prometheus/CloudWatch.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Amazon представила HyperPod Inference Gateway для SageMaker — Kubernetes-нативный аддон для EKS, который использует реальные показатели GPU (использование KV-кэша, глубина очереди, наличие LoRA и т.д.) для маршрутизации OpenAI-совместимых запросов, снижая задержку первого токена и простои GPU без изменений в приложениях.
- Система имеет двухуровневую архитектуру с локальным интеллектуальным роутингом и координацией между кластерами и интегрируется через единый ресурс InferenceGatewayConfig с метриками в Prometheus/CloudWatch.
- Это изменяет развёртывания LLM: вместо «слепого» балансировщика используется маршрутизация с учётом состояния GPU, что может сократить задержки первого токена и повысить загрузку GPU без правок кода.
ПОЧЕМУ ЭТО ВАЖНО
Это изменяет развёртывания LLM: вместо «слепого» балансировщика используется маршрутизация с учётом состояния GPU, что может сократить задержки первого токена и повысить загрузку GPU без правок кода.
ИСТОЧНИКИ И ХРОНОЛОГИЯ
1Eliminate GPU waste. Reduce first-token latency by up to 82%. Install one Kubernetes-native addon with zero application changes. Running large language models (LLMs) at scale on GPU clusters is expensive. The default Kubernetes load balancers are making it worse. Round-robin and least-connections algorithms have no visibility into what’s happening inside your GPUs: which pods have saturated KV caches, which are mid-…
Generative AI inference is uniquely hard: models are tens to hundreds of gigabytes, latency requirements are measured in tokens per second, cold starts can span multiple minutes as containers and weights transfer, GPU capacity is constrained, and traditional monitoring tools expose none of the token-level signals that matter in production. Amazon SageMaker AI offers customers the ability to deploy AI models and cons…