Tech Meridian ← К ЛЕНТЕ
EN

РЕЛИЗ · COMPANIES · #624

Amazon SageMaker запускает HyperPod Inference Gateway для маршрутизации LLM с учётом GPU

Amazon представила HyperPod Inference Gateway для SageMaker — Kubernetes-нативный аддон для EKS, который использует реальные показатели GPU (использование KV-кэша, глубина очереди, наличие LoRA и т.д.) для маршрутизации OpenAI-совместимых запросов, снижая задержку первого токена и простои GPU без изменений в приложениях. Система имеет двухуровневую архитектуру с локальным интеллектуальным роутингом и координацией между кластерами и интегрируется через единый ресурс InferenceGatewayConfig с метриками в Prometheus/CloudWatch.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Amazon представила HyperPod Inference Gateway для SageMaker — Kubernetes-нативный аддон для EKS, который использует реальные показатели GPU (использование KV-кэша, глубина очереди, наличие LoRA и т.д.) для маршрутизации OpenAI-совместимых запросов, снижая задержку первого токена и простои GPU без изменений в приложениях.
  2. Система имеет двухуровневую архитектуру с локальным интеллектуальным роутингом и координацией между кластерами и интегрируется через единый ресурс InferenceGatewayConfig с метриками в Prometheus/CloudWatch.
  3. Это изменяет развёртывания LLM: вместо «слепого» балансировщика используется маршрутизация с учётом состояния GPU, что может сократить задержки первого токена и повысить загрузку GPU без правок кода.

ПОЧЕМУ ЭТО ВАЖНО

Это изменяет развёртывания LLM: вместо «слепого» балансировщика используется маршрутизация с учётом состояния GPU, что может сократить задержки первого токена и повысить загрузку GPU без правок кода.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1