ГАЙД · COMPANIES · #205
Amazon SageMaker HyperPod добавляет кеширование моделей для сокращения cold start при инференсе
Amazon SageMaker HyperPod теперь поддерживает кеширование моделей для инференса: веса моделей и контейнерные образы можно предварительно загрузить на локальное NVMe‑хранилище узлов кластера, чтобы поды читали их локально, а не скачивали по сети. AWS утверждает, что это сокращает cold start с десятков минут до секунд; в анонсе описано, как это работает и как включить.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Amazon SageMaker HyperPod теперь поддерживает кеширование моделей для инференса: веса моделей и контейнерные образы можно предварительно загрузить на локальное NVMe‑хранилище узлов кластера, чтобы поды читали их локально, а не скачивали по сети.
- AWS утверждает, что это сокращает cold start с десятков минут до секунд; в анонсе описано, как это работает и как включить.
- Кеширование моделей снижает задержки и вариативность cold start при масштабных развертываниях SageMaker, улучшая время отклика и предсказуемость эксплуатации.
ПОЧЕМУ ЭТО ВАЖНО
Кеширование моделей снижает задержки и вариативность cold start при масштабных развертываниях SageMaker, улучшая время отклика и предсказуемость эксплуатации.