РЕЛИЗ · CODING · #903
NVIDIA открывает исходники NVCRE — контроллера Kubernetes для проверки готовности GPU-кластеров
NVIDIA Cluster Readiness Engine (NVCRE) — это открытый контроллер Kubernetes, который запускает реальные распределённые рабочие нагрузки по топологически учётным группам узлов, чтобы подтверждать готовность GPU-кластеров перед запуском продакшн AI-задач. Он предоставляет CRD Certification/Workflow/Job, адаптивную изоляцию сбоев для точного определения проблемных узлов, API WorkloadRun для настройки многонодовых GPU-запусков, интегрируется с NVIDIA AI Cluster Runtime и NVSentinel (часть NVIDIA DSX OS), устанавливается через nvcrectl и поддерживает расширение через GitHub.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- NVIDIA Cluster Readiness Engine (NVCRE) — это открытый контроллер Kubernetes, который запускает реальные распределённые рабочие нагрузки по топологически учётным группам узлов, чтобы подтверждать готовность GPU-кластеров перед запуском продакшн AI-задач.
- Он предоставляет CRD Certification/Workflow/Job, адаптивную изоляцию сбоев для точного определения проблемных узлов, API WorkloadRun для настройки многонодовых GPU-запусков, интегрируется с NVIDIA AI Cluster Runtime и NVSentinel (часть NVIDIA DSX OS), устанавливается через nvcrectl и поддерживает расширение через GitHub.
- Запуск реальных распределённых рабочих нагрузок для проверки кластера помогает выявить медленные GPU, деградацию сети или ошибки конфигурации до отказа дорогих обучений и сокращает время операторов на поиск причин.
ПОЧЕМУ ЭТО ВАЖНО
Запуск реальных распределённых рабочих нагрузок для проверки кластера помогает выявить медленные GPU, деградацию сети или ошибки конфигурации до отказа дорогих обучений и сокращает время операторов на поиск причин.