Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

НОВОСТЬ · MODELS · #1045

Amazon SageMaker HyperPod и Qumulo позволяют обучать модели между регионами без копирования данных

Amazon и Qumulo подтвердили архитектуру, в которой Amazon SageMaker HyperPod в сочетании с Cloud Native Qumulo (CNQ) и Qumulo Cloud Data Fabric (CDF) позволяет кластерам обучаться на едином наборе данных, расположенном в другом регионе AWS, без репликации данных. В тесте между us-east-2 (hub) и us-west-2 (spoke) при запуске LLaMA v3 (1,02 млрд параметров) на двух ml.p5.48xlarge-инстансах на кластер (16 H100 GPU) удалённый кластер после короткого прогрева NeuralCache достиг пропускной способности хаба (≈115–117 образцов/с) и почти полной загрузки GPU.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Amazon и Qumulo подтвердили архитектуру, в которой Amazon SageMaker HyperPod в сочетании с Cloud Native Qumulo (CNQ) и Qumulo Cloud Data Fabric (CDF) позволяет кластерам обучаться на едином наборе данных, расположенном в другом регионе AWS, без репликации данных.
  2. В тесте между us-east-2 (hub) и us-west-2 (spoke) при запуске LLaMA v3 (1,02 млрд параметров) на двух ml.p5.48xlarge-инстансах на кластер (16 H100 GPU) удалённый кластер после короткого прогрева NeuralCache достиг пропускной способности хаба (≈115–117 образцов/с) и почти полной загрузки GPU.
  3. Это снижает необходимость репликации петабайт данных между регионами и позволяет запускать ресурсоёмкое обучение там, где доступен вычислительный кластер, сохраняя пропускную способность и загрузку GPU.

ПОЧЕМУ ЭТО ВАЖНО

Это снижает необходимость репликации петабайт данных между регионами и позволяет запускать ресурсоёмкое обучение там, где доступен вычислительный кластер, сохраняя пропускную способность и загрузку GPU.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1