Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

КОМПАНИЯ · ENTITY #5707

H100 GPUs

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

2

MODELS · 1 ИСТОЧН. · AWS Machine Learning

Amazon SageMaker HyperPod и Qumulo позволяют обучать модели между регионами без копирования данных

Amazon и Qumulo подтвердили архитектуру, в которой Amazon SageMaker HyperPod в сочетании с Cloud Native Qumulo (CNQ) и Qumulo Cloud Data Fabric (CDF) позволяет кластерам обучаться на едином наборе данных, расположенном в другом регионе AWS, без репликации данных. В тесте между us-east-2 (hub) и us-west-2 (spoke) при запуске LLaMA v3 (1,02 млрд параметров) на двух ml.p5.48xlarge-инстансах на кластер (16 H100 GPU) удалённый кластер после короткого прогрева NeuralCache достиг пропускной способности хаба (≈115–117 образцов/с) и почти полной загрузки GPU.

7.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

RBS-Attention: адаптивный по радиусу двухветвевой разреженный prefill для LLM с длинным контекстом

Препринт arXiv:2609.20971v1 представляет RBS-Attention — обучение-не требующий метод разреженного prefill с двумя ветвями: базовой на центроиде и «спасающей» на основе радиуса, чтобы избежать «усредняющего разведения» при выборе блоков для attention с длинным контекстом. На H100 заявлены ускорения: до 20.65× для standalone prefill-attention, 11.92× для vLLM prefill-attention и 5.97× ускорение времени до первого токена при 128K на Qwen3-30B-A3B-Instruct-2507-FP8 с сохранением близкой плотной точности (88.65 vs 89.52 по RULER на Qwen3-32B); также использованы наборы LongBench-v2, InfiniteBench и Video-MME.

7.0