Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

НОВОСТЬ · CODING · #964

Эффективная тренировка MoE для биологических foundation-моделей с NVIDIA Transformer Engine и MXFP8

NVIDIA опубликовала рецепт обучения MoE BioNeMo, который использует примитивы Transformer Engine — GroupedLinear, MXFP8 (блочно масштабируемый 8‑битный формат) и объединённый GroupedMLP‑ядро (ForwardGroupedMLP_CuTeGEMMSwiGLU_MXFP8) — для сокращения накладных расходов на запуск кернелов, уменьшения объёма активаций и ускорения обучения MoE. В бенчмарке на восьми GPU (NVIDIA B200) рецепт показал до 2.21× пропускной способности по сравнению с базовой реализацией Hugging Face; объединённое MXFP8‑ядро требует аппаратуры Blackwell.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. NVIDIA опубликовала рецепт обучения MoE BioNeMo, который использует примитивы Transformer Engine — GroupedLinear, MXFP8 (блочно масштабируемый 8‑битный формат) и объединённый GroupedMLP‑ядро (ForwardGroupedMLP_CuTeGEMMSwiGLU_MXFP8) — для сокращения накладных расходов на запуск кернелов, уменьшения объёма активаций и ускорения обучения MoE.
  2. В бенчмарке на восьми GPU (NVIDIA B200) рецепт показал до 2.21× пропускной способности по сравнению с базовой реализацией Hugging Face; объединённое MXFP8‑ядро требует аппаратуры Blackwell.
  3. Объединённые кернелы для экспертных вычислений и блочно масштабируемая 8‑битная арифметика значительно повышают эффективность GPU и экономию памяти, что позволяет тренировать более крупные MoE‑модели для биоинформатики на поддерживаемом оборудовании NVIDIA.

ПОЧЕМУ ЭТО ВАЖНО

Объединённые кернелы для экспертных вычислений и блочно масштабируемая 8‑битная арифметика значительно повышают эффективность GPU и экономию памяти, что позволяет тренировать более крупные MoE‑модели для биоинформатики на поддерживаемом оборудовании NVIDIA.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1