Эффективная тренировка MoE для биологических foundation-моделей с NVIDIA Transformer Engine и MXFP8
NVIDIA опубликовала рецепт обучения MoE BioNeMo, который использует примитивы Transformer Engine — GroupedLinear, MXFP8 (блочно масштабируемый 8‑битный формат) и объединённый GroupedMLP‑ядро (ForwardGroupedMLP_CuTeGEMMSwiGLU_MXFP8) — для сокращения накладных расходов на запуск кернелов, уменьшения объёма активаций и ускорения обучения MoE. В бенчмарке на восьми GPU (NVIDIA B200) рецепт показал до 2.21× пропускной способности по сравнению с базовой реализацией Hugging Face; объединённое MXFP8‑ядро требует аппаратуры Blackwell.