РЕЛИЗ · MODELS · #1359
Olmo запускает Olmo-core 3 — открытую масштабируемую инфраструктуру обучения MoE
Olmo выпустила Olmo-core 3 — переработанный открытый фреймворк для обучения моделей с mixture-of-experts (MoE), рассчитанный на масштабирование до триллионных параметров при сохранении вычислительной эффективности. Стек переходит от FSDP к DDP, сочетает экспертную и конвейерную параллельность и другие оптимизации; по данным компании, на 47‑млрд MoE на восьми NVIDIA B300 пропускная способность выросла в 2,7×, а MXFP8 в тестах дал примерно +21% к скорости по сравнению с BF16.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Olmo выпустила Olmo-core 3 — переработанный открытый фреймворк для обучения моделей с mixture-of-experts (MoE), рассчитанный на масштабирование до триллионных параметров при сохранении вычислительной эффективности.
- Стек переходит от FSDP к DDP, сочетает экспертную и конвейерную параллельность и другие оптимизации; по данным компании, на 47‑млрд MoE на восьми NVIDIA B300 пропускная способность выросла в 2,7×, а MXFP8 в тестах дал примерно +21% к скорости по сравнению с BF16.
- Открытый и протестированный стек для обучения MoE, который заметно повышает пропускную способность и экономит память, может снизить стоимость и технический порог для обучения очень больших разреженных моделей.
ПОЧЕМУ ЭТО ВАЖНО
Открытый и протестированный стек для обучения MoE, который заметно повышает пропускную способность и экономит память, может снизить стоимость и технический порог для обучения очень больших разреженных моделей.