Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

РЕЛИЗ · MODELS · #1359

Olmo запускает Olmo-core 3 — открытую масштабируемую инфраструктуру обучения MoE

Olmo выпустила Olmo-core 3 — переработанный открытый фреймворк для обучения моделей с mixture-of-experts (MoE), рассчитанный на масштабирование до триллионных параметров при сохранении вычислительной эффективности. Стек переходит от FSDP к DDP, сочетает экспертную и конвейерную параллельность и другие оптимизации; по данным компании, на 47‑млрд MoE на восьми NVIDIA B300 пропускная способность выросла в 2,7×, а MXFP8 в тестах дал примерно +21% к скорости по сравнению с BF16.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Olmo выпустила Olmo-core 3 — переработанный открытый фреймворк для обучения моделей с mixture-of-experts (MoE), рассчитанный на масштабирование до триллионных параметров при сохранении вычислительной эффективности.
  2. Стек переходит от FSDP к DDP, сочетает экспертную и конвейерную параллельность и другие оптимизации; по данным компании, на 47‑млрд MoE на восьми NVIDIA B300 пропускная способность выросла в 2,7×, а MXFP8 в тестах дал примерно +21% к скорости по сравнению с BF16.
  3. Открытый и протестированный стек для обучения MoE, который заметно повышает пропускную способность и экономит память, может снизить стоимость и технический порог для обучения очень больших разреженных моделей.

ПОЧЕМУ ЭТО ВАЖНО

Открытый и протестированный стек для обучения MoE, который заметно повышает пропускную способность и экономит память, может снизить стоимость и технический порог для обучения очень больших разреженных моделей.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1