Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

РЕЛИЗ · MODELS · #927

Hunyuan-A13B: открытая MoE-модель 80B с активацией 13B

В статье на arXiv (arXiv:2609.27284v1) представлена открытая MoE-языковая модель Hunyuan-A13B с 80 миллиардами параметров, из которых во время вывода активируется 13 миллиардов. Модель предобучена на отфильтрованном корпусе из 20T токенов с улучшенной STEM-категоризацией, дообучена с привлечением разметки и RL, содержит двухрежимную стратегию Chain-of-Thought для «быстрого» и «медленного» вывода и демонстрирует конкурентные результаты и высокую пропускную способность вывода.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В статье на arXiv (arXiv:2609.27284v1) представлена открытая MoE-языковая модель Hunyuan-A13B с 80 миллиардами параметров, из которых во время вывода активируется 13 миллиардов.
  2. Модель предобучена на отфильтрованном корпусе из 20T токенов с улучшенной STEM-категоризацией, дообучена с привлечением разметки и RL, содержит двухрежимную стратегию Chain-of-Thought для «быстрого» и «медленного» вывода и демонстрирует конкурентные результаты и высокую пропускную способность вывода.
  3. Открытая MoE-модель 80B с активацией 13B и комбинацией продуманной предобучающей выборки, RL и адаптивного рассуждения может значительно улучшить соотношение стоимости и задержки и расширить возможности для исследований и развертывания LLM.

ПОЧЕМУ ЭТО ВАЖНО

Открытая MoE-модель 80B с активацией 13B и комбинацией продуманной предобучающей выборки, RL и адаптивного рассуждения может значительно улучшить соотношение стоимости и задержки и расширить возможности для исследований и развертывания LLM.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1