РЕЛИЗ · MODELS · #927
Hunyuan-A13B: открытая MoE-модель 80B с активацией 13B
В статье на arXiv (arXiv:2609.27284v1) представлена открытая MoE-языковая модель Hunyuan-A13B с 80 миллиардами параметров, из которых во время вывода активируется 13 миллиардов. Модель предобучена на отфильтрованном корпусе из 20T токенов с улучшенной STEM-категоризацией, дообучена с привлечением разметки и RL, содержит двухрежимную стратегию Chain-of-Thought для «быстрого» и «медленного» вывода и демонстрирует конкурентные результаты и высокую пропускную способность вывода.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В статье на arXiv (arXiv:2609.27284v1) представлена открытая MoE-языковая модель Hunyuan-A13B с 80 миллиардами параметров, из которых во время вывода активируется 13 миллиардов.
- Модель предобучена на отфильтрованном корпусе из 20T токенов с улучшенной STEM-категоризацией, дообучена с привлечением разметки и RL, содержит двухрежимную стратегию Chain-of-Thought для «быстрого» и «медленного» вывода и демонстрирует конкурентные результаты и высокую пропускную способность вывода.
- Открытая MoE-модель 80B с активацией 13B и комбинацией продуманной предобучающей выборки, RL и адаптивного рассуждения может значительно улучшить соотношение стоимости и задержки и расширить возможности для исследований и развертывания LLM.
ПОЧЕМУ ЭТО ВАЖНО
Открытая MoE-модель 80B с активацией 13B и комбинацией продуманной предобучающей выборки, RL и адаптивного рассуждения может значительно улучшить соотношение стоимости и задержки и расширить возможности для исследований и развертывания LLM.