НОВОСТЬ · MODELS · #163
ZGCM-1: открытая 7B фундаментальная модель с высокой эффективностью и контекстом 256K для математики и агентного поиска
В публикации на arXiv (arXiv:2609.13356v1) представлен ZGCM-1 — полностью открытая плотная модель на 7 млрд параметров, обученная с упором на эффективность данных, систем и алгоритмов и работу с длинным контекстом (до 256K). Авторы утверждают, что ZGCM-1-7B сопоставима с гораздо большими моделями по общим бенчмаркам и по задачам математического рассуждения и агентного поиска, заявляют ≈4.2× ускорение до потери при предобучении на 16K, описывают рецепт обучения (включая чередующееся скользящее окно/полное внимание и FP8 Muon optimizer) и публикуют веса, контрольные точки, код, рецепты данных и логи W&B.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В публикации на arXiv (arXiv:2609.13356v1) представлен ZGCM-1 — полностью открытая плотная модель на 7 млрд параметров, обученная с упором на эффективность данных, систем и алгоритмов и работу с длинным контекстом (до 256K).
- Авторы утверждают, что ZGCM-1-7B сопоставима с гораздо большими моделями по общим бенчмаркам и по задачам математического рассуждения и агентного поиска, заявляют ≈4.2× ускорение до потери при предобучении на 16K, описывают рецепт обучения (включая чередующееся скользящее окно/полное внимание и FP8 Muon optimizer) и публикуют веса, контрольные точки, код, рецепты данных и логи W&B.
- Если утверждения подтвердятся, открытая модель на 7 млрд параметров, сопоставимая с куда более крупными моделями по задачам математики и агентного поиска при меньших вычислениях и поддержке длинного контекста, может существенно снизить барьеры для исследований и повлиять на дизайн эффективных моделей и агентных систем.
ПОЧЕМУ ЭТО ВАЖНО
Если утверждения подтвердятся, открытая модель на 7 млрд параметров, сопоставимая с куда более крупными моделями по задачам математики и агентного поиска при меньших вычислениях и поддержке длинного контекста, может существенно снизить барьеры для исследований и повлиять на дизайн эффективных моделей и агентных систем.