Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

КОМПАНИЯ · ENTITY #5668

Qwen3.5-0.8B

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

2

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Статья демонстрирует работу RLVR (с GRPO) на Qwen3.5-0.8B без дистилляции

Препринт на arXiv применяет Reinforcement Learning with Verifiable Rewards (RLVR) с Group Relative Policy Optimization (GRPO) и инструментом поиска в Wikipedia для тренировки Qwen3.5-0.8B на MuSiQue и наборе из семи QA-бенчмарков. Лучший запуск показал 0.352 в среднем по exact-match (против 0.092 у нетренированной модели), рост в 3.8× без дистилляции; авторы отмечают, что форма вознаграждения важна — разреженное exact-match-вознаграждение оказывается худшим для этой шкалы модели.

6.0

MODELS · 1 ИСТОЧН. · arXiv cs.AI

TinyCeNN-LM: рамка качественно-гейтированной конверсии для замены внимания на слои, вдохновлённые CeNN

В препринте arXiv:2609.21139v1 представлен TinyCeNN-LM — рамка посттренировочной конверсии с качественным контролем, заменяющая слои внимания на клеточно-рекуррентные модули, вдохновлённые CeNN, с ограниченной локальной обработкой, компактной рекуррентной памятью, маршрутизацией/слиянием и валидацией «принять-или-откатить». Авторы изучают три реализации (Integrated Memory, MemoryFusion, PDelta3-GDN2-CLVR+Local32): на SmolLM2-135M слои 0–2 приняты с суммарным ΔNLL=+0.01209, слой 3 отвергнут из-за плохой сохранности представлений; на Qwen3.5-0.8B слои 3, 7 и 11 приняты с итоговым ΔNLL=+0.02073; Integrated Memory держит перплексию в пределах −0.07%…+0.93% и сокращает общий кэш до 6.01%, контроль из 200 задач на преобразованных релизах Qwen показал 28.5%–32.0% точности.

6.0