Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

КОМПАНИЯ · ENTITY #5702

GSM8K

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

4

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

GoldiMask: выбор контекста и взвешивание целей для донастройки диффузионных языковых моделей

В работе arXiv:2609.38385v1 представлен GoldiMask — метод донастройки дискретных диффузионных языковых моделей, который выбирает раскрываемые токены контекста с помощью приближённой субмодулярной оптимизации и взвешивает оставшиеся целевые токены по их пользе и обучаемости. По трём бэкбонам и трём наборам данных авторы демонстрируют более высокую среднюю точность в большинстве настроек (включая задачи рассуждения и генерации кода) и сокращение числа итераций декодирования на GSM8K и MATH-500 при confidence-threshold параллельном декодировании; абляции показывают вклад обеих компонент.

7.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Нейросимволический маршрутизатор обучает ДКА для маршрутизации запросов на edge-устройствах, повышая точность и энергоэффективность малых моделей

В препринте arXiv:2609.35833v1 предложен нейросимволический маршрутизатор, который классифицирует входящие запросы и направляет их к самому дешёвому корректному решателю; ДКА обучается алгоритмом L* с использованием малой языковой модели в роли membership-оракла. На Raspberry Pi 4B при проверке на 100 новых подсказках из DeepMind Mathematics, GSM8K и RuleTaker обученный маршрутизатор достигает 100% точности маршрутизации и 98.3% общей точности при бюджете 512 токенов (93.3% для задач-словесных задач), опережая Program-of-Thought (72.0%) и агент с вызовом инструментов (58.7%), при этом форматированные запросы обрабатываются за 1–11 мс, а в конфигурации на 30 токенов он работает в 8.8× быстрее и в 2.8× более энергоэффективно, чем Program-of-Thought.

6.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Статья на arXiv: декомпозиция «generate-transform» объясняет, когда масштабирование команд малых LLM помогает

В препринте на arXiv (arXiv:2609.36104v1) протестированы восемь архитектур оркестрации агентов на пяти инструкционно-настроенных моделях 7–9B и нескольких бенчмарках (GSM8K, GSMHard, ARC, GPQA, MMLU и задача с исполняемым кодом) до 30 вызовов. Авторы предлагают точную декомпозицию generate–transform, разделяющую изменение точности на вклад покрытия и преобразования, и показывают, что эффект масштабирования команд зависит от задачи и архитектуры: Proposer-Critic сильно масштабируется и даёт большие выигрыши на арифметике (до +17 пунктов), но не на выборочных тестах, при этом стоимость токенов при одинаковом бюджете различается примерно в 2.1×.

7.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Attention-Aware Routing (AAR) для MoE-моделей (arXiv:2609.20974v1)

В статье предложен Attention-Aware Routing (AAR): роутер MoE дополняется временными и спектральными признаками, получаемыми из скользящего окна весов внимания, при этом базовый трансформер остаётся замороженным, а обучаются только параметры роутинга. На OLMoE AAR даёт +3.37 процентных пункта по GSM8K относительно SFT-базовой модели, показывает, что изменения в роутинге через остаточный поток формируют внимание на следующем слое без прямых правок механизма внимания, сокращает длинные разветвлённые генерации неправильных ответов и демонстрирует сильную чувствительность к глубине слоёв, разделяющую поведение извлечения фактов и рассуждения.

7.0