Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

КОМПАНИЯ · ENTITY #10937

MATH-500

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

3

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Статья Mixture-of-Agents измеряет «достатимый вычислительный объём» на токен и демонстрирует выгоды маршрутизации/черновки

В arXiv:2610.02491v1 предложена методика Mixture-of-Agents (MoA) для измерения верхней границы «достатимого вычислительного объёма» на токен: панель из 15 моделей разного размера пытается воспроизвести эталонный токен, и 0.5B-модель воспроизводит 92–95% токенов, тогда как самые дорогие 10% токенов требуют оценочно 64–80% FLOP. На основе карты MoA маршрутизация и черновка (drafting) снижают проецируемую задержку (например, с 7.59 до 5.12 с на MATH-500) и уменьшают число черновых токенов и проецируемую задержку по сравнению с фиксированными базовыми методами, что указывает на запас для более эффективного распределения вычислений.

7.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

GoldiMask: выбор контекста и взвешивание целей для донастройки диффузионных языковых моделей

В работе arXiv:2609.38385v1 представлен GoldiMask — метод донастройки дискретных диффузионных языковых моделей, который выбирает раскрываемые токены контекста с помощью приближённой субмодулярной оптимизации и взвешивает оставшиеся целевые токены по их пользе и обучаемости. По трём бэкбонам и трём наборам данных авторы демонстрируют более высокую среднюю точность в большинстве настроек (включая задачи рассуждения и генерации кода) и сокращение числа итераций декодирования на GSM8K и MATH-500 при confidence-threshold параллельном декодировании; абляции показывают вклад обеих компонент.

7.0

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Разделение покрытия и специализации в LLM‑харнесах (arXiv:2609.35873v1)

Статья представляет контролируемую оценку, разделяющую покрытие ответов, повторяемые преимущества на задачах и предварительный выбор исполнения для сгенерированных LLM‑харнесов. На 386 задачах MATH-500 сравнение восьми сгенерированных харнесов с базовой конфигурацией из девяти идентичных копий показывает, что повторение одинаковых программ обеспечивает 2.16 процентных пункта «оракульного» запаса; сгенерированные программы демонстрируют повторяемые паттерны, которые в основном выявляют постоянные слабости, а не полезные постоянные выигрыши, «замороженный селектор» дает прирост 0.00 п.п., обе популяции достигают 98.70% оракульного покрытия при 27 запусках харнесов; трассировки BIRD указывают на ошибки в реализации механизмов, активации и валидности вывода, из‑чего авторы делают вывод, что покрытие и повторяемость сами по себе не подтверждают полезную специализацию и предлагают более строгие критерии оценки разнообразия харнесов.

5.0