Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

ТЕМА · ENTITY #13357

model routing

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

1

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Статья Mixture-of-Agents измеряет «достатимый вычислительный объём» на токен и демонстрирует выгоды маршрутизации/черновки

В arXiv:2610.02491v1 предложена методика Mixture-of-Agents (MoA) для измерения верхней границы «достатимого вычислительного объёма» на токен: панель из 15 моделей разного размера пытается воспроизвести эталонный токен, и 0.5B-модель воспроизводит 92–95% токенов, тогда как самые дорогие 10% токенов требуют оценочно 64–80% FLOP. На основе карты MoA маршрутизация и черновка (drafting) снижают проецируемую задержку (например, с 7.59 до 5.12 с на MATH-500) и уменьшают число черновых токенов и проецируемую задержку по сравнению с фиксированными базовыми методами, что указывает на запас для более эффективного распределения вычислений.

7.0