ИССЛЕДОВАНИЕ · RESEARCH · #1507
Статья Mixture-of-Agents измеряет «достатимый вычислительный объём» на токен и демонстрирует выгоды маршрутизации/черновки
В arXiv:2610.02491v1 предложена методика Mixture-of-Agents (MoA) для измерения верхней границы «достатимого вычислительного объёма» на токен: панель из 15 моделей разного размера пытается воспроизвести эталонный токен, и 0.5B-модель воспроизводит 92–95% токенов, тогда как самые дорогие 10% токенов требуют оценочно 64–80% FLOP. На основе карты MoA маршрутизация и черновка (drafting) снижают проецируемую задержку (например, с 7.59 до 5.12 с на MATH-500) и уменьшают число черновых токенов и проецируемую задержку по сравнению с фиксированными базовыми методами, что указывает на запас для более эффективного распределения вычислений.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В arXiv:2610.02491v1 предложена методика Mixture-of-Agents (MoA) для измерения верхней границы «достатимого вычислительного объёма» на токен: панель из 15 моделей разного размера пытается воспроизвести эталонный токен, и 0.5B-модель воспроизводит 92–95% токенов, тогда как самые дорогие 10% токенов требуют оценочно 64–80% FLOP.
- На основе карты MoA маршрутизация и черновка (drafting) снижают проецируемую задержку (например, с 7.59 до 5.12 с на MATH-500) и уменьшают число черновых токенов и проецируемую задержку по сравнению с фиксированными базовыми методами, что указывает на запас для более эффективного распределения вычислений.
- Это первое практическое измерение верхней границы вычисле‑ний на токен и эмпирическое подтверждение, что большая часть стоимости инференса сосредоточена в небольшом числе токенов, что позволяет эффективнее использовать маршрутизацию/черновку и мотивирует контроллеры, учитывающие неоднородность вычислений по токенам.
ПОЧЕМУ ЭТО ВАЖНО
Это первое практическое измерение верхней границы вычисле‑ний на токен и эмпирическое подтверждение, что большая часть стоимости инференса сосредоточена в небольшом числе токенов, что позволяет эффективнее использовать маршрутизацию/черновку и мотивирует контроллеры, учитывающие неоднородность вычислений по токенам.