ИССЛЕДОВАНИЕ · RESEARCH · #1256
Beyond Symmetric Agents (arXiv:2609.35875v1): выгода MAD объясняется ансамблевой выборкой, а не когнитивным разнообразием
В работе проверяется гипотеза о том, что когнитивное разнообразие объясняет преимущества многoагентных дебатов (MAD), используя 23 небольшие открытые модели, пять задач и более 5,500 запусков по трём осям разнообразия (персоны, температура, идентичность модели). Авторы отвергают гипотезу разнообразия: дебаты могут превосходить одиночную инференцию, но при сопоставимом бюджете они уравниваются или уступают self-consistency sampling; подсказки с персонами обычно снижают точность («штраф персоны»); смешанные команды проигрывают голосованию по собственному составу; и ошибка переполнения окна контекста смещала сравнения — в целом работы интерпретируют выигрыши MAD как эффект ансамблевой выборки и устанавливают бюджетно-проверенный эталон.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В работе проверяется гипотеза о том, что когнитивное разнообразие объясняет преимущества многoагентных дебатов (MAD), используя 23 небольшие открытые модели, пять задач и более 5,500 запусков по трём осям разнообразия (персоны, температура, идентичность модели).
- Авторы отвергают гипотезу разнообразия: дебаты могут превосходить одиночную инференцию, но при сопоставимом бюджете они уравниваются или уступают self-consistency sampling; подсказки с персонами обычно снижают точность («штраф персоны»); смешанные команды проигрывают голосованию по собственному составу; и ошибка переполнения окна контекста смещала сравнения — в целом работы интерпретируют выигрыши MAD как эффект ансамблевой выборки и устанавливают бюджетно-проверенный эталон.
- Это важно, потому что оспаривает предполагаемый механизм улучшений MAD, показывает, что выгоды часто сводятся к эффектам ансамбля или ошибкам реализации, и задаёт более строгий эталон, который должны превзойти будущие методы дебатов.
ПОЧЕМУ ЭТО ВАЖНО
Это важно, потому что оспаривает предполагаемый механизм улучшений MAD, показывает, что выгоды часто сводятся к эффектам ансамбля или ошибкам реализации, и задаёт более строгий эталон, который должны превзойти будущие методы дебатов.