Статья на arXiv: декомпозиция «generate-transform» объясняет, когда масштабирование команд малых LLM помогает
В препринте на arXiv (arXiv:2609.36104v1) протестированы восемь архитектур оркестрации агентов на пяти инструкционно-настроенных моделях 7–9B и нескольких бенчмарках (GSM8K, GSMHard, ARC, GPQA, MMLU и задача с исполняемым кодом) до 30 вызовов. Авторы предлагают точную декомпозицию generate–transform, разделяющую изменение точности на вклад покрытия и преобразования, и показывают, что эффект масштабирования команд зависит от задачи и архитектуры: Proposer-Critic сильно масштабируется и даёт большие выигрыши на арифметике (до +17 пунктов), но не на выборочных тестах, при этом стоимость токенов при одинаковом бюджете различается примерно в 2.1×.