Разделение покрытия и специализации в LLM‑харнесах (arXiv:2609.35873v1)
Статья представляет контролируемую оценку, разделяющую покрытие ответов, повторяемые преимущества на задачах и предварительный выбор исполнения для сгенерированных LLM‑харнесов. На 386 задачах MATH-500 сравнение восьми сгенерированных харнесов с базовой конфигурацией из девяти идентичных копий показывает, что повторение одинаковых программ обеспечивает 2.16 процентных пункта «оракульного» запаса; сгенерированные программы демонстрируют повторяемые паттерны, которые в основном выявляют постоянные слабости, а не полезные постоянные выигрыши, «замороженный селектор» дает прирост 0.00 п.п., обе популяции достигают 98.70% оракульного покрытия при 27 запусках харнесов; трассировки BIRD указывают на ошибки в реализации механизмов, активации и валидности вывода, из‑чего авторы делают вывод, что покрытие и повторяемость сами по себе не подтверждают полезную специализацию и предлагают более строгие критерии оценки разнообразия харнесов.