Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1258

Разделение покрытия и специализации в LLM‑харнесах (arXiv:2609.35873v1)

Статья представляет контролируемую оценку, разделяющую покрытие ответов, повторяемые преимущества на задачах и предварительный выбор исполнения для сгенерированных LLM‑харнесов. На 386 задачах MATH-500 сравнение восьми сгенерированных харнесов с базовой конфигурацией из девяти идентичных копий показывает, что повторение одинаковых программ обеспечивает 2.16 процентных пункта «оракульного» запаса; сгенерированные программы демонстрируют повторяемые паттерны, которые в основном выявляют постоянные слабости, а не полезные постоянные выигрыши, «замороженный селектор» дает прирост 0.00 п.п., обе популяции достигают 98.70% оракульного покрытия при 27 запусках харнесов; трассировки BIRD указывают на ошибки в реализации механизмов, активации и валидности вывода, из‑чего авторы делают вывод, что покрытие и повторяемость сами по себе не подтверждают полезную специализацию и предлагают более строгие критерии оценки разнообразия харнесов.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Статья представляет контролируемую оценку, разделяющую покрытие ответов, повторяемые преимущества на задачах и предварительный выбор исполнения для сгенерированных LLM‑харнесов.
  2. На 386 задачах MATH-500 сравнение восьми сгенерированных харнесов с базовой конфигурацией из девяти идентичных копий показывает, что повторение одинаковых программ обеспечивает 2.16 процентных пункта «оракульного» запаса; сгенерированные программы демонстрируют повторяемые паттерны, которые в основном выявляют постоянные слабости, а не полезные постоянные выигрыши, «замороженный селектор» дает прирост 0.00 п.п., обе популяции достигают 98.70% оракульного покрытия при 27 запусках харнесов; трассировки BIRD указывают на ошибки в реализации механизмов, активации и валидности вывода, из‑чего авторы делают вывод, что покрытие и повторяемость сами по себе не подтверждают полезную специализацию и предлагают более строгие критерии оценки разнообразия харнесов.
  3. Это важно, поскольку ставит под сомнение утверждения о том, что автоматически сгенерированные харнесы дают реальную специализацию задач, и предлагает стандарт оценки, требующий устойчивых и практически применимых преимуществ при сопоставимых бюджетах вывода.

ПОЧЕМУ ЭТО ВАЖНО

Это важно, поскольку ставит под сомнение утверждения о том, что автоматически сгенерированные харнесы дают реальную специализацию задач, и предлагает стандарт оценки, требующий устойчивых и практически применимых преимуществ при сопоставимых бюджетах вывода.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1