ИССЛЕДОВАНИЕ · RESEARCH · #1122
arXiv:2609.30328v1 — Два безярлычных теста для выявления необоснованности многоагентных судей кода
Статья (arXiv:2609.30328v1) исследует, когда модель‑судья кода действительно обоснована, и предлагает два безярлычных измерения для выявления отсутствия оснований для вердикта. При оценке конвейера MARCH на двух бенчмарках по 80 измерениям система в 78–95% случаев объявляет оба решения равноценными и даёт точность 4,4% (против 43,7%, если ту же модель спрашивать напрямую); применение одного лог‑измерения для отсечки повысило точность с 20,7% до 36,9%, при этом ответы оставались примерно в половине сравнений.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Статья (arXiv:2609.30328v1) исследует, когда модель‑судья кода действительно обоснована, и предлагает два безярлычных измерения для выявления отсутствия оснований для вердикта.
- При оценке конвейера MARCH на двух бенчмарках по 80 измерениям система в 78–95% случаев объявляет оба решения равноценными и даёт точность 4,4% (против 43,7%, если ту же модель спрашивать напрямую); применение одного лог‑измерения для отсечки повысило точность с 20,7% до 36,9%, при этом ответы оставались примерно в половине сравнений.
- Предлагает практические, безярлычные сигналы для выявления отсутствия доказательной обоснованности у судей на базе LLM и показывает, что отказ от ответа по этим сигналам реально повышает надёжность решений.
ПОЧЕМУ ЭТО ВАЖНО
Предлагает практические, безярлычные сигналы для выявления отсутствия доказательной обоснованности у судей на базе LLM и показывает, что отказ от ответа по этим сигналам реально повышает надёжность решений.