Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1122

arXiv:2609.30328v1 — Два безярлычных теста для выявления необоснованности многоагентных судей кода

Статья (arXiv:2609.30328v1) исследует, когда модель‑судья кода действительно обоснована, и предлагает два безярлычных измерения для выявления отсутствия оснований для вердикта. При оценке конвейера MARCH на двух бенчмарках по 80 измерениям система в 78–95% случаев объявляет оба решения равноценными и даёт точность 4,4% (против 43,7%, если ту же модель спрашивать напрямую); применение одного лог‑измерения для отсечки повысило точность с 20,7% до 36,9%, при этом ответы оставались примерно в половине сравнений.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Статья (arXiv:2609.30328v1) исследует, когда модель‑судья кода действительно обоснована, и предлагает два безярлычных измерения для выявления отсутствия оснований для вердикта.
  2. При оценке конвейера MARCH на двух бенчмарках по 80 измерениям система в 78–95% случаев объявляет оба решения равноценными и даёт точность 4,4% (против 43,7%, если ту же модель спрашивать напрямую); применение одного лог‑измерения для отсечки повысило точность с 20,7% до 36,9%, при этом ответы оставались примерно в половине сравнений.
  3. Предлагает практические, безярлычные сигналы для выявления отсутствия доказательной обоснованности у судей на базе LLM и показывает, что отказ от ответа по этим сигналам реально повышает надёжность решений.

ПОЧЕМУ ЭТО ВАЖНО

Предлагает практические, безярлычные сигналы для выявления отсутствия доказательной обоснованности у судей на базе LLM и показывает, что отказ от ответа по этим сигналам реально повышает надёжность решений.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1