Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1418

Исследование: рационалы в основном влияют на суждения верификатора, а не на точность ответов

Авторы предлагают diagnostic «message-intervention», фиксирующий доказательства и кандидата на ответ и меняющий только рационал, передаваемый от рассуждающего модуля к верификатору. На 400 примерах из MuSiQue, HotpotQA и 2WikiMultiHopQA с DeepSeek в роли генератора и верификатора авторы показывают, что правдивые рационалы почти не повышают точность ответов по сравнению с отсутствием рационала, тогда как искажённые рационалы значительно меняют оценки поддержки (10–22% при «слепом» промпте, 34–55% при явной проверке рационала), а финальные ответы меняются значительно реже (2–30%); аудиты людей показывают случаи чрезмерного доверия модели.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Авторы предлагают diagnostic «message-intervention», фиксирующий доказательства и кандидата на ответ и меняющий только рационал, передаваемый от рассуждающего модуля к верификатору.
  2. На 400 примерах из MuSiQue, HotpotQA и 2WikiMultiHopQA с DeepSeek в роли генератора и верификатора авторы показывают, что правдивые рационалы почти не повышают точность ответов по сравнению с отсутствием рационала, тогда как искажённые рационалы значительно меняют оценки поддержки (10–22% при «слепом» промпте, 34–55% при явной проверке рационала), а финальные ответы меняются значительно реже (2–30%); аудиты людей показывают случаи чрезмерного доверия модели.
  3. Это важно, потому что переводит фокус на рационалы как механизм передачи сообщения верификатору, который может создавать новые сценарии отказа (чрезмерное доверие, искажение поддержки) и влиять на оценку и проектирование конвейеров QA.

ПОЧЕМУ ЭТО ВАЖНО

Это важно, потому что переводит фокус на рационалы как механизм передачи сообщения верификатору, который может создавать новые сценарии отказа (чрезмерное доверие, искажение поддержки) и влиять на оценку и проектирование конвейеров QA.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1