Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #944

TwinCheck: проверка во время инференса с контрфактическими «негативными близнецами» (arXiv:2609.26911v1)

TwinCheck — это политика верификации во время инференса, которая строит привязанный к трейсy контрфактический «негативный близнец» и заменяет предложенный агентом вызов инструмента только если близнец проходит структурные проверки и парный верификатор предпочитает его в обоих порядках. При парном оценивании с точным воспроизведением на 159 многоходовых задачах BFCL V4 полная политика повысила долю успешных задач для GPT-5.6 Sol с 45,3% до 58,5% (95% task-bootstrap ДИ [8,2, 18,8]) без зафиксированных регрессий успех→неуспех.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. TwinCheck — это политика верификации во время инференса, которая строит привязанный к трейсy контрфактический «негативный близнец» и заменяет предложенный агентом вызов инструмента только если близнец проходит структурные проверки и парный верификатор предпочитает его в обоих порядках.
  2. При парном оценивании с точным воспроизведением на 159 многоходовых задачах BFCL V4 полная политика повысила долю успешных задач для GPT-5.6 Sol с 45,3% до 58,5% (95% task-bootstrap ДИ [8,2, 18,8]) без зафиксированных регрессий успех→неуспех.
  3. Статья переосмысливает исправление на границе выполнения как ограниченное контрфактическое сравнение и демонстрирует измеримое улучшение без регрессий для агентa с инструментами, что даёт практичный механизм верификации для развертываемых агентов.

ПОЧЕМУ ЭТО ВАЖНО

Статья переосмысливает исправление на границе выполнения как ограниченное контрфактическое сравнение и демонстрирует измеримое улучшение без регрессий для агентa с инструментами, что даёт практичный механизм верификации для развертываемых агентов.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1