ИССЛЕДОВАНИЕ · RESEARCH · #1019
TWIST: предложение бенчмарка для оценки качества вмешательств в память диалога (arXiv v1)
TWIST — предложенный набор тестов (arXiv:2609.28575v1) для оценки качества вмешательств в память при длительных диалогах — то есть способности системы правильно вмешиваться в точки изменения убеждений — по четырём трекам (обнаружение напряжения, проверка черновиков, ответы с сохранением истории замещений и управление чувствительным воспоминанием). Авторы публикуют человеко-валидированный ключ Track B v1.0 (161 элемент, пост-аджудикации каппа = 0.85) и показывают компромисс у базовых систем между полнотой обнаружения против ложных вмешательств (flat-RAG обнаруживает 0.76–0.97 истинных противоречий, но помечает как опасные 16–43% безопасных черновиков; развернутая система, ориентированная на когерентность, имеет специфичность 0.98–1.00 и ловит 42% противоречий), предлагая TWIST как дополнение к метрикам полноты.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- TWIST — предложенный набор тестов (arXiv:2609.28575v1) для оценки качества вмешательств в память при длительных диалогах — то есть способности системы правильно вмешиваться в точки изменения убеждений — по четырём трекам (обнаружение напряжения, проверка черновиков, ответы с сохранением истории замещений и управление чувствительным воспоминанием).
- Авторы публикуют человеко-валидированный ключ Track B v1.0 (161 элемент, пост-аджудикации каппа = 0.85) и показывают компромисс у базовых систем между полнотой обнаружения против ложных вмешательств (flat-RAG обнаруживает 0.76–0.97 истинных противоречий, но помечает как опасные 16–43% безопасных черновиков; развернутая система, ориентированная на когерентность, имеет специфичность 0.98–1.00 и ловит 42% противоречий), предлагая TWIST как дополнение к метрикам полноты.
- TWIST важен потому, что оценивает способность систем памяти понимать, когда следует вмешаться и когда нет — аспект, который простые метрики полноты не покрывают и который влияет на безопасность и доверие к диалоговым агентам.
ПОЧЕМУ ЭТО ВАЖНО
TWIST важен потому, что оценивает способность систем памяти понимать, когда следует вмешаться и когда нет — аспект, который простые метрики полноты не покрывают и который влияет на безопасность и доверие к диалоговым агентам.