НОВОСТЬ · RESEARCH · #358
Blindspot — бенчмарк для калибровки безопасности и отказов в долгих взаимодействиях агента с инструментами (arXiv:2609.16305v1)
Blindspot — новый бенчмарк и расширяемая среда-симулятор для оценки калибровки безопасности и отказов на уровне траекторий у агентов с долгими взаимодействиями и использованием инструментов; текущая версия включает 22 класса атак, 35 сценариев и более 2,500 траекторий (в среднем 14.7 шагов) с пятью типами исходов. Авторы протестировали 13 закрытых и открытых моделей по восьми метрикам и зафиксировали заметные различия в калибровке безопасность–полезность, включая сбои, проявляющиеся только после нескольких первоначально безопасных шагов.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Blindspot — новый бенчмарк и расширяемая среда-симулятор для оценки калибровки безопасности и отказов на уровне траекторий у агентов с долгими взаимодействиями и использованием инструментов; текущая версия включает 22 класса атак, 35 сценариев и более 2,500 траекторий (в среднем 14.7 шагов) с пятью типами исходов.
- Авторы протестировали 13 закрытых и открытых моделей по восьми метрикам и зафиксировали заметные различия в калибровке безопасность–полезность, включая сбои, проявляющиеся только после нескольких первоначально безопасных шагов.
- Это переводит безопасность агента в задачу калибровки на уровне траекторий и даёт стандартизованную расширяемую оценку, которая выявляет многошаговые сбои и компромиссы между полезностью и отказом.
ПОЧЕМУ ЭТО ВАЖНО
Это переводит безопасность агента в задачу калибровки на уровне траекторий и даёт стандартизованную расширяемую оценку, которая выявляет многошаговые сбои и компромиссы между полезностью и отказом.