Tech Meridian ← К ЛЕНТЕ
EN

НОВОСТЬ · RESEARCH · #358

Blindspot — бенчмарк для калибровки безопасности и отказов в долгих взаимодействиях агента с инструментами (arXiv:2609.16305v1)

Blindspot — новый бенчмарк и расширяемая среда-симулятор для оценки калибровки безопасности и отказов на уровне траекторий у агентов с долгими взаимодействиями и использованием инструментов; текущая версия включает 22 класса атак, 35 сценариев и более 2,500 траекторий (в среднем 14.7 шагов) с пятью типами исходов. Авторы протестировали 13 закрытых и открытых моделей по восьми метрикам и зафиксировали заметные различия в калибровке безопасность–полезность, включая сбои, проявляющиеся только после нескольких первоначально безопасных шагов.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Blindspot — новый бенчмарк и расширяемая среда-симулятор для оценки калибровки безопасности и отказов на уровне траекторий у агентов с долгими взаимодействиями и использованием инструментов; текущая версия включает 22 класса атак, 35 сценариев и более 2,500 траекторий (в среднем 14.7 шагов) с пятью типами исходов.
  2. Авторы протестировали 13 закрытых и открытых моделей по восьми метрикам и зафиксировали заметные различия в калибровке безопасность–полезность, включая сбои, проявляющиеся только после нескольких первоначально безопасных шагов.
  3. Это переводит безопасность агента в задачу калибровки на уровне траекторий и даёт стандартизованную расширяемую оценку, которая выявляет многошаговые сбои и компромиссы между полезностью и отказом.

ПОЧЕМУ ЭТО ВАЖНО

Это переводит безопасность агента в задачу калибровки на уровне траекторий и даёт стандартизованную расширяемую оценку, которая выявляет многошаговые сбои и компромиссы между полезностью и отказом.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1