ИССЛЕДОВАНИЕ · RESEARCH · #528
Статья на arXiv представляет бенчмарк SAFE для проверки, запрашивают ли передовые модели данные о безопасности перед действием
В работе (arXiv:2609.17865v1) представлен SAFE — контролируемый бенчмарк, в котором модели решают, запрашивать ли дополнительную информацию о безопасности, меняя её стоимость, вероятность, серьёзность и подачу. При оценке GPT-5.5, o3, Claude Opus 4.8 и Claude Sonnet 4.6 авторы обнаружили разные политики запроса доказательств (Opus почти всегда проверяет, o3 чаще пропускает, GPT-5.5 и Sonnet — промежуточно), сильную зависимость от серьёзности и стоимости доступа, слабую от вероятности, и рассогласование между объяснениями моделей и фактическим поведением.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В работе (arXiv:2609.17865v1) представлен SAFE — контролируемый бенчмарк, в котором модели решают, запрашивать ли дополнительную информацию о безопасности, меняя её стоимость, вероятность, серьёзность и подачу.
- При оценке GPT-5.5, o3, Claude Opus 4.8 и Claude Sonnet 4.6 авторы обнаружили разные политики запроса доказательств (Opus почти всегда проверяет, o3 чаще пропускает, GPT-5.5 и Sonnet — промежуточно), сильную зависимость от серьёзности и стоимости доступа, слабую от вероятности, и рассогласование между объяснениями моделей и фактическим поведением.
- Показывает, что безопасность при развертывании зависит не только от реакции на известные риски, но и от того, запрашивает ли модель доказательства этих рисков, что важно для оценки и мер смягчения последствий.
ПОЧЕМУ ЭТО ВАЖНО
Показывает, что безопасность при развертывании зависит не только от реакции на известные риски, но и от того, запрашивает ли модель доказательства этих рисков, что важно для оценки и мер смягчения последствий.