РЕГУЛИРОВАНИЕ · MODELS · #1349
OpenAI остановила кампанию по извлечению рассуждений моделей, но исследователи вновь получили рассуждения через Azure
OpenAI сообщила, что обнаружила и остановила скоординированную кампанию «adversarial distillation», которая пыталась извлечь защищённые цепочки рассуждений моделей, зафиксировав всплеск запросов в июле и заблокировав тысячи аккаунтов к 28 июля. Однако команда исследователя Йоахима Шеффера показала, что те же методы всё ещё позволяли извлечь рассуждения через облачные платформы (в частности Microsoft Azure), включая GPT-6 Astra и ряд моделей Anthropic, пока соответствующие точки доступа не были закрыты в конце сентября.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- OpenAI сообщила, что обнаружила и остановила скоординированную кампанию «adversarial distillation», которая пыталась извлечь защищённые цепочки рассуждений моделей, зафиксировав всплеск запросов в июле и заблокировав тысячи аккаунтов к 28 июля.
- Однако команда исследователя Йоахима Шеффера показала, что те же методы всё ещё позволяли извлечь рассуждения через облачные платформы (в частности Microsoft Azure), включая GPT-6 Astra и ряд моделей Anthropic, пока соответствующие точки доступа не были закрыты в конце сентября.
- Инцидент демонстрирует практический способ вытянуть внутренние рассуждения моделей и подчёркивает, что разная степень защиты у облачных провайдеров может оставлять внутренности моделей уязвимыми.
ПОЧЕМУ ЭТО ВАЖНО
Инцидент демонстрирует практический способ вытянуть внутренние рассуждения моделей и подчёркивает, что разная степень защиты у облачных провайдеров может оставлять внутренности моделей уязвимыми.