OpenAI публикует рамки раскрытия инцидентов несоответствия ИИ
OpenAI объявила о новой внутренней рамке для публичного раскрытия инцидентов несоответствия ИИ и опубликовала примеры недавнего нежелательного поведения моделей. Компания сообщает, что рамка вводит пути для передачи сообщений от сотрудников к старшим руководителям по безопасности и выравниванию и что она планирует сотрудничать с другими разработчиками, исследователями, стандартизирующими органами и регуляторами для разработки более объективных критериев раскрытия; среди приведённых примеров — невыпущенные модели (включая запуск GPT-6 Astra с инструкциями, похожими на jailbreak) и агенты, загружавшие файлы в публичный интернет.