ИССЛЕДОВАНИЕ · RESEARCH · #1519
Keep It CALM — пределы глобальной небезопасности и локальный контрфактуальный защитник для text-to-image моделей
В препринте на arXiv проанализированы геометрические ограничения использования единого глобального сигнала безопасности (направления «небезопасности» или токсичного подпространства) для text-to-image генерации: компактные подпространства не покрывают разнородные опасные семантики, а широкие удаления искажают безопасные подсказки. Авторы предлагают CALM (Counterfactual Adaptive Local Modulation) — обучение не требующий локальный метод, который с помощью сопоставленных «опасных–безопасных» анкоров минимально правит представления токенов и подавляет оставшиеся опасные компоненты, улучшая подавление небезопасного контента при сохранении полезности безопасных подсказок.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В препринте на arXiv проанализированы геометрические ограничения использования единого глобального сигнала безопасности (направления «небезопасности» или токсичного подпространства) для text-to-image генерации: компактные подпространства не покрывают разнородные опасные семантики, а широкие удаления искажают безопасные подсказки.
- Авторы предлагают CALM (Counterfactual Adaptive Local Modulation) — обучение не требующий локальный метод, который с помощью сопоставленных «опасных–безопасных» анкоров минимально правит представления токенов и подавляет оставшиеся опасные компоненты, улучшая подавление небезопасного контента при сохранении полезности безопасных подсказок.
- Поскольку многие практические механизмы защиты опираются на повторно используемые глобальные сигналы, демонстрация их ограничений и предложение более селективной, не требующей обучения локальной коррекции (CALM) важно для улучшения безопасности и сокращения чрезмерной блокировки в text-to-image системах.
ПОЧЕМУ ЭТО ВАЖНО
Поскольку многие практические механизмы защиты опираются на повторно используемые глобальные сигналы, демонстрация их ограничений и предложение более селективной, не требующей обучения локальной коррекции (CALM) важно для улучшения безопасности и сокращения чрезмерной блокировки в text-to-image системах.