Keep It CALM — пределы глобальной небезопасности и локальный контрфактуальный защитник для text-to-image моделей
В препринте на arXiv проанализированы геометрические ограничения использования единого глобального сигнала безопасности (направления «небезопасности» или токсичного подпространства) для text-to-image генерации: компактные подпространства не покрывают разнородные опасные семантики, а широкие удаления искажают безопасные подсказки. Авторы предлагают CALM (Counterfactual Adaptive Local Modulation) — обучение не требующий локальный метод, который с помощью сопоставленных «опасных–безопасных» анкоров минимально правит представления токенов и подавляет оставшиеся опасные компоненты, улучшая подавление небезопасного контента при сохранении полезности безопасных подсказок.