ИССЛЕДОВАНИЕ · RESEARCH · #603
Обнаружение вредоносных подсказок через скрытые активации LLaMA-3.1-8B
В работе на arXiv 'Safety Beyond the Interface' исследователи извлекают скрытые активации из LLaMA-3.1-8B и обучают лёгкие MLP-пробники (12,6M параметров) для обнаружения вредоносных подсказок. На наборах WildJailbreak, Beavertails и AEGIS 2.0 пробники показывают F1 99%, 83% и 84% соответственно, что, по утверждению авторов, сопоставимо с охранными моделями примерно в 1000 раз больше по размерам при меньшей задержке и вычислительных затратах.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В работе на arXiv 'Safety Beyond the Interface' исследователи извлекают скрытые активации из LLaMA-3.1-8B и обучают лёгкие MLP-пробники (12,6M параметров) для обнаружения вредоносных подсказок.
- На наборах WildJailbreak, Beavertails и AEGIS 2.0 пробники показывают F1 99%, 83% и 84% соответственно, что, по утверждению авторов, сопоставимо с охранными моделями примерно в 1000 раз больше по размерам при меньшей задержке и вычислительных затратах.
- Если метод окажется надёжным, обнаружение вреда в скрытых состояниях модели позволит проводить более быстрые и дешёвые проверки безопасности и сократит пробел в гарантиях, оставляемый внешними охранными моделями.
ПОЧЕМУ ЭТО ВАЖНО
Если метод окажется надёжным, обнаружение вреда в скрытых состояниях модели позволит проводить более быстрые и дешёвые проверки безопасности и сократит пробел в гарантиях, оставляемый внешними охранными моделями.