Обнаружение вредоносных подсказок через скрытые активации LLaMA-3.1-8B
В работе на arXiv 'Safety Beyond the Interface' исследователи извлекают скрытые активации из LLaMA-3.1-8B и обучают лёгкие MLP-пробники (12,6M параметров) для обнаружения вредоносных подсказок. На наборах WildJailbreak, Beavertails и AEGIS 2.0 пробники показывают F1 99%, 83% и 84% соответственно, что, по утверждению авторов, сопоставимо с охранными моделями примерно в 1000 раз больше по размерам при меньшей задержке и вычислительных затратах.