Tech Meridian ← К ЛЕНТЕ
EN

ИССЛЕДОВАНИЕ · RESEARCH · #603

Обнаружение вредоносных подсказок через скрытые активации LLaMA-3.1-8B

В работе на arXiv 'Safety Beyond the Interface' исследователи извлекают скрытые активации из LLaMA-3.1-8B и обучают лёгкие MLP-пробники (12,6M параметров) для обнаружения вредоносных подсказок. На наборах WildJailbreak, Beavertails и AEGIS 2.0 пробники показывают F1 99%, 83% и 84% соответственно, что, по утверждению авторов, сопоставимо с охранными моделями примерно в 1000 раз больше по размерам при меньшей задержке и вычислительных затратах.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В работе на arXiv 'Safety Beyond the Interface' исследователи извлекают скрытые активации из LLaMA-3.1-8B и обучают лёгкие MLP-пробники (12,6M параметров) для обнаружения вредоносных подсказок.
  2. На наборах WildJailbreak, Beavertails и AEGIS 2.0 пробники показывают F1 99%, 83% и 84% соответственно, что, по утверждению авторов, сопоставимо с охранными моделями примерно в 1000 раз больше по размерам при меньшей задержке и вычислительных затратах.
  3. Если метод окажется надёжным, обнаружение вреда в скрытых состояниях модели позволит проводить более быстрые и дешёвые проверки безопасности и сократит пробел в гарантиях, оставляемый внешними охранными моделями.

ПОЧЕМУ ЭТО ВАЖНО

Если метод окажется надёжным, обнаружение вреда в скрытых состояниях модели позволит проводить более быстрые и дешёвые проверки безопасности и сократит пробел в гарантиях, оставляемый внешними охранными моделями.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1