Tech Meridian ← К СУЩНОСТЯМ
EN

ТЕМА · ENTITY #4355

arXiv:2609.19472v1

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

1

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Обнаружение вредоносных подсказок через скрытые активации LLaMA-3.1-8B

В работе на arXiv 'Safety Beyond the Interface' исследователи извлекают скрытые активации из LLaMA-3.1-8B и обучают лёгкие MLP-пробники (12,6M параметров) для обнаружения вредоносных подсказок. На наборах WildJailbreak, Beavertails и AEGIS 2.0 пробники показывают F1 99%, 83% и 84% соответственно, что, по утверждению авторов, сопоставимо с охранными моделями примерно в 1000 раз больше по размерам при меньшей задержке и вычислительных затратах.

7.0