ИССЛЕДОВАНИЕ · RESEARCH · #1287
Систематическое исследование выявляет компромисс между эффективностью и плавностью при кондиционировании LLM
Работа систематически оценивает методы кондиционирования LLM для задач внедрения и удаления концептов и показывает, что многие эффективные методы управления заметно ухудшают качество генерации. Авторы отмечают, что activation-steering существенно слабее на инструкционно дообученных моделях по сравнению с базовыми, в то время как подсказки и супервизированная дообучка годятся для внедрения концептов (но хуже для их удаления); дешёвые текстовые метрики хорошо коррелируют с оценками LLM в роли судей. Опубликовано в TMLR (18 сентября 2026 г.).
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Работа систематически оценивает методы кондиционирования LLM для задач внедрения и удаления концептов и показывает, что многие эффективные методы управления заметно ухудшают качество генерации.
- Авторы отмечают, что activation-steering существенно слабее на инструкционно дообученных моделях по сравнению с базовыми, в то время как подсказки и супервизированная дообучка годятся для внедрения концептов (но хуже для их удаления); дешёвые текстовые метрики хорошо коррелируют с оценками LLM в роли судей.
- Опубликовано в TMLR (18 сентября 2026 г.).
ПОЧЕМУ ЭТО ВАЖНО
Важность заключается в том, что методы управления поведением LLM могут существенно снижать качество вывода и по‑разному работать в зависимости от режима обучения, что влияет на безопасность и надёжность при внедрении.