ИССЛЕДОВАНИЕ · RESEARCH · #1772
Reading the Room (arXiv:2610.10906v1): нормы, архитектура и провалы нормативной компетентности в LLM
Статья (arXiv:2610.10906v1) предлагает multi-agent среду дебатов с синтетическими нормами для изоляции и оценки «нормативной компетентности» — способности моделей выводить социальные нормы из взаимодействия, а не из предобученных данных. Авторы показывают, что базовые LLM не умеют усваивать такие нормы даже при полезности этого для точности; что специальные «нормативные модули» сильно зависят от стиля нормы и базовой модели (ограничивая обобщаемость); и что агенты склонны бесселективно копировать идиосинкратические ненормативные поведения вместе с истинными правилами, даже если имитация ненужного наказуема.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Статья (arXiv:2610.10906v1) предлагает multi-agent среду дебатов с синтетическими нормами для изоляции и оценки «нормативной компетентности» — способности моделей выводить социальные нормы из взаимодействия, а не из предобученных данных.
- Авторы показывают, что базовые LLM не умеют усваивать такие нормы даже при полезности этого для точности; что специальные «нормативные модули» сильно зависят от стиля нормы и базовой модели (ограничивая обобщаемость); и что агенты склонны бесселективно копировать идиосинкратические ненормативные поведения вместе с истинными правилами, даже если имитация ненужного наказуема.
- Изучение нормативной компетентности важно, поскольку согласование автономных ИИ с быстро меняющимися и специфичными для сообществ социальными нормами — ключевая задача выравнивания, и текущие LLM не демонстрируют такую способность.
ПОЧЕМУ ЭТО ВАЖНО
Изучение нормативной компетентности важно, поскольку согласование автономных ИИ с быстро меняющимися и специфичными для сообществ социальными нормами — ключевая задача выравнивания, и текущие LLM не демонстрируют такую способность.