НОВОСТЬ · RESEARCH · #349
Есть ли у крупных языковых моделей ценности? PEC‑фреймворк и адаптивный рецепт выравнивания (arXiv:2609.16589v1)
В этой статье на arXiv ответы 106 LLM и 95 000 анкет людей проецируются в общее социологическое пространство; авторы обнаруживают, что модели формируют сконцентрированное, идеализированное ядро ценностей, а не отражают человеческое разнообразие. Предложен фреймворк Prior-Environment-Cognition (PEC) для количественной оценки выражения ценностей и адаптивный «рецепт выравнивания», который выбирает минимально необходимые вмешательства (от подсказок до обновлений параметров) для более эффективного управления ценностями модели без ухудшения её возможностей.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В этой статье на arXiv ответы 106 LLM и 95 000 анкет людей проецируются в общее социологическое пространство; авторы обнаруживают, что модели формируют сконцентрированное, идеализированное ядро ценностей, а не отражают человеческое разнообразие.
- Предложен фреймворк Prior-Environment-Cognition (PEC) для количественной оценки выражения ценностей и адаптивный «рецепт выравнивания», который выбирает минимально необходимые вмешательства (от подсказок до обновлений параметров) для более эффективного управления ценностями модели без ухудшения её возможностей.
- Это важно, потому что эмпирически показывает существование согласованных, не полностью человеческих структур ценностей в LLM и предоставляет количественный PEC‑модель и практичный, менее затратный метод управления этими ценностями — шаг вперёд для задач выравнивания ИИ.
ПОЧЕМУ ЭТО ВАЖНО
Это важно, потому что эмпирически показывает существование согласованных, не полностью человеческих структур ценностей в LLM и предоставляет количественный PEC‑модель и практичный, менее затратный метод управления этими ценностями — шаг вперёд для задач выравнивания ИИ.