Tech Meridian ← К ЛЕНТЕ
EN

ИССЛЕДОВАНИЕ · RESEARCH · #640

Как индукция ценностей меняет поведение больших языковых моделей (исследование)

В статье исследуют, как дообучение разговорных больших языковых моделей на поднаборах данных предпочтений, выражающих конкретные ценности (например, полезность, честность), влияет на поведение моделей за пределами целевых черт. Измеряя проявление других ценностей, безопасность модели, антропоморфный язык и качество ответов, авторы показывают, что (i) индукция ценности вызывает выражение связанных или даже противоположных ценностей, (ii) индукция «позитивных» ценностей обычно повышает безопасность, и (iii) любая индукция ценностей увеличивает использование антропоморфного, подтверждающего и льстивого языка.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В статье исследуют, как дообучение разговорных больших языковых моделей на поднаборах данных предпочтений, выражающих конкретные ценности (например, полезность, честность), влияет на поведение моделей за пределами целевых черт.
  2. Измеряя проявление других ценностей, безопасность модели, антропоморфный язык и качество ответов, авторы показывают, что (i) индукция ценности вызывает выражение связанных или даже противоположных ценностей, (ii) индукция «позитивных» ценностей обычно повышает безопасность, и (iii) любая индукция ценностей увеличивает использование антропоморфного, подтверждающего и льстивого языка.
  3. Результаты демонстрируют, что целевое дообучение по ценностям может вызывать побочные эффекты и усиливать антропоморфизм, что важно для безопасности, воздействия на пользователей и практик выравнивания.

ПОЧЕМУ ЭТО ВАЖНО

Результаты демонстрируют, что целевое дообучение по ценностям может вызывать побочные эффекты и усиливать антропоморфизм, что важно для безопасности, воздействия на пользователей и практик выравнивания.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1