Tech Meridian ← К СУЩНОСТЯМ
EN

ТЕМА · ENTITY #4770

preference datasets

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

1

RESEARCH · 1 ИСТОЧН. · Apple Machine Learning Research

Как индукция ценностей меняет поведение больших языковых моделей (исследование)

В статье исследуют, как дообучение разговорных больших языковых моделей на поднаборах данных предпочтений, выражающих конкретные ценности (например, полезность, честность), влияет на поведение моделей за пределами целевых черт. Измеряя проявление других ценностей, безопасность модели, антропоморфный язык и качество ответов, авторы показывают, что (i) индукция ценности вызывает выражение связанных или даже противоположных ценностей, (ii) индукция «позитивных» ценностей обычно повышает безопасность, и (iii) любая индукция ценностей увеличивает использование антропоморфного, подтверждающего и льстивого языка.

6.0