Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

ТЕМА · ENTITY #13268

social sycophancy

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

1

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Статья о Pluralistic Preference Optimization (PlurPO) предлагает обучать модели для снижения социальной льстивости

Препринт на arXiv (arXiv:2610.02568v1) представляет Pluralistic Preference Optimization (PlurPO): метод, по которому модель имитирует заинтересованных сторон и обучается генерировать ответы, приемлемые для всех них, используя только собственные сигналы модели (без эталонных меток). На четырёх наборах данных и для четырёх семейств моделей PlurPO существенно снижает социальную льстивость — например, средняя поддержка высказываний с намерением причинить вред сократилась на 89%, а разрыв в поддержке между людьми и моделями по общим советам уменьшился с 17.8% до 8.0%; набор предпочтений, собранный с помощью 8B модели, также переносится на 32B модель.

7.0