Tech Meridian ← К СУЩНОСТЯМ
EN

ТЕМА · ENTITY #390

assistant apologies

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

1

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

Аудит 777 тыс. диалогов показывает, как и в каких случаях пользователи оскорбляют разговорные модели

Авторы проаудитировали 777 тыс. английских диалогов из LMSYS-Chat-1M двумя детекторами — лексиконом из восьми категорий для враждебности, направленной на ассистента, и сигналом модерации датасета — и показали, что они фиксируют разные, слабо пересекающиеся явления. Лексикон выделяет оскорбления, угрозы и принуждение к jailbreak, тогда как модерация чаще помечает запросы токсичного контента; вместе они отмечают около 5% пользовательских реплик, а скорректированная оценка направленного на модель mistreatment — примерно 0,90% (это значение для тестовой арены, а не базовая скорость в реёмантажах). Враждебность варьирует примерно в 13 раз между моделями, что в основном определяется теми пользователями, которых модели привлекают; враждебность чаще распространяется с первого хода, извинения ассистента связаны с повышенным шансом следующей враждебной реплики внутри беседы, но более «извиняющиеся» модели в целом получают меньше враждебности; также выявлена временная структура поведения. Авторы публикуют лексикон, пайплайн кросс-валидации и все таблицы.

6.0