НОВОСТЬ · RESEARCH · #142
Аудит 777 тыс. диалогов показывает, как и в каких случаях пользователи оскорбляют разговорные модели
Авторы проаудитировали 777 тыс. английских диалогов из LMSYS-Chat-1M двумя детекторами — лексиконом из восьми категорий для враждебности, направленной на ассистента, и сигналом модерации датасета — и показали, что они фиксируют разные, слабо пересекающиеся явления. Лексикон выделяет оскорбления, угрозы и принуждение к jailbreak, тогда как модерация чаще помечает запросы токсичного контента; вместе они отмечают около 5% пользовательских реплик, а скорректированная оценка направленного на модель mistreatment — примерно 0,90% (это значение для тестовой арены, а не базовая скорость в реёмантажах). Враждебность варьирует примерно в 13 раз между моделями, что в основном определяется теми пользователями, которых модели привлекают; враждебность чаще распространяется с первого хода, извинения ассистента связаны с повышенным шансом следующей враждебной реплики внутри беседы, но более «извиняющиеся» модели в целом получают меньше враждебности; также выявлена временная структура поведения. Авторы публикуют лексикон, пайплайн кросс-валидации и все таблицы.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- английских диалогов из LMSYS-Chat-1M двумя детекторами — лексиконом из восьми категорий для враждебности, направленной на ассистента, и сигналом модерации датасета — и показали, что они фиксируют разные, слабо пересекающиеся явления.
- Лексикон выделяет оскорбления, угрозы и принуждение к jailbreak, тогда как модерация чаще помечает запросы токсичного контента; вместе они отмечают около 5% пользовательских реплик, а скорректированная оценка направленного на модель mistreatment — примерно 0,90% (это значение для тестовой арены, а не базовая скорость в реёмантажах).
- Враждебность варьирует примерно в 13 раз между моделями, что в основном определяется теми пользователями, которых модели привлекают; враждебность чаще распространяется с первого хода, извинения ассистента связаны с повышенным шансом следующей враждебной реплики внутри беседы, но более «извиняющиеся» модели в целом получают меньше враждебности; также выявлена временная структура поведения.
ПОЧЕМУ ЭТО ВАЖНО
Исследование количественно показывает, как пользовательская враждебность и принуждение проявляются в больших наборах диалогов, что важно для интерпретации поведения моделей, оценки выравнивания и стратегий развертывания/модерации.