Comedic Fool's Gold: уязвимости вознаграждений и контрмеры в разговорном юморе (arXiv:2610.00197v1)
В новом препринте на arXiv исследуются автоматические функции вознаграждения для обучения языковых моделей создавать разговорный юмор; авторы выявляют несколько путей эксплуатации и тестируют контрмеры. Эмбеддинговая метрика «удивления» принимает переставленные по словам ответы так же, как и остроумные (частично это обнаруживает фильтр флюентности, который при этом иногда отвергает корректные шутки), модель аудитории уязвима к сигналам смеха (нормализация по говорящим уменьшает атаку, но остаются другие обходы), а три прогона RL с последовательными правками вознаграждений повысили комбинированный оценочный балл на 0.0903 и сократили число нулевых сессий на 40%, но не достигли заранее зарегистрированной цели по улучшению юмора.