GAP-DPO: выбор пар по геометрии улучшает персонализированную оптимизацию предпочтений
Препринт arXiv:2610.00061v1 представляет GAP-DPO — итеративный метод, который выбирает пары предпочтений с учётом выравнивания градиентов между обновлениями DPO и градиентами ожидаемой пользовательской полезности. Авторы анализируют, как выбор пар определяет, становится ли DPO корректировкой ошибок или обновлением в духе обучения с подкреплением при off-policy сэмплинге, и показывают, что GAP-DPO повышает стилистическую точность, согласованность с предпочтениями и качество генерации на бенчмарках персонализированной генерации текста по сравнению со стандартными вариантами DPO.