Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

КОМПАНИЯ · ENTITY #12420

GAP-DPO

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

1

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

GAP-DPO: выбор пар по геометрии улучшает персонализированную оптимизацию предпочтений

Препринт arXiv:2610.00061v1 представляет GAP-DPO — итеративный метод, который выбирает пары предпочтений с учётом выравнивания градиентов между обновлениями DPO и градиентами ожидаемой пользовательской полезности. Авторы анализируют, как выбор пар определяет, становится ли DPO корректировкой ошибок или обновлением в духе обучения с подкреплением при off-policy сэмплинге, и показывают, что GAP-DPO повышает стилистическую точность, согласованность с предпочтениями и качество генерации на бенчмарках персонализированной генерации текста по сравнению со стандартными вариантами DPO.

6.0