Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1005

Оценка по‑шаговых преимуществ через графы траекторий (GRAFT)

В препринте (v1) авторы показывают системную смещённость у групповых методов RL (например, GRPO) при по‑шаговой оценке преимуществ в многошаговых/агентных задачах и предлагают GRAFT — фреймворк для по‑шаговой атрибуции на графе траекторий: сведение всех прогонов в граф, восстановление значений состояний узлов через итерацию Беллмана и распределение кредита по разнице значений между узлами. Также предложен Graph GAE (расширение GAE для графа траекторий); авторы сообщают стабильные улучшения над GRPO и другими алгоритмами и указывают на выкладку кода в GitHub.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В препринте (v1) авторы показывают системную смещённость у групповых методов RL (например, GRPO) при по‑шаговой оценке преимуществ в многошаговых/агентных задачах и предлагают GRAFT — фреймворк для по‑шаговой атрибуции на графе траекторий: сведение всех прогонов в граф, восстановление значений состояний узлов через итерацию Беллмана и распределение кредита по разнице значений между узлами.
  2. Также предложен Graph GAE (расширение GAE для графа траекторий); авторы сообщают стабильные улучшения над GRPO и другими алгоритмами и указывают на выкладку кода в GitHub.
  3. Более надёжная по‑шаговая оценка преимуществ улучшает атрибуцию кредита при обучении многошаговых/агентных LLM, что влияет на качество обучения политик и составление поведения.

ПОЧЕМУ ЭТО ВАЖНО

Более надёжная по‑шаговая оценка преимуществ улучшает атрибуцию кредита при обучении многошаговых/агентных LLM, что влияет на качество обучения политик и составление поведения.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1