ИССЛЕДОВАНИЕ · RESEARCH · #1005
Оценка по‑шаговых преимуществ через графы траекторий (GRAFT)
В препринте (v1) авторы показывают системную смещённость у групповых методов RL (например, GRPO) при по‑шаговой оценке преимуществ в многошаговых/агентных задачах и предлагают GRAFT — фреймворк для по‑шаговой атрибуции на графе траекторий: сведение всех прогонов в граф, восстановление значений состояний узлов через итерацию Беллмана и распределение кредита по разнице значений между узлами. Также предложен Graph GAE (расширение GAE для графа траекторий); авторы сообщают стабильные улучшения над GRPO и другими алгоритмами и указывают на выкладку кода в GitHub.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В препринте (v1) авторы показывают системную смещённость у групповых методов RL (например, GRPO) при по‑шаговой оценке преимуществ в многошаговых/агентных задачах и предлагают GRAFT — фреймворк для по‑шаговой атрибуции на графе траекторий: сведение всех прогонов в граф, восстановление значений состояний узлов через итерацию Беллмана и распределение кредита по разнице значений между узлами.
- Также предложен Graph GAE (расширение GAE для графа траекторий); авторы сообщают стабильные улучшения над GRPO и другими алгоритмами и указывают на выкладку кода в GitHub.
- Более надёжная по‑шаговая оценка преимуществ улучшает атрибуцию кредита при обучении многошаговых/агентных LLM, что влияет на качество обучения политик и составление поведения.
ПОЧЕМУ ЭТО ВАЖНО
Более надёжная по‑шаговая оценка преимуществ улучшает атрибуцию кредита при обучении многошаговых/агентных LLM, что влияет на качество обучения политик и составление поведения.