Оценка по‑шаговых преимуществ через графы траекторий (GRAFT)
В препринте (v1) авторы показывают системную смещённость у групповых методов RL (например, GRPO) при по‑шаговой оценке преимуществ в многошаговых/агентных задачах и предлагают GRAFT — фреймворк для по‑шаговой атрибуции на графе траекторий: сведение всех прогонов в граф, восстановление значений состояний узлов через итерацию Беллмана и распределение кредита по разнице значений между узлами. Также предложен Graph GAE (расширение GAE для графа траекторий); авторы сообщают стабильные улучшения над GRPO и другими алгоритмами и указывают на выкладку кода в GitHub.