Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #939

RLDS: разложение вознаграждения по подтаскам улучшает RL для агентов на языковых моделях (arXiv:2609.27035v1)

В работе предлагается Reinforcement Learning with Decomposed Subtasks (RLDS) и Subtask-Decomposed Advantage Estimation (SDAE): вместо сворачивания траекторного вознаграждения в одно скалярное значение они распределяют его по подтаскам перед обновлением политики. На четырёх бенчмарках метод давал значительные улучшения при высокой неоднородности подтасков (ScienceWorld +11.5 пунктов, paired-bootstrap 95% CI [+9.8, +13.3]; FrozenLake +9.8 пунктов, CI [+7.0, +12.8]), почти не менял результаты там, где диагностика предсказывала мало выиграть (HotpotQA, DeepResearch), и был эффективнее по времени на ScienceWorld (-10.9% wall-clock на шаг).

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В работе предлагается Reinforcement Learning with Decomposed Subtasks (RLDS) и Subtask-Decomposed Advantage Estimation (SDAE): вместо сворачивания траекторного вознаграждения в одно скалярное значение они распределяют его по подтаскам перед обновлением политики.
  2. На четырёх бенчмарках метод давал значительные улучшения при высокой неоднородности подтасков (ScienceWorld +11.5 пунктов, paired-bootstrap 95% CI [+9.8, +13.3]; FrozenLake +9.8 пунктов, CI [+7.0, +12.8]), почти не менял результаты там, где диагностика предсказывала мало выиграть (HotpotQA, DeepResearch), и был эффективнее по времени на ScienceWorld (-10.9% wall-clock на шаг).
  3. Разложение вознаграждения по подтаскам решает проблему присвоения кредитов в длинных разнородных роллдаутах для агентов на языковых моделях, приводя к измеримым приростам качества и вычислительной эффективности на сложных задачах.

ПОЧЕМУ ЭТО ВАЖНО

Разложение вознаграждения по подтаскам решает проблему присвоения кредитов в длинных разнородных роллдаутах для агентов на языковых моделях, приводя к измеримым приростам качества и вычислительной эффективности на сложных задачах.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1