ИССЛЕДОВАНИЕ · RESEARCH · #1002
SLCA-GRPO: присвоение кредитов по сегментам для RL с вызовами инструментов (arXiv:2609.29050v1)
В статье предлагается SLCA-GRPO — подход с присвоением кредитов по сегментам (SLCA) и иерархическими наградами для устранения неправильного распределения кредитов между сегментами при RL с вызовами инструментов; также представлена симуляция SGLS для масштабируемой тренировки. На модели 7B SLCA-GRPO ускоряет сходимость и превосходит GRPO, ToolPO и RLTR: +2.53 п.п. в домене, +1.36 п.п. на BFCL и +9.15 п.п. на τ^2-Bench при тех же ресурсах (arXiv:2609.29050v1).
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В статье предлагается SLCA-GRPO — подход с присвоением кредитов по сегментам (SLCA) и иерархическими наградами для устранения неправильного распределения кредитов между сегментами при RL с вызовами инструментов; также представлена симуляция SGLS для масштабируемой тренировки.
- На модели 7B SLCA-GRPO ускоряет сходимость и превосходит GRPO, ToolPO и RLTR: +2.53 п.п.
- на τ^2-Bench при тех же ресурсах (arXiv:2609.29050v1).
ПОЧЕМУ ЭТО ВАЖНО
Устранение «загрязнения» преимущества между токенами вызова инструментов и сводками снижает шум градиента и стабилизирует оптимизацию, повышая эффективность тренировки и точность политик с инструментами.