Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1002

SLCA-GRPO: присвоение кредитов по сегментам для RL с вызовами инструментов (arXiv:2609.29050v1)

В статье предлагается SLCA-GRPO — подход с присвоением кредитов по сегментам (SLCA) и иерархическими наградами для устранения неправильного распределения кредитов между сегментами при RL с вызовами инструментов; также представлена симуляция SGLS для масштабируемой тренировки. На модели 7B SLCA-GRPO ускоряет сходимость и превосходит GRPO, ToolPO и RLTR: +2.53 п.п. в домене, +1.36 п.п. на BFCL и +9.15 п.п. на τ^2-Bench при тех же ресурсах (arXiv:2609.29050v1).

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В статье предлагается SLCA-GRPO — подход с присвоением кредитов по сегментам (SLCA) и иерархическими наградами для устранения неправильного распределения кредитов между сегментами при RL с вызовами инструментов; также представлена симуляция SGLS для масштабируемой тренировки.
  2. На модели 7B SLCA-GRPO ускоряет сходимость и превосходит GRPO, ToolPO и RLTR: +2.53 п.п.
  3. на τ^2-Bench при тех же ресурсах (arXiv:2609.29050v1).

ПОЧЕМУ ЭТО ВАЖНО

Устранение «загрязнения» преимущества между токенами вызова инструментов и сводками снижает шум градиента и стабилизирует оптимизацию, повышая эффективность тренировки и точность политик с инструментами.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1