Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

ТЕМА · ENTITY #8450

τ^2-Bench

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

1

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

SLCA-GRPO: присвоение кредитов по сегментам для RL с вызовами инструментов (arXiv:2609.29050v1)

В статье предлагается SLCA-GRPO — подход с присвоением кредитов по сегментам (SLCA) и иерархическими наградами для устранения неправильного распределения кредитов между сегментами при RL с вызовами инструментов; также представлена симуляция SGLS для масштабируемой тренировки. На модели 7B SLCA-GRPO ускоряет сходимость и превосходит GRPO, ToolPO и RLTR: +2.53 п.п. в домене, +1.36 п.п. на BFCL и +9.15 п.п. на τ^2-Bench при тех же ресурсах (arXiv:2609.29050v1).

7.0