Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

КОМПАНИЯ · ENTITY #6112

Berkeley Function-Calling Leaderboard (BFCL)

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

2

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

SLCA-GRPO: присвоение кредитов по сегментам для RL с вызовами инструментов (arXiv:2609.29050v1)

В статье предлагается SLCA-GRPO — подход с присвоением кредитов по сегментам (SLCA) и иерархическими наградами для устранения неправильного распределения кредитов между сегментами при RL с вызовами инструментов; также представлена симуляция SGLS для масштабируемой тренировки. На модели 7B SLCA-GRPO ускоряет сходимость и превосходит GRPO, ToolPO и RLTR: +2.53 п.п. в домене, +1.36 п.п. на BFCL и +9.15 п.п. на τ^2-Bench при тех же ресурсах (arXiv:2609.29050v1).

7.0

RESEARCH · 1 ИСТОЧН. · NVIDIA Developer

Оценка агентов смещается к исполняемой E2E- и пошаговой оценке; демонстрация NVIDIA Nemotron 3.5 Lightning

Оценка агентов смещается от оценки отдельных вызовов функций к запуску в исполняемых окружениях, отслеживающих состояние при многозадачном использовании инструментов: пошаговая (process) оценка выявляет разрывы в цепочке, а E2E-оценка проверяет финальное выполнение задачи; метрики сворачиваются по иерархии Benchmark→Trial→Task→Turn→Step, причём предпочтительны исполняемые проверки вместо reference- или LLM-judge методов. NVIDIA демонстрирует этот подход и сообщает, что Nemotron 3.5 Lightning достигает 86% точности на PinchBench и выполняет задачи примерно на 30% быстрее сопоставимых моделей; доступны документы по воспроизводимости и демо на build.nvidia.com.

7.0