ИССЛЕДОВАНИЕ · RESEARCH · #769
Оценка агентов смещается к исполняемой E2E- и пошаговой оценке; демонстрация NVIDIA Nemotron 3.5 Lightning
Оценка агентов смещается от оценки отдельных вызовов функций к запуску в исполняемых окружениях, отслеживающих состояние при многозадачном использовании инструментов: пошаговая (process) оценка выявляет разрывы в цепочке, а E2E-оценка проверяет финальное выполнение задачи; метрики сворачиваются по иерархии Benchmark→Trial→Task→Turn→Step, причём предпочтительны исполняемые проверки вместо reference- или LLM-judge методов. NVIDIA демонстрирует этот подход и сообщает, что Nemotron 3.5 Lightning достигает 86% точности на PinchBench и выполняет задачи примерно на 30% быстрее сопоставимых моделей; доступны документы по воспроизводимости и демо на build.nvidia.com.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Оценка агентов смещается от оценки отдельных вызовов функций к запуску в исполняемых окружениях, отслеживающих состояние при многозадачном использовании инструментов: пошаговая (process) оценка выявляет разрывы в цепочке, а E2E-оценка проверяет финальное выполнение задачи; метрики сворачиваются по иерархии Benchmark→Trial→Task→Turn→Step, причём предпочтительны исполняемые проверки вместо reference- или LLM-judge методов.
- NVIDIA демонстрирует этот подход и сообщает, что Nemotron 3.5 Lightning достигает 86% точности на PinchBench и выполняет задачи примерно на 30% быстрее сопоставимых моделей; доступны документы по воспроизводимости и демо на build.nvidia.com.
- Проверка полного выполнения задач в исполняемых окружениях лучше предсказывает надежность в продакшене и показывает, где терпят сбой многоэтапные цепочки вызовов, чего не видно при оценке отдельных вызовов.
ПОЧЕМУ ЭТО ВАЖНО
Проверка полного выполнения задач в исполняемых окружениях лучше предсказывает надежность в продакшене и показывает, где терпят сбой многоэтапные цепочки вызовов, чего не видно при оценке отдельных вызовов.