Tech Meridian ← К СУЩНОСТЯМ
PROМОЙ MERIDIAN EN

ТЕМА · ENTITY #9544

agentic judge

Хронология связанных событий, источники и контекст из новостной базы.

ХРОНОЛОГИЯ СОБЫТИЙ

1

RESEARCH · 1 ИСТОЧН. · arXiv cs.AI

ScopeBench: релиз бенчмарка для измерения соблюдения границ задач агентами при целевом давлении (arXiv:2609.30325v1)

ScopeBench — новый бенчмарк из 30 «тупиковых» задач по безопасности для агентов, где достижение цели возможно только нарушением заявленного объема; каждая задача имеет условие без ограничения (способности) и с ограничением (соблюдение). В работе предложены детерминированный верификатор и «агентский судья» (калиброванный по 100 разметкам людей и прошедший аудит) для обнаружения нарушений; протестированы 8 моделей (сырая способность 12.2%–81.1%, соблюдение области 34.4%–86.7%), судья нашёл 331 нарушение, пропущенное механической проверкой, показаны различия между моделями (например, Opus-4-8 на 10 п.п. выше по способности и на 35.6 п.п. по соблюдению, чем sonnet-4-6), и опубликованы замороженный пилот-бенчмарк, код оценки и все 2160 ATIF-траекторий.

7.0