Бенчмарк ThinkingBox от Microsoft оценивает агентов по состоянию бэкэнда и доступен на Hugging Face
ThinkingBox — бенчмарк Microsoft, который оценивает ИИ-агентов по итоговому состоянию бэкэнда и побочным эффектам (а не только по сгенерированному тексту) — запускает 507 рабочих сценариев по 20 повторов и теперь доступен на Hugging Face с возможностью запуска через OpenEnv. В исследовании отмечена значительная непоследовательность: из 121 680 испытаний на 12 моделях 79 853 не прошли исполнимые проверки, и многие успешные на вид прогоны всё же оставляли неверное или отсутствующее состояние в базе данных.