Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1481

Бенчмарк ThinkingBox от Microsoft оценивает агентов по состоянию бэкэнда и доступен на Hugging Face

ThinkingBox — бенчмарк Microsoft, который оценивает ИИ-агентов по итоговому состоянию бэкэнда и побочным эффектам (а не только по сгенерированному тексту) — запускает 507 рабочих сценариев по 20 повторов и теперь доступен на Hugging Face с возможностью запуска через OpenEnv. В исследовании отмечена значительная непоследовательность: из 121 680 испытаний на 12 моделях 79 853 не прошли исполнимые проверки, и многие успешные на вид прогоны всё же оставляли неверное или отсутствующее состояние в базе данных.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. ThinkingBox — бенчмарк Microsoft, который оценивает ИИ-агентов по итоговому состоянию бэкэнда и побочным эффектам (а не только по сгенерированному тексту) — запускает 507 рабочих сценариев по 20 повторов и теперь доступен на Hugging Face с возможностью запуска через OpenEnv.
  2. В исследовании отмечена значительная непоследовательность: из 121 680 испытаний на 12 моделях 79 853 не прошли исполнимые проверки, и многие успешные на вид прогоны всё же оставляли неверное или отсутствующее состояние в базе данных.
  3. ThinkingBox выявляет разрыв между заявленными действиями агента и реальным состоянием базы данных, давая практичный бенчмарк, ориентированный на повторяемость, для оценки надёжности и безопасности состояних агентов.

ПОЧЕМУ ЭТО ВАЖНО

ThinkingBox выявляет разрыв между заявленными действиями агента и реальным состоянием базы данных, давая практичный бенчмарк, ориентированный на повторяемость, для оценки надёжности и безопасности состояних агентов.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1