ИССЛЕДОВАНИЕ · RESEARCH · #1494
Open-Endedness Bench (OEB) оценивает эпистемические процессы агентов по журналам исполнения
В статье предложена OEB — методика, независимая от эталона, которая строит эпистемический граф событий из журнала исполнения агента (без опоры на эталонные ответы или итоговые оценки), связывая заявленные положения с выполненными тестирующими действиями и оценивая четыре компетентностные оси и шесть персональных черт. Применённая к 119 прогонам по 12 задачам (дообучение LLM, проектирование чипов и рекорд скорости обучения), OEB показывает, что только 16–29% заявленных улучшений действительно подтверждаются выполненными экспериментами, а поведение исследовательских агентов сильнее связано с моделью, чем с задачей.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В статье предложена OEB — методика, независимая от эталона, которая строит эпистемический граф событий из журнала исполнения агента (без опоры на эталонные ответы или итоговые оценки), связывая заявленные положения с выполненными тестирующими действиями и оценивая четыре компетентностные оси и шесть персональных черт.
- Применённая к 119 прогонам по 12 задачам (дообучение LLM, проектирование чипов и рекорд скорости обучения), OEB показывает, что только 16–29% заявленных улучшений действительно подтверждаются выполненными экспериментами, а поведение исследовательских агентов сильнее связано с моделью, чем с задачей.
- OEB даёт воспроизводимый, независимый от результата способ проверить, подкреплены ли утверждения агентов выполненными экспериментами, выявляя переоценённые улучшения и давая полезные метрики для разработки и оценки агентов.
ПОЧЕМУ ЭТО ВАЖНО
OEB даёт воспроизводимый, независимый от результата способ проверить, подкреплены ли утверждения агентов выполненными экспериментами, выявляя переоценённые улучшения и давая полезные метрики для разработки и оценки агентов.