Open-Endedness Bench (OEB) оценивает эпистемические процессы агентов по журналам исполнения
В статье предложена OEB — методика, независимая от эталона, которая строит эпистемический граф событий из журнала исполнения агента (без опоры на эталонные ответы или итоговые оценки), связывая заявленные положения с выполненными тестирующими действиями и оценивая четыре компетентностные оси и шесть персональных черт. Применённая к 119 прогонам по 12 задачам (дообучение LLM, проектирование чипов и рекорд скорости обучения), OEB показывает, что только 16–29% заявленных улучшений действительно подтверждаются выполненными экспериментами, а поведение исследовательских агентов сильнее связано с моделью, чем с задачей.