AgBench: набор тестов для агентных ИИ на персональных устройствах (arXiv:2609.38652v1)
AgBench — набор тестов и открытые материалы для воспроизводимой оценки агентных ИИ на персональных устройствах, сравнивающий локальное, гибридное и облачное выполнение для разных задач. На основе более чем 162,07 млн наблюдений авторы показывают, что локальное выполнение устраняет плату за облачные API и утечку данных, но обычно снижает успех выполнения задач и удлиняет время завершения по сравнению с облачным; гибридные схемы могут повышать успех за счёт компромиссов по стоимости и раскрытию данных.