ИССЛЕДОВАНИЕ · RESEARCH · #1316
AgBench: набор тестов для агентных ИИ на персональных устройствах (arXiv:2609.38652v1)
AgBench — набор тестов и открытые материалы для воспроизводимой оценки агентных ИИ на персональных устройствах, сравнивающий локальное, гибридное и облачное выполнение для разных задач. На основе более чем 162,07 млн наблюдений авторы показывают, что локальное выполнение устраняет плату за облачные API и утечку данных, но обычно снижает успех выполнения задач и удлиняет время завершения по сравнению с облачным; гибридные схемы могут повышать успех за счёт компромиссов по стоимости и раскрытию данных.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- AgBench — набор тестов и открытые материалы для воспроизводимой оценки агентных ИИ на персональных устройствах, сравнивающий локальное, гибридное и облачное выполнение для разных задач.
- На основе более чем 162,07 млн наблюдений авторы показывают, что локальное выполнение устраняет плату за облачные API и утечку данных, но обычно снижает успех выполнения задач и удлиняет время завершения по сравнению с облачным; гибридные схемы могут повышать успех за счёт компромиссов по стоимости и раскрытию данных.
- AgBench даёт систематический воспроизводимый способ измерять компромиссы между стоимостью, конфиденциальностью, задержками и успешностью при локальном и облачном развёртывании агентных ИИ, что важно для проектирования устройств и схем развёртывания.
ПОЧЕМУ ЭТО ВАЖНО
AgBench даёт систематический воспроизводимый способ измерять компромиссы между стоимостью, конфиденциальностью, задержками и успешностью при локальном и облачном развёртывании агентных ИИ, что важно для проектирования устройств и схем развёртывания.