Tech Meridian ← К ЛЕНТЕ
EN

ИССЛЕДОВАНИЕ · RESEARCH · #519

RideWay: бенчмарк и метрика Efficiency Utility для агентов с использованием инструментов (arXiv:2609.17985v1)

В статье представлен RideWay — бенчмарк, ориентированный на эффективность, для райдхейлинговых агентов в среде с состоянием и вызовами инструментов, а также метрика Efficiency Utility, которая штрафует лишние вызовы инструментов и дополнительные пользовательские реплики относительно эталонных затрат на задачу. На 58 задачах и 24 моделях авторы показывают, что откалиброванный по человеческим предпочтениям штраф за лишние реплики примерно вдвое выше, чем за лишние вызовы инструментов; Efficiency Utility совпадает с отложенными человеческими предпочтениями на 78.7% в целом (90.6% при различиях в числе реплик), но даёт уровень случайного угадывания при различиях только в числе вызовов инструментов, что выявляет пределы оценок, основанных на простом подсчёте вызовов.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В статье представлен RideWay — бенчмарк, ориентированный на эффективность, для райдхейлинговых агентов в среде с состоянием и вызовами инструментов, а также метрика Efficiency Utility, которая штрафует лишние вызовы инструментов и дополнительные пользовательские реплики относительно эталонных затрат на задачу.
  2. На 58 задачах и 24 моделях авторы показывают, что откалиброванный по человеческим предпочтениям штраф за лишние реплики примерно вдвое выше, чем за лишние вызовы инструментов; Efficiency Utility совпадает с отложенными человеческими предпочтениями на 78.7% в целом (90.6% при различиях в числе реплик), но даёт уровень случайного угадывания при различиях только в числе вызовов инструментов, что выявляет пределы оценок, основанных на простом подсчёте вызовов.
  3. Делает измеримой эффективность взаимодействия наряду с успешностью задачи и показывает, что простые подсчёты вызовов инструментов упускают человеческие предпочтения относительно реплик, что важно для дизайна оценок агентов.

ПОЧЕМУ ЭТО ВАЖНО

Делает измеримой эффективность взаимодействия наряду с успешностью задачи и показывает, что простые подсчёты вызовов инструментов упускают человеческие предпочтения относительно реплик, что важно для дизайна оценок агентов.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1