Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #1325

Бенчмарк VAmoS Energy: более жесткая и реалистичная симуляция голосовых агентов для звонков по счетам

Статья VAmoS Part Deux (arXiv:2609.38512v1) представляет VAmoS Energy — набор из 100 симулированных звонков по оплате коммунальных услуг, где у каждого звонящего 2–4 запроса, а агентам доступны 16 инструментов (включая тестовую интеграцию Stripe и Apache Fineract). LLM‑верификатор (99,1% согласия с кодовым верфикатором) проверяет действия агента и произносимые числа; по 14 голосовым стекам показатели выполнения задач составили 17,3%–44,7% (лидирующее место у Grok Voice), а фоновой телевизор снизил общий успех с 38,7% до 8,6%.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Статья VAmoS Part Deux (arXiv:2609.38512v1) представляет VAmoS Energy — набор из 100 симулированных звонков по оплате коммунальных услуг, где у каждого звонящего 2–4 запроса, а агентам доступны 16 инструментов (включая тестовую интеграцию Stripe и Apache Fineract).
  2. LLM‑верификатор (99,1% согласия с кодовым верфикатором) проверяет действия агента и произносимые числа; по 14 голосовым стекам показатели выполнения задач составили 17,3%–44,7% (лидирующее место у Grok Voice), а фоновой телевизор снизил общий успех с 38,7% до 8,6%.
  3. Это демонстрирует, что производительность голосовых агентов нужно оценивать на уровне всего звонка (речь, действия, верификация) в реалистичных сценариях с многократными запросами и инструментами, поскольку выявляет значительные ошибки и чувствительность к шуму.

ПОЧЕМУ ЭТО ВАЖНО

Это демонстрирует, что производительность голосовых агентов нужно оценивать на уровне всего звонка (речь, действия, верификация) в реалистичных сценариях с многократными запросами и инструментами, поскольку выявляет значительные ошибки и чувствительность к шуму.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1