НОВОСТЬ · RESEARCH · #139
τ-Elicitation: бенчмаркинг многошагового извлечения сущностей в голосовых агентах
В статье представлен τ-Elicitation — 200 задач для оценки точного многошагового сбора сущностей голосовыми агентами по 10 типам сущностей, с управляемой сложностью, реализмами звонящих и тремя средами. Текстовый агент проходит все задачи, тогда как четыре голосовые конфигурации показывают устойчивую точную успешность 0,14–0,41; агенты чаще запрашивают проверку для сложных или незнакомых сущностей и иногда для неверных захватов, но только 24–37% проверенных ошибок исправляются; каркас с требованием правописания, озвучивания, исправления и подтверждения повышает Pass^3 на 14–31 пунктов при дополнительной задержке 21–28 секунд на вызов.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В статье представлен τ-Elicitation — 200 задач для оценки точного многошагового сбора сущностей голосовыми агентами по 10 типам сущностей, с управляемой сложностью, реализмами звонящих и тремя средами.
- Текстовый агент проходит все задачи, тогда как четыре голосовые конфигурации показывают устойчивую точную успешность 0,14–0,41; агенты чаще запрашивают проверку для сложных или незнакомых сущностей и иногда для неверных захватов, но только 24–37% проверенных ошибок исправляются; каркас с требованием правописания, озвучивания, исправления и подтверждения повышает Pass^3 на 14–31 пунктов при дополнительной задержке 21–28 секунд на вызов.
- Это важно, потому что предлагаемая оценка и измерения показывают, что главным узким местом для точного сбора говорящих сущностей являются выбор стратегий и восстановление, а не только распознавание речи.
ПОЧЕМУ ЭТО ВАЖНО
Это важно, потому что предлагаемая оценка и измерения показывают, что главным узким местом для точного сбора говорящих сущностей являются выбор стратегий и восстановление, а не только распознавание речи.