ИССЛЕДОВАНИЕ · RESEARCH · #1107
Аудио-LLM могут определить ненадёжную транскрипцию с помощью представлений аудиокодировщика
Новая статья на arXiv (arXiv:2609.30625v1) показывает, что аудио-LLM плохо оценивают надёжность своих транскрипций, но информация о надёжности хорошо закодирована в представлениях замороженного аудиокодировщика. Авторы предлагают лёгкий предиктор на этих представлениях, который классифицирует надёжность транскрипции до генерации, достигая macro-F1 81.10% в домене и 78.09% в кросс-домене и опережая лучшие базовые методы примерно на 10–12 пунктов; метки надёжности переносятся между семействами Audio LLM при согласовании границ надёжности.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Новая статья на arXiv (arXiv:2609.30625v1) показывает, что аудио-LLM плохо оценивают надёжность своих транскрипций, но информация о надёжности хорошо закодирована в представлениях замороженного аудиокодировщика.
- Авторы предлагают лёгкий предиктор на этих представлениях, который классифицирует надёжность транскрипции до генерации, достигая macro-F1 81.10% в домене и 78.09% в кросс-домене и опережая лучшие базовые методы примерно на 10–12 пунктов; метки надёжности переносятся между семействами Audio LLM при согласовании границ надёжности.
- Обнаружение ненадёжного аудио до генерации позволяет избежать неверных ответов модели и запрашивать уточнение, повышая безопасность и удобство голосовых интерфейсов.
ПОЧЕМУ ЭТО ВАЖНО
Обнаружение ненадёжного аудио до генерации позволяет избежать неверных ответов модели и запрашивать уточнение, повышая безопасность и удобство голосовых интерфейсов.