Аудио-LLM могут определить ненадёжную транскрипцию с помощью представлений аудиокодировщика
Новая статья на arXiv (arXiv:2609.30625v1) показывает, что аудио-LLM плохо оценивают надёжность своих транскрипций, но информация о надёжности хорошо закодирована в представлениях замороженного аудиокодировщика. Авторы предлагают лёгкий предиктор на этих представлениях, который классифицирует надёжность транскрипции до генерации, достигая macro-F1 81.10% в домене и 78.09% в кросс-домене и опережая лучшие базовые методы примерно на 10–12 пунктов; метки надёжности переносятся между семействами Audio LLM при согласовании границ надёжности.