Сжатие потоковых нейронных аудио-энкодеров с помощью дистилляции в латентном пространстве
В статье предложена схема дистилляции потоковых аудио-токенизаторов: студент-энкодер обучается восстанавливать предквантизаторные латентные представления учителя по среднеквадратичной ошибке с одной аффинной прослойкой для согласования ширины. При сжатии 2.8× дистиллированный студент по пяти из шести пар учитель—студент остаётся в пределах 1.9% относительного WER от учителя без дообучения и на 3.9% опережает независимо обученный токенизатор той же ёмкости; метод применим как к отдельно предобученным, так и к совместно обучаемым токенизаторам и модели языка.