ИССЛЕДОВАНИЕ · RESEARCH · #967
Сжатие потоковых нейронных аудио-энкодеров с помощью дистилляции в латентном пространстве
В статье предложена схема дистилляции потоковых аудио-токенизаторов: студент-энкодер обучается восстанавливать предквантизаторные латентные представления учителя по среднеквадратичной ошибке с одной аффинной прослойкой для согласования ширины. При сжатии 2.8× дистиллированный студент по пяти из шести пар учитель—студент остаётся в пределах 1.9% относительного WER от учителя без дообучения и на 3.9% опережает независимо обученный токенизатор той же ёмкости; метод применим как к отдельно предобученным, так и к совместно обучаемым токенизаторам и модели языка.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- В статье предложена схема дистилляции потоковых аудио-токенизаторов: студент-энкодер обучается восстанавливать предквантизаторные латентные представления учителя по среднеквадратичной ошибке с одной аффинной прослойкой для согласования ширины.
- При сжатии 2.8× дистиллированный студент по пяти из шести пар учитель—студент остаётся в пределах 1.9% относительного WER от учителя без дообучения и на 3.9% опережает независимо обученный токенизатор той же ёмкости; метод применим как к отдельно предобученным, так и к совместно обучаемым токенизаторам и модели языка.
- Уменьшение размера точных токенизаторов снижает нагрузку на память, энергопотребление и задержки для всегда включённых систем диктовки на устройствах, которые конкурируют за DRAM с разреженно активируемыми экспертами модели языка.
ПОЧЕМУ ЭТО ВАЖНО
Уменьшение размера точных токенизаторов снижает нагрузку на память, энергопотребление и задержки для всегда включённых систем диктовки на устройствах, которые конкурируют за DRAM с разреженно активируемыми экспертами модели языка.