Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

ИССЛЕДОВАНИЕ · RESEARCH · #967

Сжатие потоковых нейронных аудио-энкодеров с помощью дистилляции в латентном пространстве

В статье предложена схема дистилляции потоковых аудио-токенизаторов: студент-энкодер обучается восстанавливать предквантизаторные латентные представления учителя по среднеквадратичной ошибке с одной аффинной прослойкой для согласования ширины. При сжатии 2.8× дистиллированный студент по пяти из шести пар учитель—студент остаётся в пределах 1.9% относительного WER от учителя без дообучения и на 3.9% опережает независимо обученный токенизатор той же ёмкости; метод применим как к отдельно предобученным, так и к совместно обучаемым токенизаторам и модели языка.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. В статье предложена схема дистилляции потоковых аудио-токенизаторов: студент-энкодер обучается восстанавливать предквантизаторные латентные представления учителя по среднеквадратичной ошибке с одной аффинной прослойкой для согласования ширины.
  2. При сжатии 2.8× дистиллированный студент по пяти из шести пар учитель—студент остаётся в пределах 1.9% относительного WER от учителя без дообучения и на 3.9% опережает независимо обученный токенизатор той же ёмкости; метод применим как к отдельно предобученным, так и к совместно обучаемым токенизаторам и модели языка.
  3. Уменьшение размера точных токенизаторов снижает нагрузку на память, энергопотребление и задержки для всегда включённых систем диктовки на устройствах, которые конкурируют за DRAM с разреженно активируемыми экспертами модели языка.

ПОЧЕМУ ЭТО ВАЖНО

Уменьшение размера точных токенизаторов снижает нагрузку на память, энергопотребление и задержки для всегда включённых систем диктовки на устройствах, которые конкурируют за DRAM с разреженно активируемыми экспертами модели языка.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1