Не установлено по доступным источникам.
NVIDIA · ТРЕКЕР МОДЕЛИ
NVIDIA Nemotron 3.5 ASR
NVIDIA Nemotron 3.5 ASR — модель автоматического распознавания речи, обеспечивающая многоязычную потоковую транскрипцию для 40 языковых локалей. Модель адаптируема через дообучение (в статье показан рабочий процесс с 133,7 часами саудовского арабского) и позволяет менять точность, задержку и вычисления через обновления энкодера, количество lookahead-фреймов и параметры декодирования.ТЕКУЩИЙ СНИМОК3/5 РАЗДЕЛОВ С ДАННЫМИ
Главные характеристики в одном месте.
Lookahead-фреймы и декодированиеУвеличение контекста внимания до 13 lookahead-фреймов и использование beam-8 MALSD-декодирования снизило WER на 2,71 абсолютных пункта без дообучения, при добавлении примерно 800 мс задержки (подходит для пакетной транскрипции).
МодальностьАвтоматическое распознавание речи (многоязычная потоковая транскрипция).
WER для саудовского арабского (наджи, хиджази) после дообученияДообучение на 133,7 часах речи на диалектах Наджи и Хиджази снизило WER с 55,05% до 29,96% на целевом тестовом сете.
Изменение WER для английского после адаптацииПроизводительность на английском улучшилась с 11,04% до 10,42% WER после описанной адаптации.
Не установлено по доступным источникам.
ПРОВЕРЯЕМЫЕ ФАКТЫ
Каждое значение привязано к источнику и дате.
МОДАЛЬНОСТИ · МодальностьДАННЫЕ РАЗРАБОТЧИКА
Автоматическое распознавание речи (многоязычная потоковая транскрипция).
ВОЗМОЖНОСТИ · Поддерживаемые языковые локалиДАННЫЕ РАЗРАБОТЧИКА
Поддерживает многоязычную потоковую транскрипцию для 40 языковых локалей, включая готовую к транскрипции арабскую локаль.
БЕНЧМАРКИ · WER для саудовского арабского (наджи, хиджази) после дообученияДАННЫЕ РАЗРАБОТЧИКА
Дообучение на 133,7 часах речи на диалектах Наджи и Хиджази снизило WER с 55,05% до 29,96% на целевом тестовом сете.
БЕНЧМАРКИ · Изменение WER для английского после адаптацииДАННЫЕ РАЗРАБОТЧИКА
Производительность на английском улучшилась с 11,04% до 10,42% WER после описанной адаптации.
КОНТЕКСТ · Lookahead-фреймы и декодированиеДАННЫЕ РАЗРАБОТЧИКА
Увеличение контекста внимания до 13 lookahead-фреймов и использование beam-8 MALSD-декодирования снизило WER на 2,71 абсолютных пункта без дообучения, при добавлении примерно 800 мс задержки (подходит для пакетной транскрипции).
ВОЗМОЖНОСТИ · Обновление энкодера и обучаемые параметрыДАННЫЕ РАЗРАБОТЧИКА
Обновление всех 24 слоев энкодера дало наименьшие ошибки, но потребовало 230,4 миллиона обучаемых параметров; заморозка слоев позволяет снизить вычисления при ограниченных данных или памяти. В рабочем процессе используются методы взвешенного воспроизведения, bucketing по длительности и частичное размораживание энкодера.
ОГРАНИЧЕНИЯ · Ограничения по диалектам и условиям записиДАННЫЕ РАЗРАБОТЧИКА
Несмотря на работу с множеством языков, специфические диалекты и локальные условия записи (например, Наджи и Хиджази) могут приводить к плохой работе без целевой дообучения; широкое предобучение не гарантирует высокие результаты на слабо представленных региональных диалектах.
ЧТО ИЗМЕНИЛОСЬ