Tech Meridian← ВСЕ МОДЕЛИ
PROМОЙ MERIDIAN

NVIDIA · ТРЕКЕР МОДЕЛИ

NVIDIA Nemotron 3.5 ASR

NVIDIA Nemotron 3.5 ASR — модель автоматического распознавания речи, обеспечивающая многоязычную потоковую транскрипцию для 40 языковых локалей. Модель адаптируема через дообучение (в статье показан рабочий процесс с 133,7 часами саудовского арабского) и позволяет менять точность, задержку и вычисления через обновления энкодера, количество lookahead-фреймов и параметры декодирования.

ТЕКУЩИЙ СНИМОК3/5 РАЗДЕЛОВ С ДАННЫМИ

Главные характеристики в одном месте.

ЦЕНА

Не установлено по доступным источникам.

КОНТЕКСТ
Lookahead-фреймы и декодированиеУвеличение контекста внимания до 13 lookahead-фреймов и использование beam-8 MALSD-декодирования снизило WER на 2,71 абсолютных пункта без дообучения, при добавлении примерно 800 мс задержки (подходит для пакетной транскрипции).
МОДАЛЬНОСТИ
МодальностьАвтоматическое распознавание речи (многоязычная потоковая транскрипция).
БЕНЧМАРКИ
WER для саудовского арабского (наджи, хиджази) после дообученияДообучение на 133,7 часах речи на диалектах Наджи и Хиджази снизило WER с 55,05% до 29,96% на целевом тестовом сете.
Изменение WER для английского после адаптацииПроизводительность на английском улучшилась с 11,04% до 10,42% WER после описанной адаптации.
ДОСТУПНОСТЬ

Не установлено по доступным источникам.

ПРОВЕРЯЕМЫЕ ФАКТЫ

Каждое значение привязано к источнику и дате.

ВОЗМОЖНОСТИ · Поддерживаемые языковые локалиДАННЫЕ РАЗРАБОТЧИКА

Поддерживает многоязычную потоковую транскрипцию для 40 языковых локалей, включая готовую к транскрипции арабскую локаль.

БЕНЧМАРКИ · WER для саудовского арабского (наджи, хиджази) после дообученияДАННЫЕ РАЗРАБОТЧИКА

Дообучение на 133,7 часах речи на диалектах Наджи и Хиджази снизило WER с 55,05% до 29,96% на целевом тестовом сете.

КОНТЕКСТ · Lookahead-фреймы и декодированиеДАННЫЕ РАЗРАБОТЧИКА

Увеличение контекста внимания до 13 lookahead-фреймов и использование beam-8 MALSD-декодирования снизило WER на 2,71 абсолютных пункта без дообучения, при добавлении примерно 800 мс задержки (подходит для пакетной транскрипции).

ВОЗМОЖНОСТИ · Обновление энкодера и обучаемые параметрыДАННЫЕ РАЗРАБОТЧИКА

Обновление всех 24 слоев энкодера дало наименьшие ошибки, но потребовало 230,4 миллиона обучаемых параметров; заморозка слоев позволяет снизить вычисления при ограниченных данных или памяти. В рабочем процессе используются методы взвешенного воспроизведения, bucketing по длительности и частичное размораживание энкодера.

ОГРАНИЧЕНИЯ · Ограничения по диалектам и условиям записиДАННЫЕ РАЗРАБОТЧИКА

Несмотря на работу с множеством языков, специфические диалекты и локальные условия записи (например, Наджи и Хиджази) могут приводить к плохой работе без целевой дообучения; широкое предобучение не гарантирует высокие результаты на слабо представленных региональных диалектах.

ЧТО ИЗМЕНИЛОСЬ

Сохранённые версии паспорта, без догадок задним числом.

Паспорт создан7 фактов