Tech Meridian← ВСЕ МОДЕЛИ
PROМОЙ MERIDIAN

NVIDIA · ТРЕКЕР МОДЕЛИ

Nemotron 3 Diarization

Nemotron 3 Diarization — модель диаризации от Nvidia (~100 млн параметров), определяющая, кто говорит в записи или в реальном времени; поддерживает до восьми участников, распознаёт перекрывающуюся речь, её веса доступны бесплатно.

ТЕКУЩИЙ СНИМОК4/5 РАЗДЕЛОВ С ДАННЫМИ

Главные характеристики в одном месте.

ЦЕНА

Не установлено по доступным источникам.

КОНТЕКСТ
Настройки буфера аудиоБуфер аудио настраивается на четырёх уровнях — от 30.4 до 0.32 секунды; более короткие буферы обычно снижают точность.
МОДАЛЬНОСТИ
Основная задачаДиаризация говорящих (кто говорил когда) — аудио-диаризация
Модальности вводаРаботает как с записями, так и с аудио в реальном времени (стриминг).
БЕНЧМАРКИ
Результат в бенчмаркеЗанимает 1-е место в Diarization-Bench Voice Arena с ошибкой диаризации (DER) 14,72%.
Результаты на бенчмаркеЗаняла первое место в Diarization-Bench (VoiceArena) с ошибкой 14.72%; следующий по результату — 19.3%. Бенчмарк учитывает перекрывающуюся речь и мелкие рассогласования как ошибки.
ДОСТУПНОСТЬ
Доступность весовВеса модели доступны бесплатно.

ХРОНОЛОГИЯ РЕЛИЗОВ

Только опубликованные события с источниками.

ИСТОЧНИКОВ 1 · ВАЖНОСТЬ 7.0

Nvidia выпустила Nemotron 3 Diarization — 100M‑параметрическую модель для диаризации в реальном времени

Nvidia выпустила Nemotron 3 Diarization — модель примерно с 100 миллионами параметров и открытыми весами. Модель различает до восьми говорящих (включая наложение речи), работает с живым и записанным звуком с настраиваемым буфером и показывает 14,72% ошибки на Diarization-Bench от VoiceArena, опережая предыдущую лучшую систему и сокращая ошибку примерно на 41% по сравнению со Streaming Sortformer в ряде тестов.

→
ИСТОЧНИКОВ 1 · ВАЖНОСТЬ 7.0

NVIDIA выпустила Nemotron 3 Diarization — открытая модель на 100M параметров для многоговорящей диаризации в реальном времени

NVIDIA представила Nemotron 3 Diarization — открытую модель диаризации на 100 млн параметров, занявшую 1-е место в Diarization-Bench Voice Arena (DER 14,72%). Модель поддерживает до восьми анонимных каналов, обрабатывает перекрывающуюся речь в потоковом и офлайн-режимах, использует кэширование по порядку появления (AOSC) и FIFO-буфер, а обучение включало данные David AI, что снизило совокупную DER на 0,77 пункта.

→

ПРОВЕРЯЕМЫЕ ФАКТЫ

Каждое значение привязано к источнику и дате.

ВОЗМОЖНОСТИ · Ключевые возможностиДАННЫЕ РАЗРАБОТЧИКА

Обрабатывает перекрывающуюся речь; поддерживает почастную (chunked) обработку для гибкой длины записей; настраиваемую задержку стриминга; упорядочивает выходные каналы участников по их первому появлению (подход Sortformer).

БЕНЧМАРКИ · Результаты на бенчмаркеДАННЫЕ РАЗРАБОТЧИКА

Заняла первое место в Diarization-Bench (VoiceArena) с ошибкой 14.72%; следующий по результату — 19.3%. Бенчмарк учитывает перекрывающуюся речь и мелкие рассогласования как ошибки.

ЧТО ИЗМЕНИЛОСЬ

Сохранённые версии паспорта, без догадок задним числом.

Паспорт обновлён12 фактов
КОНТЕКСТ · Настройки буфера аудио+ Буфер аудио настраивается на четырёх уровнях — от 30.4 до 0.32 секунды; более короткие буферы обычно снижают точность.
БЕНЧМАРКИ · Результаты на бенчмарке+ Заняла первое место в Diarization-Bench (VoiceArena) с ошибкой 14.72%; следующий по результату — 19.3%. Бенчмарк учитывает перекрывающуюся речь и мелкие рассогласования как ошибки.
МОДАЛЬНОСТИ · Модальности ввода+ Работает как с записями, так и с аудио в реальном времени (стриминг).
ВОЗМОЖНОСТИ · Максимальное число говорящих+ Может различать до восьми говорящих.
ВОЗМОЖНОСТИ · Обнаружение перекрывающейся речи+ Может обнаруживать одновременную речь нескольких людей (перекрытия).
ВОЗМОЖНОСТИ · Число параметров100 млн параметров→Около 100 миллионов параметров.
РЕЛИЗ · Анонс выпуска+ По сообщению, выпущена компанией Nvidia (статья опубликована 2026-09-27).
ДОСТУПНОСТЬ · Веса модели− Открытые веса (веса модели опубликованы / открыты)
ДОСТУПНОСТЬ · Доступность весов+ Веса модели доступны бесплатно.
Паспорт создан6 фактов