Не установлено по доступным источникам.
NVIDIA · ТРЕКЕР МОДЕЛИ
Nemotron 3 Diarization
Nemotron 3 Diarization — модель диаризации от Nvidia (~100 млн параметров), определяющая, кто говорит в записи или в реальном времени; поддерживает до восьми участников, распознаёт перекрывающуюся речь, её веса доступны бесплатно.ТЕКУЩИЙ СНИМОК4/5 РАЗДЕЛОВ С ДАННЫМИ
Главные характеристики в одном месте.
ХРОНОЛОГИЯ РЕЛИЗОВ
Только опубликованные события с источниками.
Nvidia выпустила Nemotron 3 Diarization — 100M‑параметрическую модель для диаризации в реальном времени
Nvidia выпустила Nemotron 3 Diarization — модель примерно с 100 миллионами параметров и открытыми весами. Модель различает до восьми говорящих (включая наложение речи), работает с живым и записанным звуком с настраиваемым буфером и показывает 14,72% ошибки на Diarization-Bench от VoiceArena, опережая предыдущую лучшую систему и сокращая ошибку примерно на 41% по сравнению со Streaming Sortformer в ряде тестов.
NVIDIA выпустила Nemotron 3 Diarization — открытая модель на 100M параметров для многоговорящей диаризации в реальном времени
NVIDIA представила Nemotron 3 Diarization — открытую модель диаризации на 100 млн параметров, занявшую 1-е место в Diarization-Bench Voice Arena (DER 14,72%). Модель поддерживает до восьми анонимных каналов, обрабатывает перекрывающуюся речь в потоковом и офлайн-режимах, использует кэширование по порядку появления (AOSC) и FIFO-буфер, а обучение включало данные David AI, что снизило совокупную DER на 0,77 пункта.
ПРОВЕРЯЕМЫЕ ФАКТЫ
Каждое значение привязано к источнику и дате.
Диаризация говорящих (кто говорил когда) — аудио-диаризация
Около 100 миллионов параметров.
Поддерживает до восьми участников в живых и записанных беседах
Обрабатывает перекрывающуюся речь; поддерживает почастную (chunked) обработку для гибкой длины записей; настраиваемую задержку стриминга; упорядочивает выходные каналы участников по их первому появлению (подход Sortformer).
Веса модели доступны бесплатно.
Занимает 1-е место в Diarization-Bench Voice Arena с ошибкой диаризации (DER) 14,72%.
По сообщению, выпущена компанией Nvidia (статья опубликована 2026-09-27).
Может различать до восьми говорящих.
Может обнаруживать одновременную речь нескольких людей (перекрытия).
Работает как с записями, так и с аудио в реальном времени (стриминг).
Буфер аудио настраивается на четырёх уровнях — от 30.4 до 0.32 секунды; более короткие буферы обычно снижают точность.
Заняла первое место в Diarization-Bench (VoiceArena) с ошибкой 14.72%; следующий по результату — 19.3%. Бенчмарк учитывает перекрывающуюся речь и мелкие рассогласования как ошибки.
ЧТО ИЗМЕНИЛОСЬ