Не установлено по доступным источникам.
MISTRAL AI · ТРЕКЕР МОДЕЛИ
Voxtral Transcribe 2
Voxtral Transcribe 2 — выпущенная семейство новейших моделей распознавания речи от Mistral AI (Voxtral Mini Transcribe V2 для пакетной обработки и Voxtral Realtime для живых приложений). Обещает передовое качество транскрипции, разметку по говорящим (diarization), покомпонентные временные метки, мультиъязычность (13 языков) и настраиваемую сверхнизкую задержку; веса Voxtral Realtime выпущены под лицензией Apache 2.0 на Hugging Face.ТЕКУЩИЙ СНИМОК2/5 РАЗДЕЛОВ С ДАННЫМИ
Главные характеристики в одном месте.
Не установлено по доступным источникам.
МодальностьРечь -> текст (транскрипция) с разметкой говорящих (diarization) и покомпонентными временными метками.
Бенчмарк FLEURS и заявление о ценеОтчёт о показателях WER по языкам на бенчмарке FLEURS; утверждается, что Voxtral Mini Transcribe V2 достигает наименьшего WER при самой низкой цене.
WЕР Realtime при разных задержкахПри задержке 2,4 с Realtime соответствует Voxtral Mini Transcribe V2; при 480 мс Realtime, согласно отчету, «держится в пределах 1–2% WER», что позволяет использовать голосовые агенты с близкой к офлайн точностью.
Не установлено по доступным источникам.
ПРОВЕРЯЕМЫЕ ФАКТЫ
Каждое значение привязано к источнику и дате.
РЕЛИЗ · Дата выпускаДАННЫЕ РАЗРАБОТЧИКА
Анонс/выпуск 2026-02-04 (дата публикации объявления).
РЕЛИЗ · Включённые модели в семействеДАННЫЕ РАЗРАБОТЧИКА
Voxtral Mini Transcribe V2 (пакетная транскрипция) и Voxtral Realtime (живые/потоковые приложения).
МОДАЛЬНОСТИ · МодальностьДАННЫЕ РАЗРАБОТЧИКА
Речь -> текст (транскрипция) с разметкой говорящих (diarization) и покомпонентными временными метками.
ВОЗМОЖНОСТИ · Поддерживаемые языкиДАННЫЕ РАЗРАБОТЧИКА
Нативная мультиъязычность, поддерживает 13 языков: английский, китайский, хинди, испанский, арабский, французский, португальский, русский, немецкий, японский, корейский, итальянский и нидерландский.
ВОЗМОЖНОСТИ · Потоковая архитектура и задержкаДАННЫЕ РАЗРАБОТЧИКА
Voxtral Realtime использует новую потоковую архитектуру, транскрибируя аудио по мере поступления; задержка настраивается до значений ниже 200 мс (предназначено для живой транскрипции и голосовых агентов).
ВОЗМОЖНОСТИ · Размер модели / объём параметровДАННЫЕ РАЗРАБОТЧИКА
Сообщается объём 4 млрд параметров (отмечается, что модель эффективно работает на edge-устройствах).
БЕНЧМАРКИ · Бенчмарк FLEURS и заявление о ценеДАННЫЕ РАЗРАБОТЧИКА
Отчёт о показателях WER по языкам на бенчмарке FLEURS; утверждается, что Voxtral Mini Transcribe V2 достигает наименьшего WER при самой низкой цене.
БЕНЧМАРКИ · WЕР Realtime при разных задержкахДАННЫЕ РАЗРАБОТЧИКА
При задержке 2,4 с Realtime соответствует Voxtral Mini Transcribe V2; при 480 мс Realtime, согласно отчету, «держится в пределах 1–2% WER», что позволяет использовать голосовые агенты с близкой к офлайн точностью.
ЧТО ИЗМЕНИЛОСЬ