ЦенообразованиеВ анонсе говорится, что v2.0 обеспечивает вдвое большую точность, чем Grok Voice Transcribe 1.0, по той же цене.
SPACEXAI · ТРЕКЕР МОДЕЛИ
Grok Voice Transcribe 2.0
Grok Voice Transcribe 2.0 — модель преобразования речи в текст от SpaceXAI (анонсована 2026-09-18). Компания заявляет о повышенной точности на реалистичных аудио по сравнению с Grok Voice Transcribe 1.0, автоматическом определении языка и обработке переключений языка в середине записи, лидерстве в публичном стриминговом бенчмарке и доступности через существующий Speech-to-Text API (batch и streaming).ТЕКУЩИЙ СНИМОК4/5 РАЗДЕЛОВ С ДАННЫМИ
Главные характеристики в одном месте.
Не установлено по доступным источникам.
МодальностьРечь в текст (аудио-транскрипция) — модель для транскрибирования аудио.
Рейтинг в публичном бенчмаркеЗанимает первое место по точности среди 32 стриминговых моделей в публичном рейтинге Artificial Analysis (по заявлению в анонсе).
Улучшения по WER (доля ошибок слов)По заявлению, вдвое точнее Grok Voice Transcribe 1.0 в целом; на наборе коротких фраз WER уменьшается с 20.6% (v1.0) до 6.8% (v2.0); внутренние оценки на четырёх наборах из производственного трафика показывают улучшения по всем наборам, при этом в телефонии модель лидирует среди протестированных.
Доступность / режимы интеграцииДоступна через существующие интеграции Speech-to-Text API без изменений в коде; поддерживает Batch и streaming, может транскрибировать записанные файлы, URL и потоки живого аудио.
ХРОНОЛОГИЯ РЕЛИЗОВ
Только опубликованные события с источниками.
ПРОВЕРЯЕМЫЕ ФАКТЫ
Каждое значение привязано к источнику и дате.
РЕЛИЗ · Дата выпуска/анонсаДАННЫЕ РАЗРАБОТЧИКА
Анонс опубликован 2026-09-18T17:34:03.777368+00:00 (SpaceXAI объявила о выпуске модели).
МОДАЛЬНОСТИ · МодальностьДАННЫЕ РАЗРАБОТЧИКА
Речь в текст (аудио-транскрипция) — модель для транскрибирования аудио.
ВОЗМОЖНОСТИ · Поддержка нескольких языков и определение языкаДАННЫЕ РАЗРАБОТЧИКА
Транскрибирует десятки языков, автоматически определяет язык и обрабатывает переключения языка в середине записи в один проход.
ВОЗМОЖНОСТИ · Фундаментальная модель и данные обученияДАННЫЕ РАЗРАБОТЧИКА
Построена на аудиофундаментальной модели Grok Voice; обучена на наборе живых шумных многоязычных аудио из разнообразных условий и доработана посттренировкой.
БЕНЧМАРКИ · Рейтинг в публичном бенчмаркеДАННЫЕ РАЗРАБОТЧИКА
Занимает первое место по точности среди 32 стриминговых моделей в публичном рейтинге Artificial Analysis (по заявлению в анонсе).
БЕНЧМАРКИ · Улучшения по WER (доля ошибок слов)ДАННЫЕ РАЗРАБОТЧИКА
По заявлению, вдвое точнее Grok Voice Transcribe 1.0 в целом; на наборе коротких фраз WER уменьшается с 20.6% (v1.0) до 6.8% (v2.0); внутренние оценки на четырёх наборах из производственного трафика показывают улучшения по всем наборам, при этом в телефонии модель лидирует среди протестированных.
ЦЕНЫ · ЦенообразованиеДАННЫЕ РАЗРАБОТЧИКА
В анонсе говорится, что v2.0 обеспечивает вдвое большую точность, чем Grok Voice Transcribe 1.0, по той же цене.
ДОСТУПНОСТЬ · Доступность / режимы интеграцииДАННЫЕ РАЗРАБОТЧИКА
Доступна через существующие интеграции Speech-to-Text API без изменений в коде; поддерживает Batch и streaming, может транскрибировать записанные файлы, URL и потоки живого аудио.
ЧТО ИЗМЕНИЛОСЬ