Tech Meridian← ВСЕ МОДЕЛИ
PROМОЙ MERIDIAN

SPACEXAI · ТРЕКЕР МОДЕЛИ

Grok Voice Transcribe 2.0

Grok Voice Transcribe 2.0 — модель преобразования речи в текст от SpaceXAI (анонсована 2026-09-18). Компания заявляет о повышенной точности на реалистичных аудио по сравнению с Grok Voice Transcribe 1.0, автоматическом определении языка и обработке переключений языка в середине записи, лидерстве в публичном стриминговом бенчмарке и доступности через существующий Speech-to-Text API (batch и streaming).

ТЕКУЩИЙ СНИМОК4/5 РАЗДЕЛОВ С ДАННЫМИ

Главные характеристики в одном месте.

ЦЕНА
ЦенообразованиеВ анонсе говорится, что v2.0 обеспечивает вдвое большую точность, чем Grok Voice Transcribe 1.0, по той же цене.
КОНТЕКСТ

Не установлено по доступным источникам.

МОДАЛЬНОСТИ
МодальностьРечь в текст (аудио-транскрипция) — модель для транскрибирования аудио.
БЕНЧМАРКИ
Рейтинг в публичном бенчмаркеЗанимает первое место по точности среди 32 стриминговых моделей в публичном рейтинге Artificial Analysis (по заявлению в анонсе).
Улучшения по WER (доля ошибок слов)По заявлению, вдвое точнее Grok Voice Transcribe 1.0 в целом; на наборе коротких фраз WER уменьшается с 20.6% (v1.0) до 6.8% (v2.0); внутренние оценки на четырёх наборах из производственного трафика показывают улучшения по всем наборам, при этом в телефонии модель лидирует среди протестированных.
ДОСТУПНОСТЬ
Доступность / режимы интеграцииДоступна через существующие интеграции Speech-to-Text API без изменений в коде; поддерживает Batch и streaming, может транскрибировать записанные файлы, URL и потоки живого аудио.

ХРОНОЛОГИЯ РЕЛИЗОВ

Только опубликованные события с источниками.

ИСТОЧНИКОВ 1 · ВАЖНОСТЬ 7.0

SpaceXAI выпустила модель распознавания речи Grok Voice Transcribe 2.0

SpaceXAI представила Grok Voice Transcribe 2.0 — обновлённую модель распознавания речи на базе аудиофунда Grok Voice. Компания утверждает, что модель вдвое точнее Grok Voice Transcribe 1.0 в реальных сценариях, занимает первое место в стриминговом рейтинге Artificial Analysis, распознаёт десятки языков с автоматическим определением и диаризацией говорящих, сохраняет прежние тарифы и совместимость API, а версия 1.0 будет выведена из эксплуатации.

→

ПРОВЕРЯЕМЫЕ ФАКТЫ

Каждое значение привязано к источнику и дате.

ВОЗМОЖНОСТИ · Поддержка нескольких языков и определение языкаДАННЫЕ РАЗРАБОТЧИКА

Транскрибирует десятки языков, автоматически определяет язык и обрабатывает переключения языка в середине записи в один проход.

ВОЗМОЖНОСТИ · Фундаментальная модель и данные обученияДАННЫЕ РАЗРАБОТЧИКА

Построена на аудиофундаментальной модели Grok Voice; обучена на наборе живых шумных многоязычных аудио из разнообразных условий и доработана посттренировкой.

БЕНЧМАРКИ · Рейтинг в публичном бенчмаркеДАННЫЕ РАЗРАБОТЧИКА

Занимает первое место по точности среди 32 стриминговых моделей в публичном рейтинге Artificial Analysis (по заявлению в анонсе).

БЕНЧМАРКИ · Улучшения по WER (доля ошибок слов)ДАННЫЕ РАЗРАБОТЧИКА

По заявлению, вдвое точнее Grok Voice Transcribe 1.0 в целом; на наборе коротких фраз WER уменьшается с 20.6% (v1.0) до 6.8% (v2.0); внутренние оценки на четырёх наборах из производственного трафика показывают улучшения по всем наборам, при этом в телефонии модель лидирует среди протестированных.

ЦЕНЫ · ЦенообразованиеДАННЫЕ РАЗРАБОТЧИКА

В анонсе говорится, что v2.0 обеспечивает вдвое большую точность, чем Grok Voice Transcribe 1.0, по той же цене.

ДОСТУПНОСТЬ · Доступность / режимы интеграцииДАННЫЕ РАЗРАБОТЧИКА

Доступна через существующие интеграции Speech-to-Text API без изменений в коде; поддерживает Batch и streaming, может транскрибировать записанные файлы, URL и потоки живого аудио.

ЧТО ИЗМЕНИЛОСЬ

Сохранённые версии паспорта, без догадок задним числом.

Паспорт создан8 фактов