Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

РЕЛИЗ · MODELS · #1429

Microsoft выпустила модели речи MAI-Transcribe-2-Streaming и MAI-Voice-2.1

Microsoft выпустила MAI-Transcribe-2-Streaming — модель для моментальной транскрипции, которую компания утверждает как лидирующую по точности по данным Artificial Analysis; модель поддерживает 60 языков и выдаёт первые частичные результаты чуть более чем за 100 мс, стартовая цена — $0,54 за час аудио. Также выпущены модели синтеза голоса MAI-Voice-2.1 и низкопоздняя версия MAI-Voice-2.1-Flash (≈150 мс), говорящие на 23 языках, умеющие клонировать голос по нескольким секундам аудио, с встроенными защитами и доступные через Microsoft Foundry, MAI Playground и OpenRouter (Flash — $15 за 1M символов, стандартная версия — $22, по данным Microsoft).

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Microsoft выпустила MAI-Transcribe-2-Streaming — модель для моментальной транскрипции, которую компания утверждает как лидирующую по точности по данным Artificial Analysis; модель поддерживает 60 языков и выдаёт первые частичные результаты чуть более чем за 100 мс, стартовая цена — $0,54 за час аудио.
  2. Также выпущены модели синтеза голоса MAI-Voice-2.1 и низкопоздняя версия MAI-Voice-2.1-Flash (≈150 мс), говорящие на 23 языках, умеющие клонировать голос по нескольким секундам аудио, с встроенными защитами и доступные через Microsoft Foundry, MAI Playground и OpenRouter (Flash — $15 за 1M символов, стандартная версия — $22, по данным Microsoft).
  3. Низкая задержка, многоязычность, возможность клонирования голоса за несколько секунд и сниженная стартовая цена могут ускорить внедрение более отзывчивых голосовых агентов и диалоговых интерфейсов.

ПОЧЕМУ ЭТО ВАЖНО

Низкая задержка, многоязычность, возможность клонирования голоса за несколько секунд и сниженная стартовая цена могут ускорить внедрение более отзывчивых голосовых агентов и диалоговых интерфейсов.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1