РЕЛИЗ · MODELS · #1429
Microsoft выпустила модели речи MAI-Transcribe-2-Streaming и MAI-Voice-2.1
Microsoft выпустила MAI-Transcribe-2-Streaming — модель для моментальной транскрипции, которую компания утверждает как лидирующую по точности по данным Artificial Analysis; модель поддерживает 60 языков и выдаёт первые частичные результаты чуть более чем за 100 мс, стартовая цена — $0,54 за час аудио. Также выпущены модели синтеза голоса MAI-Voice-2.1 и низкопоздняя версия MAI-Voice-2.1-Flash (≈150 мс), говорящие на 23 языках, умеющие клонировать голос по нескольким секундам аудио, с встроенными защитами и доступные через Microsoft Foundry, MAI Playground и OpenRouter (Flash — $15 за 1M символов, стандартная версия — $22, по данным Microsoft).
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Microsoft выпустила MAI-Transcribe-2-Streaming — модель для моментальной транскрипции, которую компания утверждает как лидирующую по точности по данным Artificial Analysis; модель поддерживает 60 языков и выдаёт первые частичные результаты чуть более чем за 100 мс, стартовая цена — $0,54 за час аудио.
- Также выпущены модели синтеза голоса MAI-Voice-2.1 и низкопоздняя версия MAI-Voice-2.1-Flash (≈150 мс), говорящие на 23 языках, умеющие клонировать голос по нескольким секундам аудио, с встроенными защитами и доступные через Microsoft Foundry, MAI Playground и OpenRouter (Flash — $15 за 1M символов, стандартная версия — $22, по данным Microsoft).
- Низкая задержка, многоязычность, возможность клонирования голоса за несколько секунд и сниженная стартовая цена могут ускорить внедрение более отзывчивых голосовых агентов и диалоговых интерфейсов.
ПОЧЕМУ ЭТО ВАЖНО
Низкая задержка, многоязычность, возможность клонирования голоса за несколько секунд и сниженная стартовая цена могут ускорить внедрение более отзывчивых голосовых агентов и диалоговых интерфейсов.