Tech Meridian ← К ЛЕНТЕ
EN

НОВОСТЬ · MODELS · #435

Mistral запускает Voxtral TTS — мультиязычную модель синтеза речи на 4 млрд параметров

Mistral AI представила Voxtral TTS — мультиязычную модель синтеза речи на 4 млрд параметров, которая, по заявлению Mistral, генерирует эмоционально выразительную речь с низкой задержкой на девяти языках и поддерживает простую адаптацию голоса и нулевую шот-кросс-язычную передачу голоса. Модель доступна через API и Mistral Studio, стоит от $0,016 за 1K символов; по результатам внутренних человеческих оценок Mistral указывает превосходство над ElevenLabs Flash v2.5 и паритет с ElevenLabs v3 по качеству при сопоставимом времени до первого аудио.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Mistral AI представила Voxtral TTS — мультиязычную модель синтеза речи на 4 млрд параметров, которая, по заявлению Mistral, генерирует эмоционально выразительную речь с низкой задержкой на девяти языках и поддерживает простую адаптацию голоса и нулевую шот-кросс-язычную передачу голоса.
  2. Модель доступна через API и Mistral Studio, стоит от $0,016 за 1K символов; по результатам внутренних человеческих оценок Mistral указывает превосходство над ElevenLabs Flash v2.5 и паритет с ElevenLabs v3 по качеству при сопоставимом времени до первого аудио.
  3. Компактная и недорогая модель TTS с быстрой адаптацией голоса и нулевым шотом при кросс-язычной передаче может существенно расширить варианты для корпоративных голосовых агентов и повлиять на рынок поставщиков TTS.

ПОЧЕМУ ЭТО ВАЖНО

Компактная и недорогая модель TTS с быстрой адаптацией голоса и нулевым шотом при кросс-язычной передаче может существенно расширить варианты для корпоративных голосовых агентов и повлиять на рынок поставщиков TTS.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1