НОВОСТЬ · MODELS · #435
Mistral запускает Voxtral TTS — мультиязычную модель синтеза речи на 4 млрд параметров
Mistral AI представила Voxtral TTS — мультиязычную модель синтеза речи на 4 млрд параметров, которая, по заявлению Mistral, генерирует эмоционально выразительную речь с низкой задержкой на девяти языках и поддерживает простую адаптацию голоса и нулевую шот-кросс-язычную передачу голоса. Модель доступна через API и Mistral Studio, стоит от $0,016 за 1K символов; по результатам внутренних человеческих оценок Mistral указывает превосходство над ElevenLabs Flash v2.5 и паритет с ElevenLabs v3 по качеству при сопоставимом времени до первого аудио.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Mistral AI представила Voxtral TTS — мультиязычную модель синтеза речи на 4 млрд параметров, которая, по заявлению Mistral, генерирует эмоционально выразительную речь с низкой задержкой на девяти языках и поддерживает простую адаптацию голоса и нулевую шот-кросс-язычную передачу голоса.
- Модель доступна через API и Mistral Studio, стоит от $0,016 за 1K символов; по результатам внутренних человеческих оценок Mistral указывает превосходство над ElevenLabs Flash v2.5 и паритет с ElevenLabs v3 по качеству при сопоставимом времени до первого аудио.
- Компактная и недорогая модель TTS с быстрой адаптацией голоса и нулевым шотом при кросс-язычной передаче может существенно расширить варианты для корпоративных голосовых агентов и повлиять на рынок поставщиков TTS.
ПОЧЕМУ ЭТО ВАЖНО
Компактная и недорогая модель TTS с быстрой адаптацией голоса и нулевым шотом при кросс-язычной передаче может существенно расширить варианты для корпоративных голосовых агентов и повлиять на рынок поставщиков TTS.