Mistral запускает Voxtral TTS — мультиязычную модель синтеза речи на 4 млрд параметров
Mistral AI представила Voxtral TTS — мультиязычную модель синтеза речи на 4 млрд параметров, которая, по заявлению Mistral, генерирует эмоционально выразительную речь с низкой задержкой на девяти языках и поддерживает простую адаптацию голоса и нулевую шот-кросс-язычную передачу голоса. Модель доступна через API и Mistral Studio, стоит от $0,016 за 1K символов; по результатам внутренних человеческих оценок Mistral указывает превосходство над ElevenLabs Flash v2.5 и паритет с ElevenLabs v3 по качеству при сопоставимом времени до первого аудио.