Alibaba выпустила Qwen-Audio-3.1 и снизила цены на аудио‑AI до 95%
Команда Qwen Alibaba выпустила Qwen‑Audio‑3.1 — набор из пяти моделей для распознавания речи (ASR), синтеза речи (TTS) и режима реального времени. В релизе: улучшенное мультиязычное и диалектное ASR, распознавание нескольких говорящих с временными метками и детекция эмоций/фоновых/машинных шумов в ASR‑Next, кроссъязычный и управляемый TTS, диффузионный TTS‑Next для одновременной генерации голоса, эффектов и фона; модель реального времени поддерживает одновременную речь и прослушивание, мгновенное прерывание и реакцию с учётом настроения. Alibaba также существенно снизила цены на аудиосервисы (TTS примерно −70%, Realtime примерно −85%, ASR до −95%) и опубликовала подробности в блоге и на Qwen Cloud.