Tech Meridian ← К ЛЕНТЕ
PROМОЙ MERIDIAN EN

РЕЛИЗ · MODELS · #860

Alibaba выпустила Qwen-Audio-3.1 и снизила цены на аудио‑AI до 95%

Команда Qwen Alibaba выпустила Qwen‑Audio‑3.1 — набор из пяти моделей для распознавания речи (ASR), синтеза речи (TTS) и режима реального времени. В релизе: улучшенное мультиязычное и диалектное ASR, распознавание нескольких говорящих с временными метками и детекция эмоций/фоновых/машинных шумов в ASR‑Next, кроссъязычный и управляемый TTS, диффузионный TTS‑Next для одновременной генерации голоса, эффектов и фона; модель реального времени поддерживает одновременную речь и прослушивание, мгновенное прерывание и реакцию с учётом настроения. Alibaba также существенно снизила цены на аудиосервисы (TTS примерно −70%, Realtime примерно −85%, ASR до −95%) и опубликовала подробности в блоге и на Qwen Cloud.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Команда Qwen Alibaba выпустила Qwen‑Audio‑3.1 — набор из пяти моделей для распознавания речи (ASR), синтеза речи (TTS) и режима реального времени.
  2. В релизе: улучшенное мультиязычное и диалектное ASR, распознавание нескольких говорящих с временными метками и детекция эмоций/фоновых/машинных шумов в ASR‑Next, кроссъязычный и управляемый TTS, диффузионный TTS‑Next для одновременной генерации голоса, эффектов и фона; модель реального времени поддерживает одновременную речь и прослушивание, мгновенное прерывание и реакцию с учётом настроения.
  3. Alibaba также существенно снизила цены на аудиосервисы (TTS примерно −70%, Realtime примерно −85%, ASR до −95%) и опубликовала подробности в блоге и на Qwen Cloud.

ПОЧЕМУ ЭТО ВАЖНО

Релиз приносит продвинутые ASR/TTS и возможности реального времени, а резкое снижение цен может ускорить внедрение аудио‑AI и создать ценовое давление на конкурентов.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1