Tech Meridian← ВСЕ МОДЕЛИ
PROМОЙ MERIDIAN

ALIBABA (QWEN) · ТРЕКЕР МОДЕЛИ

Qwen-Audio-3.1

Qwen-Audio-3.1 — выпущенная линейка из пяти аудиомоделей команды Qwen компании Alibaba для автоматического распознавания речи (ASR), синтеза речи (TTS) и реального взаимодействия, с новыми возможностями и существенным снижением цен.

ТЕКУЩИЙ СНИМОК0/5 РАЗДЕЛОВ С ДАННЫМИ

Главные характеристики в одном месте.

ЦЕНА

Не установлено по доступным источникам.

КОНТЕКСТ

Не установлено по доступным источникам.

МОДАЛЬНОСТИ

Не установлено по доступным источникам.

БЕНЧМАРКИ

Не установлено по доступным источникам.

ДОСТУПНОСТЬ

Не установлено по доступным источникам.

ХРОНОЛОГИЯ РЕЛИЗОВ

Только опубликованные события с источниками.

ИСТОЧНИКОВ 1 · ВАЖНОСТЬ 7.0

Alibaba выпустила Qwen-Audio-3.1 и снизила цены на аудио‑AI до 95%

Команда Qwen Alibaba выпустила Qwen‑Audio‑3.1 — набор из пяти моделей для распознавания речи (ASR), синтеза речи (TTS) и режима реального времени. В релизе: улучшенное мультиязычное и диалектное ASR, распознавание нескольких говорящих с временными метками и детекция эмоций/фоновых/машинных шумов в ASR‑Next, кроссъязычный и управляемый TTS, диффузионный TTS‑Next для одновременной генерации голоса, эффектов и фона; модель реального времени поддерживает одновременную речь и прослушивание, мгновенное прерывание и реакцию с учётом настроения. Alibaba также существенно снизила цены на аудиосервисы (TTS примерно −70%, Realtime примерно −85%, ASR до −95%) и опубликовала подробности в блоге и на Qwen Cloud.

→

ПРОВЕРЯЕМЫЕ ФАКТЫ

Каждое значение привязано к источнику и дате.

ВОЗМОЖНОСТИ · Линейка моделей и модальностиДАННЫЕ РАЗРАБОТЧИКА

Выпущена линейка из пяти моделей, охватывающих распознавание речи (ASR), синтез речи (TTS) и интерактивную работу в реальном времени.

ВОЗМОЖНОСТИ · Возможности TTSДАННЫЕ РАЗРАБОТЧИКА

TTS поддерживает многоязычный синтез с естественной передачей голоса между языками; пользователи контролируют эмоцию, скорость и стиль с помощью текстовых подсказок.

ВОЗМОЖНОСТИ · Подход TTS-NextДАННЫЕ РАЗРАБОТЧИКА

TTS-Next сочетает языковую модель с диффузионным подходом для генерации голоса, звуковых эффектов и фоновой аудиодорожки за один проход.

ВОЗМОЖНОСТИ · Функции взаимодействия в реальном времениДАННЫЕ РАЗРАБОТЧИКА

Модель для реального времени поддерживает одновременную речь и прослушивание с мгновенным прерыванием.

БЕЗОПАСНОСТЬ · Адаптивное поведение ответаДАННЫЕ РАЗРАБОТЧИКА

Утверждается, что модель в реальном времени обнаруживает пониженное настроение и отвечает медленнее и более эмпатично.

ЧТО ИЗМЕНИЛОСЬ

Сохранённые версии паспорта, без догадок задним числом.

Паспорт создан8 фактов