Развёртывание Qwen3-TTS со стриминговым выводом на SageMaker через vLLM-Omni v1.5 для приложений реального времени
AWS опубликовала пошаговое руководство (Часть 1) по развёртыванию модели синтеза речи Qwen3-TTS на Amazon SageMaker AI с использованием Deep Learning Container vLLM-Omni v1.5. В материале показано, как по одному постоянному двухстороннему соединению (SageMaker bidirectional streaming) отправлять текст и получать аудиочасти через нативный WebSocket‑маршрут vLLM-Omni (v1/audio/speech/stream), а также приведён пример на Gradio; серия также охватит другие специализированные DLC (WhisperX, llama.cpp).