通义发布 Qwen-Audio-3.0-TTS 语音模型 一段参考音能说 16 种语言和 20 种方言 首包延迟做到

通义发布 Qwen-Audio-3.0-TTS 语音模型

一段参考音能说 16 种语言和 20 种方言

首包延迟做到 300 毫秒级

同一段参考音可以跨 16 种语言念,音色不走样:CV3-Eval 上说话人相似度 16 个语种全部排第一,Plus 平均 82.75 分(百分制,越接近 100 越像本人)。

https://best.xiaohu.ai/article/qwen-audio-3-tts/

原链接