通义发布 Qwen-Audio-3.0-TTS 语音模型 一段参考音能说 16 种语言和 20 种方言 首包延迟做到
通义发布 Qwen-Audio-3.0-TTS 语音模型
一段参考音能说 16 种语言和 20 种方言
首包延迟做到 300 毫秒级
同一段参考音可以跨 16 种语言念,音色不走样:CV3-Eval 上说话人相似度 16 个语种全部排第一,Plus 平均 82.75 分(百分制,越接近 100 越像本人)。
https://best.xiaohu.ai/article/qwen-audio-3-tts/