效果非常不错的一款TTS,一个完全非自回归的TTS模型:MaskGCT 它不需要文本和语音之间的显式对齐信息,也不需要音

效果非常不错的一款TTS,一个完全非自回归的TTS模型:MaskGCT

它不需要文本和语音之间的显式对齐信息,也不需要音素级别的持续时间预测,采用了掩码和预测的学习方式,在声音克隆、跨语种合成、语音控制等方面表现优秀

原链接