腾讯混元开源15亿参数语音生成与编辑模型AuK,支持声音克隆、改词、换情绪、去口音、调语速音高、降噪及多人/音乐分离,可用自然语言控制。该模型能直接编辑已有录音,无需整段重录,声音克隆无需参考文本。在SpeechEditBench评测中得分49.73,大幅领先第二名。快速版AuK-Flash经蒸馏后推理速度提升约4.5倍。论文承认模型对随意自然语言指令理解尚不稳定,需依赖Prompt Enhancer。代码和权重已公开,采用MIT许可证。
其他报道 (2条)