Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

网易有道开源 Confucius4-TTS:14 语种零参考文本跨语种语音克隆(1.3B,Apache)

如果你在做数字人、跨境内容或语音类产品,但又不想把声音数据交给闭源 API、还想在本地跑,这条值得停下来看。网易有道把"子曰4.0"大模型体系里的语音合成引擎 Confucius4-TTS 开源了,参数量 1.3B,采用宽松的 Apache 协议,开放完整模型权重与配套工具链,开发者可下载 54G 资源包本地离线部署、商用无限制。 TTS(Text-to-Speech,文本转语音)这几年最难啃的不是"能不能合成出声音",而是"零样本声音克隆"——只给几秒目标人的录音,就能用这个音色读任意文本,而不用为每个人单独训练。Confucius4-TTS 主打的正是这条线,并把它往前推了一步:跨语种克隆。也就是说你拿一段中文录音,模型能用同一个音色去说日语、英语等外语。 这套引擎声称的最大突破是不依赖参考文本即可实现 14 语种无口音跨语种语音克隆,并自称是全球首个做到这点。支持的语言包括中、英、日、韩、德、法、西、印尼、意、泰、葡、俄、马来、越南共 14 种。这里"不依赖参考文本"是关键差异:很多克隆方案需要你同时提供录音和它对应的文字稿才能对齐,去掉这一步对实际使用门槛是实打实的降低。 官方自报的几个量化点:3 秒即可完成一次音频克隆,克隆音色与原声相似度超过 85%,克隆任务准确度达 97%。相较其初代 EmotiVoice 只能复刻训练集内的音色,这一代主打"零样本即可复刻原声"。需要说明,这些是厂商自报数据,相似度 85%、准确度 97% 具体怎么测、用什么样本,原文未给出方法细节。 跨语种这一点是它对标同类产品的卖点。语音合成长期的痛点是"中式口音"——拿中文音色去说外语容易"硬凹"。官方引用技术博主的评价称,用中文声音讲日语听起来像地道的日本人在说,发音自然。这类主观评价仍属宣传口径,真实跨语种发音质量得听 demo 或第三方复测来判断。 它还支持音频 Prompt 情感克隆:系统自动从参考音频里提取情感标签,复刻语调与韵律,并支持跨语种无损迁移——"生气地说一句话,合成出来的外语也是生气的语气"。这比初代只支持 happy/sad/angry 这类离散文本标签的粗放控制更细。底层架构上,原文称从传统 HiFi-GAN 声码器路线升级为大模型驱动,不过给出的描述在此处被截断,更具体的网络细节原文未完整给出。 落到判断:对想把语音克隆能力跑在自己机器上、规避闭源 API 依赖与合规风险的团队,1.3B + Apache + 本地权重 + 商用无限制 这套组合很实在,数字人、跨境传播、智能教育是它点名的目标场景。诚实的保留是:相似度、准确度、跨语种地道程度目前都是厂商自报,缺少独立第三方未污染评测;要不要上生产,建议先用自己的素材跑一遍再下结论。
相关