小米AI实验室推出OmniVoice:业内首个覆盖数百语种的语音克隆TTS模型

2026-05-08 16:21:13   |   探索者   |   1479

5月8日,“小米技术”公众号宣布,小米AI实验室新一代Kaldi团队全新推出OmniVoice。该模型不仅在中英文场景达到顶尖性能,更在多语言任务中展现出超越商用系统的实力,成为业内首个覆盖数百语种的语音克隆TTS模型。

官方表示,OmniVoice在低资源小语种上具备极强的泛化能力,几乎所有语种都可以用它来合成语音。该模型最亮眼的突破在于其极简的架构——仅用一个双向Transformer网络,就能直接实现文本到语音的转化,省去了文本单独建模、复杂混合结构以及多层级token预测等多余环节,是目前最简单的非自回归TTS模型。

在性能方面,OmniVoice的语音合成质量优于同类主流模型,同时训练和推理速度极具优势。它可以在一天内完成10万小时的训练,使用PyTorch推理即可达到40倍实时速度,轻松适配各类应用场景。

这一出色表现背后是两项关键设计。其一,通过全码本随机掩蔽策略显著提升训练效率,从而全面提升模型能力;其二,引入大语言模型作为预训练参数,首次在非自回归TTS模型中有效利用大语言模型,大幅提升语音合成的可懂度,解决了“读不准”的问题。

在多语言测试中,即便仅基于开源数据训练,OmniVoice在24语种测试中的语音相似度和可懂度均超越多款商用系统;在102种语种的测试中,其语音可懂度逼近甚至优于真实语音。即使对于训练数据不足10小时的小语种,OmniVoice也能实现高质量语音合成,大大降低了低资源语种的语音合成门槛。

此外,OmniVoice还具备多项实用功能。在自定义音色设计方面,用户无需参考音频,只需描述音色属性如性别、年龄、音调、方言、口音等,就能生成符合预期的音色,还支持耳语等特殊风格。针对带噪参考音频,模型能自动过滤噪声,提取清晰的音色特征,即便在嘈杂环境下录制的音频也能克隆出高质量语音。模型还支持插入笑声、叹气等语气符号,让合成语音更有表现力,更贴近真人交流。对于中英文多音字和专有名词易读错的问题,用户可通过简单设置纠正发音错误,提升语音合成的可靠性。

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字、图片等内容的真实性、完整性、及时性本站不作任何保证或承诺,请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时发送相关信息至bireading@163.com,本站将会在48小时内处理完毕。

小米AI实验室推出OmniVoice:业内首个覆盖数百语种的语音克隆TTS模型

2026-05-08 16:21:13 浏览量: 1479 作者: 探索者

5月8日,“小米技术”公众号宣布,小米AI实验室新一代Kaldi团队全新推出OmniVoice。该模型不仅在中英文场景达到顶尖性能,更在多语言任务中展现出超越商用系统的实力,成为业内首个覆盖数百语种的语音克隆TTS模型。

官方表示,OmniVoice在低资源小语种上具备极强的泛化能力,几乎所有语种都可以用它来合成语音。该模型最亮眼的突破在于其极简的架构——仅用一个双向Transformer网络,就能直接实现文本到语音的转化,省去了文本单独建模、复杂混合结构以及多层级token预测等多余环节,是目前最简单的非自回归TTS模型。

在性能方面,OmniVoice的语音合成质量优于同类主流模型,同时训练和推理速度极具优势。它可以在一天内完成10万小时的训练,使用PyTorch推理即可达到40倍实时速度,轻松适配各类应用场景。

这一出色表现背后是两项关键设计。其一,通过全码本随机掩蔽策略显著提升训练效率,从而全面提升模型能力;其二,引入大语言模型作为预训练参数,首次在非自回归TTS模型中有效利用大语言模型,大幅提升语音合成的可懂度,解决了“读不准”的问题。

在多语言测试中,即便仅基于开源数据训练,OmniVoice在24语种测试中的语音相似度和可懂度均超越多款商用系统;在102种语种的测试中,其语音可懂度逼近甚至优于真实语音。即使对于训练数据不足10小时的小语种,OmniVoice也能实现高质量语音合成,大大降低了低资源语种的语音合成门槛。

此外,OmniVoice还具备多项实用功能。在自定义音色设计方面,用户无需参考音频,只需描述音色属性如性别、年龄、音调、方言、口音等,就能生成符合预期的音色,还支持耳语等特殊风格。针对带噪参考音频,模型能自动过滤噪声,提取清晰的音色特征,即便在嘈杂环境下录制的音频也能克隆出高质量语音。模型还支持插入笑声、叹气等语气符号,让合成语音更有表现力,更贴近真人交流。对于中英文多音字和专有名词易读错的问题,用户可通过简单设置纠正发音错误,提升语音合成的可靠性。

,

Copyright ©2018 铋读网 All Rights Reserved.

京ICP备18051707号

京公网安备 11011302001633号