OmniVoice

OmniVoice

600语种语音克隆

AI官网

应用介绍

市面上的语音合成,能选的语言基本就是那几十种主流的。想要一个小语种的配音,要么根本没有,要么效果差到没法听。想换成自己的声音,通常还得先录一堆素材去训练一个专属模型。

OmniVoice 把这两件事一起解决了:一个覆盖 600 多种语言的零样本语音合成模型。零样本的意思是不用训练——给它一段参考音频,它就能用这个声音去念你给的文本,语言换了也照样是这个声音。

除了照着参考音频克隆,它还有另一条路:不给音频,直接描述你要什么样的嗓音(说话人属性),让它凭空造一个出来。

项目来自小米 AI 实验室的 Next-gen Kaldi 团队,Apache-2.0 开源。模型和代码都能下到本地跑——pip 装完可以用 Python 调,也能起一个本地网页界面;显卡支持 CUDA,苹果芯片和 Intel Arc 也各有对应的后端。想先试效果的话,官方在 HuggingFace 上挂了在线演示。

软件功能



600 多种语言:零样本 TTS 里语言覆盖面最广的一档,冷门语种也在列,不用为小语种单独找方案。

零样本克隆:给一段参考音频就能用那个音色说话,不需要准备训练数据、也不用训练专属模型。

凭描述造音色:不提供参考音频时,可以按说话人属性描述直接生成一个新嗓音。

跨语言保持音色:同一个参考音色可以用来念不同语言的文本,声音特征跟着走。

推理够快:采用扩散语言模型式的架构,在保证质量的同时把生成速度做上去了。

本地运行:pip 安装后可用 Python API 调用,也能启动本地网页界面,音频不必上传到别人服务器。

多种硬件后端:NVIDIA CUDA 之外,苹果芯片走 mps、Intel Arc 走 xpu,都有对应配置。

在线试听:官方在 HuggingFace 上提供演示空间,装之前可以先听效果。

应用截图