应用介绍
市面上的语音合成,能选的语言基本就是那几十种主流的。想要一个小语种的配音,要么根本没有,要么效果差到没法听。想换成自己的声音,通常还得先录一堆素材去训练一个专属模型。
OmniVoice 把这两件事一起解决了:一个覆盖 600 多种语言的零样本语音合成模型。零样本的意思是不用训练——给它一段参考音频,它就能用这个声音去念你给的文本,语言换了也照样是这个声音。
除了照着参考音频克隆,它还有另一条路:不给音频,直接描述你要什么样的嗓音(说话人属性),让它凭空造一个出来。
项目来自小米 AI 实验室的 Next-gen Kaldi 团队,Apache-2.0 开源。模型和代码都能下到本地跑——pip 装完可以用 Python 调,也能起一个本地网页界面;显卡支持 CUDA,苹果芯片和 Intel Arc 也各有对应的后端。想先试效果的话,官方在 HuggingFace 上挂了在线演示。
600 多种语言:零样本 TTS 里语言覆盖面最广的一档,冷门语种也在列,不用为小语种单独找方案。
零样本克隆:给一段参考音频就能用那个音色说话,不需要准备训练数据、也不用训练专属模型。
凭描述造音色:不提供参考音频时,可以按说话人属性描述直接生成一个新嗓音。
跨语言保持音色:同一个参考音色可以用来念不同语言的文本,声音特征跟着走。
推理够快:采用扩散语言模型式的架构,在保证质量的同时把生成速度做上去了。
本地运行:pip 安装后可用 Python API 调用,也能启动本地网页界面,音频不必上传到别人服务器。
多种硬件后端:NVIDIA CUDA 之外,苹果芯片走 mps、Intel Arc 走 xpu,都有对应配置。
在线试听:官方在 HuggingFace 上提供演示空间,装之前可以先听效果。
OmniVoice 把这两件事一起解决了:一个覆盖 600 多种语言的零样本语音合成模型。零样本的意思是不用训练——给它一段参考音频,它就能用这个声音去念你给的文本,语言换了也照样是这个声音。
除了照着参考音频克隆,它还有另一条路:不给音频,直接描述你要什么样的嗓音(说话人属性),让它凭空造一个出来。
项目来自小米 AI 实验室的 Next-gen Kaldi 团队,Apache-2.0 开源。模型和代码都能下到本地跑——pip 装完可以用 Python 调,也能起一个本地网页界面;显卡支持 CUDA,苹果芯片和 Intel Arc 也各有对应的后端。想先试效果的话,官方在 HuggingFace 上挂了在线演示。
软件功能
600 多种语言:零样本 TTS 里语言覆盖面最广的一档,冷门语种也在列,不用为小语种单独找方案。
零样本克隆:给一段参考音频就能用那个音色说话,不需要准备训练数据、也不用训练专属模型。
凭描述造音色:不提供参考音频时,可以按说话人属性描述直接生成一个新嗓音。
跨语言保持音色:同一个参考音色可以用来念不同语言的文本,声音特征跟着走。
推理够快:采用扩散语言模型式的架构,在保证质量的同时把生成速度做上去了。
本地运行:pip 安装后可用 Python API 调用,也能启动本地网页界面,音频不必上传到别人服务器。
多种硬件后端:NVIDIA CUDA 之外,苹果芯片走 mps、Intel Arc 走 xpu,都有对应配置。
在线试听:官方在 HuggingFace 上提供演示空间,装之前可以先听效果。

