yovoice

yovoice

本地运行的配音与音色复刻工具

AI官网

应用介绍

做视频配旁白,在线 TTS 按字符计费,一段两千字的稿子改五版就是五份钱;想换个更贴合的音色,还得把原声素材传到别人服务器上。yovoice 把这一套搬回本机:模型跑在自己的显卡上,不调任何云端 API,不按字收费,导进去一段一分钟以内的参考音频就能复刻音色,生成的人声还能指定情绪。

它不是一个命令行脚本套壳,而是完整的创作台——左边是作品列表,中间写稿,右边调音色、表达方式和情绪强度,底部直接是波形和播放器,改一句重生成一句,历史版本留着可回溯。表达方式给了四条路:跟随参考音色、参考一段演绎、用情绪预设微调、或者干脆用文字描述你想要的语气。macOS 14+(Apple Silicon)和 Windows 10/11 都有安装包,Apache-2.0 开源。

软件功能



本地生成不计费:模型和推理都在本机,不经过云端 API,稿子改多少版都不产生额外费用,内容也不用上传给第三方。

音色复刻:导入或现场录一段 1 到 60 秒的参考音频就能复刻音色,VoxCPM2 还支持不给参考音频、直接用文字描述设计一个新音色,以及带转写辅助的可控克隆。

情绪与表达控制:四种表达方式可选——跟随参考音色、参考演绎、情绪预设调节、文字指导,情绪强度还能用滑杆连续调,不是只有一个平铺直叙的朗读腔。

多种本地模型:通过 audio.cpp 运行 IndexTTS 2.0 / 2.5 和 VoxCPM2,模型在应用内下载且支持断点续传,也可以导入自己的 GGUF 权重。

硬件加速:Apple Silicon 上走 Metal,Windows 上支持 CPU、NVIDIA CUDA 以及实验性的 Vulkan,CUDA 引擎可以在设置里单独下载。

完整音频工作流:导入或录制参考音频、裁剪片段、试听、导出成品,作品按项目管理,历史生成记录随时翻回去对比。

48 kHz 输出:VoxCPM2 提供 48 kHz 采样率输出,并自动处理多语种文本,配到视频里不会一听就是低采样率的机器音。

命令行与 Agent Skill:附带独立 CLI,不开桌面端也能跑;还打包成了 Agent Skill,可以让 AI 助手自己装好引擎和模型,然后按一句话指令读稿生成配音文件。

数据留在本地:项目、音色和设置都存在用户目录下的 .yovoice 里,卸载不会清掉,换机拷目录就能接着用。

应用截图