audio.cpp

audio.cpp

纯C++本地语音AI推理引擎

AI官网

应用介绍

想在本地跑个语音模型,真正的门槛从来不是显卡。是 conda 建了第三个环境、是 torch 和 CUDA 版本对不上、是这个模型要 transformers 4.38 那个要 4.44、是一个 requirements.txt 装二十分钟最后报 ImportError。等你把环境弄通,兴致已经没了。

audio.cpp 把这条路换掉了。它是纯 C++ 的音频推理引擎,底层用 ggml,推理核心一行 Python 都不需要。语音合成、语音识别、声音克隆、变声、人声分离、说话人分离、VAD、音乐生成——这些原本散在几十个各自为政的 Python 仓库里的能力,在这里共用同一套运行时、同一套 CLI 和同一个 API 服务。

模型这块已经接进 60 多个家族、85 个以上的变体,Qwen3-TTS、Qwen3-ASR、Fish Audio、CosyVoice3、FireRedTTS3、MiniMax Music 3 这些都在列,全部支持 GGUF 量化加载,Q8 包在部分路径上比 16 位快约 1.5 倍、显存峰值低三分之一左右。性能是这个项目最上心的部分:官方给出的对比里,多条 TTS 路径比对应的 Python 官方实现快 1.8 到 8 倍,端到端延迟降低 45%~85%。

要说清楚的是,目前重点优化的是 CUDA。HIP/ROCm、Vulkan、Metal 和纯 CPU 后端都能跑,但性能和模型覆盖程度不如 N 卡这条线,选型前值得先看一眼自己的硬件。

软件功能



一套运行时覆盖全流程:语音合成、识别、声音克隆、变声、说话人分离、VAD、人声分离、强制对齐、音乐生成共用同一套框架,不用为每个模型单独搭一个环境。

不依赖 Python:推理核心是 C++ 加 ggml,编译出来就是可执行文件和服务端,部署时不用带解释器和几百个包,也不会再撞版本冲突。

GGUF 量化:所有已发布的模型家族都支持 GGUF 加载,实测 Q8 包在 Higgs Audio、Fish Audio、Voxtral 等路径上最高快约 1.53 倍,显存峰值降低约 37%。

WebUI 与 Arena 对比界面:自带原生 WebUI 直接在浏览器里试模型;Arena 标签页可以用同一段输入同时排队跑多个模型或多个量化变体,出结果后并排看指标再挑。

统一 API 服务:CLI 和 HTTP 服务共用同一套入口,接自己的语音助手、配音工具或者批量处理脚本都是直接调接口,还有实验性的 JSON 流水线做多步工作流。

多后端多平台:CUDA、HIP/ROCm、Vulkan、Metal 和纯 CPU 后端都能编,Windows、Linux、macOS 通用,NVIDIA、AMD、Apple Silicon 和无显卡的机器都覆盖到。

内置音频工具:降噪、增强、重采样、STFT/ISTFT 这些前后处理直接做进框架,不用再拉一堆音频库来补齐流水线。

与 Python 实现对齐验证:项目自带 parity 测试工具,把输出和 Python 官方实现逐项比对,移植不是"跑通就行",结果要对得上。