应用介绍
想给自己的项目加个语音克隆——配音、有声书、语音助手——大多数开源 TTS 要么模型几个 G 塞不进本地显卡,要么速度慢到没法实时,要么输出还停在 24kHz 听着发闷。三样凑不齐。
LuxTTS 想把这三样一起给你。它是个基于 zipvoice 的轻量级语音克隆模型,给一段参考音频就能克隆音色合成新语音,官方说克隆质量能对标比它大十倍的模型。速度上单张 GPU 能到 150 倍实时,在 CPU 上也快过实时;整个模型压进 1GB 显存以内,几乎任何本地显卡都装得下。
音质是它另一个卖点:输出 48kHz 高清语音,而多数 TTS 模型停在 24kHz。用法很简单,加载模型、用 encode_prompt 编码一段参考音、generate_speech 出声,几行 Python 搞定,采样步数(num_steps)可调,3-4 步是质量和速度的甜点。
可以本地跑,也提供 Colab 和 HuggingFace Space 在线试。Apache 2.0 开源,5.3K Star。
高质量语音克隆:给一段参考音频即可克隆音色并合成新语音,官方称克隆质量对标比它大十倍的模型。
150 倍实时速度:单张 GPU 上可达 150 倍实时生成速度,在 CPU 上也能快过实时,适合批量和实时场景。
48kHz 高清输出:输出 48kHz 采样率的清晰语音,高于多数 TTS 模型常见的 24kHz,听感更自然。
1GB 显存即可:整个模型压进 1GB 显存以内,几乎任何本地 GPU 都能跑,不挑硬件。
几行代码接入:加载模型、encode_prompt 编码参考音、generate_speech 合成,几行 Python 即可集成到自己的项目。
多种运行方式:支持本地(CUDA/CPU/Mac MPS)、Google Colab 和 HuggingFace Space,想快速试或正式部署都行。
LuxTTS 想把这三样一起给你。它是个基于 zipvoice 的轻量级语音克隆模型,给一段参考音频就能克隆音色合成新语音,官方说克隆质量能对标比它大十倍的模型。速度上单张 GPU 能到 150 倍实时,在 CPU 上也快过实时;整个模型压进 1GB 显存以内,几乎任何本地显卡都装得下。
音质是它另一个卖点:输出 48kHz 高清语音,而多数 TTS 模型停在 24kHz。用法很简单,加载模型、用 encode_prompt 编码一段参考音、generate_speech 出声,几行 Python 搞定,采样步数(num_steps)可调,3-4 步是质量和速度的甜点。
可以本地跑,也提供 Colab 和 HuggingFace Space 在线试。Apache 2.0 开源,5.3K Star。
软件功能
高质量语音克隆:给一段参考音频即可克隆音色并合成新语音,官方称克隆质量对标比它大十倍的模型。
150 倍实时速度:单张 GPU 上可达 150 倍实时生成速度,在 CPU 上也能快过实时,适合批量和实时场景。
48kHz 高清输出:输出 48kHz 采样率的清晰语音,高于多数 TTS 模型常见的 24kHz,听感更自然。
1GB 显存即可:整个模型压进 1GB 显存以内,几乎任何本地 GPU 都能跑,不挑硬件。
几行代码接入:加载模型、encode_prompt 编码参考音、generate_speech 合成,几行 Python 即可集成到自己的项目。
多种运行方式:支持本地(CUDA/CPU/Mac MPS)、Google Colab 和 HuggingFace Space,想快速试或正式部署都行。


