VoxCPM开源语音合成教程:无分词器TTS与零样本声音克隆部署指南

2026-08-04 | AI Tools Hub

VoxCPM是OpenBMB开源的无分词器(Tokenizer-Free)文本转语音系统,支持中英文混合合成和零样本声音克隆。基于MiniCPM-4骨干网络,采用扩散自回归架构,44.1kHz高采样率输出接近CD音质。GitHub星标8k+,Apache 2.0开源协议。

技术架构

VoxCPM采用双语言模型架构:Text-Semantic Language Model负责文本语义理解,Residual Acoustic Language Model负责声学特征生成。LocEnc和LocDIT模块确保跨语言语音生成的准确性。通过FSQ约束实现隐式语义-声学解耦,增强表现力和生成稳定性。

安装部署

VoxCPM支持PyPI一键安装和源码安装两种方式:

pip install voxcpm

或从源码安装:

git clone https://github.com/OpenBMB/VoxCPM.git
cd VoxCPM
pip install .

推荐Python 3.10+,NVIDIA GPU显存≥8GB。支持Apple Silicon MPS后端(统一内存≥16GB)。VoxCPM2版本已发布,支持更长音频生成。

声音克隆实战

只需上传几秒钟的目标说话人录音,VoxCPM提取声纹特征后即可克隆音色。Web UI版本(VoxCPM-1.5-TTS-WEB-UI)提供浏览器界面,支持实时语音合成和批量处理。Docker一键部署方案适合团队使用。

对语音AI感兴趣?阅读我们的VibeVoice语音AI教程,或了解Qwen-Audio-3.0语音推理

📚 常见问题

VoxCPM开源语音合成是什么?

VoxCPM是OpenBMB开源的无分词器(Tokenizer-Free)文本转语音系统,支持中英文混合合成和零样本声音克隆。基于MiniCPM-4骨干网络,采用扩散自回归架构,44.1kHz高采样率输出接近CD音质。GitHub星标8k+,Apache 2.0开源协议。