VoxCPM是OpenBMB开源的无分词器(Tokenizer-Free)文本转语音系统,支持中英文混合合成和零样本声音克隆。基于MiniCPM-4骨干网络,采用扩散自回归架构,44.1kHz高采样率输出接近CD音质。GitHub星标8k+,Apache 2.0开源协议。
VoxCPM采用双语言模型架构:Text-Semantic Language Model负责文本语义理解,Residual Acoustic Language Model负责声学特征生成。LocEnc和LocDIT模块确保跨语言语音生成的准确性。通过FSQ约束实现隐式语义-声学解耦,增强表现力和生成稳定性。
VoxCPM支持PyPI一键安装和源码安装两种方式:
pip install voxcpm
或从源码安装:
git clone https://github.com/OpenBMB/VoxCPM.git cd VoxCPM pip install .
推荐Python 3.10+,NVIDIA GPU显存≥8GB。支持Apple Silicon MPS后端(统一内存≥16GB)。VoxCPM2版本已发布,支持更长音频生成。
只需上传几秒钟的目标说话人录音,VoxCPM提取声纹特征后即可克隆音色。Web UI版本(VoxCPM-1.5-TTS-WEB-UI)提供浏览器界面,支持实时语音合成和批量处理。Docker一键部署方案适合团队使用。
对语音AI感兴趣?阅读我们的VibeVoice语音AI教程,或了解Qwen-Audio-3.0语音推理。
VoxCPM是OpenBMB开源的无分词器(Tokenizer-Free)文本转语音系统,支持中英文混合合成和零样本声音克隆。基于MiniCPM-4骨干网络,采用扩散自回归架构,44.1kHz高采样率输出接近CD音质。GitHub星标8k+,Apache 2.0开源协议。