IndexTTS2是B站语音团队开源的语音克隆模型,支持实时语音克隆、情绪输入、语速控制。GitHub: github.com/index-tts/IndexTTS2
Python 3.8+ | PyTorch 2.0+ | CUDA 11.8+ | GPU建议8GB+显存
git clone https://github.com/index-tts/IndexTTS2.git cd IndexTTS2 pip install -r requirements.txt pip install torch torchvision torchaudio
首次运行会自动下载预训练模型(GPT模型+声码器+情绪模型)。也可手动下载放到model_dir目录。
文本前端:文本正则化→音素转换→韵律预测
GPT模型:UnifiedVoice,生成自回归语音token
声码器BigVGANv2:梅尔频谱图→高质量语音波形
情绪控制:基于Qwen的情绪模型,支持7种标准情绪(开心/悲伤/愤怒/惊讶/恐惧/厌恶/中性)
from indextts2 import IndexTTS2
tts = IndexTTS2(model_dir="models")
tts.synthesize("你好世界", output="output.wav", emotion="happy", speed=1.0)
IndexTTS2:支持情绪输入和语速控制,适合内容创作。VoxCPM:零样本声音克隆,3秒音频即可克隆。两者可互补使用。
相关:VoxCPM语音克隆教程、VibeVoice语音AI。
IndexTTS2是B站语音团队开源的语音克隆模型,支持实时语音克隆、情绪输入、语速控制。GitHub: github.com/index-tts/IndexTTS2