IndexTTS2语音克隆安装教程:B站开源实时语音克隆与情绪控制

2026-08-10 | AI Tools Hub

IndexTTS2是B站语音团队开源的语音克隆模型,支持实时语音克隆、情绪输入、语速控制。GitHub: github.com/index-tts/IndexTTS2

环境要求

Python 3.8+ | PyTorch 2.0+ | CUDA 11.8+ | GPU建议8GB+显存

安装步骤

git clone https://github.com/index-tts/IndexTTS2.git
cd IndexTTS2
pip install -r requirements.txt
pip install torch torchvision torchaudio

模型下载

首次运行会自动下载预训练模型(GPT模型+声码器+情绪模型)。也可手动下载放到model_dir目录。

核心架构

文本前端:文本正则化→音素转换→韵律预测

GPT模型:UnifiedVoice,生成自回归语音token

声码器BigVGANv2:梅尔频谱图→高质量语音波形

情绪控制:基于Qwen的情绪模型,支持7种标准情绪(开心/悲伤/愤怒/惊讶/恐惧/厌恶/中性)

使用方式

from indextts2 import IndexTTS2
tts = IndexTTS2(model_dir="models")
tts.synthesize("你好世界", output="output.wav", emotion="happy", speed=1.0)

与VoxCPM对比

IndexTTS2:支持情绪输入和语速控制,适合内容创作。VoxCPM:零样本声音克隆,3秒音频即可克隆。两者可互补使用。

相关:VoxCPM语音克隆教程VibeVoice语音AI

📚 常见问题

IndexTTS2语音克隆安装是什么?

IndexTTS2是B站语音团队开源的语音克隆模型,支持实时语音克隆、情绪输入、语速控制。GitHub: github.com/index-tts/IndexTTS2