📌 项目日期:2026年9月 | 数据来源:GitHub官方仓库 | 星数:15,000+
VoiceStudio 是 GitHub 上 1.5 万星的开源语音工作室,定位为"完全本地运行的 ElevenLabs 替代品"。它把语音克隆、语音设计、视频配音、实时听写四大能力打包进一个桌面应用,所有推理都在你自己的 GPU 上完成——没有订阅费、没有字符额度、音频数据不出本机。
对内容创作者来说,这意味着可以无限量生成配音而不用担心账单。其他本地语音方案可参考 IndexTTS2语音克隆教程 和 VoxCPM语音合成教程 对比选择。
| 功能 | 说明 | 对标 |
|---|---|---|
| 语音克隆 | 几秒样本即可克隆音色 | ElevenLabs Voice Cloning |
| 语音设计 | 从零生成指定风格的虚拟音色 | ElevenLabs Voice Design |
| 视频配音 | 导入视频自动生成对齐配音 | 专业配音工作流 |
| 实时听写 | 本地Whisper转写 | Otter/讯飞听见 |
| 多语言 | 中英等多语种合成 | - |
# 环境:Windows/Linux, NVIDIA GPU 8GB+ 显存推荐
git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
# 创建环境并安装依赖
python -m venv venv
source venv/bin/activate # Windows: venv\Scripts\activate
pip install -r requirements.txt
# 下载模型权重(首次运行自动下载)
python app.py
# 浏览器访问
# http://localhost:7860
步骤1: 准备 5-30 秒清晰人声样本(WAV,无背景音)
步骤2: 界面选择 "Voice Clone" → 上传样本
步骤3: 输入要合成的文本,选择克隆的音色
步骤4: 点击生成 → 导出 WAV/MP3
视频配音流程:
导入MP4 → 自动提取原音轨 → 生成翻译文本
→ 选择目标音色 → 生成配音 → 音画对齐导出
| 方案 | 优势 | 劣势 |
|---|---|---|
| VoiceStudio | 全功能整合,UI友好,完全免费本地 | 需要较好GPU,克隆质量略逊ElevenLabs |
| ElevenLabs | 音质天花板,API稳定 | 贵,数据上传云端 |
| IndexTTS2 | 中文效果顶尖,情感控制好 | 需自行搭建服务 |
| CosyVoice | 阿里出品,多语言强 | 工程化程度一般 |
推荐场景:
不推荐场景:
VoiceStudio 是 GitHub 上 1.5 万星的开源语音工作室,定位为"完全本地运行的 ElevenLabs 替代品"。它把语音克隆、语音设计、视频配音、实时听写四大能力打包进一个桌面应用,所有推理都在你自己的 GPU 上完成——没有订阅费、没有字符额度、音频数据不出本机。
短视频/播客批量配音,控制成本