GitHub 2 万星的 VoiceStudio,把 ElevenLabs 整个搬进了你电脑
免费基金定投助手全功能拆解:1300 行8种智能定投策略引擎,怎么把 Excel 仓位表变成会自己算买卖点的定投系统-CSDN博客
https://download.csdn.net/download/weitingfu/93448039?spm=1001.2014.3001.5503
写在前面:先讲一个真实的"烧钱"场景
做口播视频的朋友,大概率经历过这种痛:
- 每月雷打不动给配音平台交订阅费,按字符、按分钟计费;
- 自己的声音素材,先得上传到别人的服务器上才能"克隆";
- 想配一个 10 分钟的视频,额度像漏水的桶,哗哗就没了。
ElevenLabs 的官方价格摆在那里:自动配音每分钟烧 2000-3000 credits,Dubbing Studio 模式(保留说话人、可手动修时间轴)每分钟 5000-10000 credits。$22 一月的 Creator 套餐一共 121,000 credits——一个 10 分钟的无水印 Studio 配音视频,能吃掉你将近一个月的额度。
一个月白干。
而就在 9 月,GitHub 趋势榜被一个叫 VoiceStudio 的开源项目霸榜了整个九月:AI 趋势榜第一梯队、当周新增约 5500 星、总量突破 1.8 万星。
它只做一件事:
把 ElevenLabs 那套云端语音能力,整个搬进你自己的电脑。免费,离线,数据不出门。
一、VoiceStudio 是什么?
一句话:完全本地优先的开源 ElevenLabs 替代品。这是它在 GitHub 仓库里的原话,不是营销文案。
| 关键信息 | 内容 |
|---|---|
| 项目 | debpalash/VoiceStudio(前身 OmniVoice Studio) |
| 开源时间 | 2026 年 4 月,v0.5.0 更名 VoiceStudio |
| 许可证 | AGPL-3.0(应用代码;模型另有许可) |
| 引擎规模 | 16 个 TTS 引擎 + 11 个 ASR 引擎 |
| 语言覆盖 | 官方口径 646 种 |
| 平台 | Windows / macOS / Linux / Docker |
打个比方:ElevenLabs 是云食堂,刷卡点菜,厨房在别人家,吃什么由后厨决定;VoiceStudio 是自家厨房,锅碗瓢盆(模型)全在本地,想怎么炒怎么炒,只是——柴火(显卡和内存)得自己出。
二、六大工作流:不是"一个工具",是一整条语音流水线
VoiceStudio 打开后是一堆工作区(Workspace),核心六个:
1. 语音克隆:3 秒起,零样本
给一段 3-15 秒的干净人声样本(单人、近麦、无背景乐),就能零样本合成这个人的声音。
注意"零样本"三个字——它不是用你的声音去训练模型,而是把你的声音当"prompt"喂给模型。所以不是样本越长越好,5-15 秒、音色干净、语气匹配目标输出,才是关键。
2. 语音设计:不靠样本,靠"捏"
不想用真人声音?可以纯靠参数捏一个新声音:性别、年龄、口音、音高、语速、情绪,一句话描述也能生成。适合做虚拟人设、游戏角色。
3. 视频配音:转录 → 翻译 → 换声 → 对时,一条龙
丢一个本地视频或 YouTube 链接进去,自动完成:
- 人声分离(Demucs):把对白从背景音乐里抠出来;
- 说话人分离(Pyannote / WhisperX):识别"谁在什么时候说了什么";
- 翻译 + 合成:翻译成目标语言,保留原说话人的音色重新合成;
- 导出 MP4:音画同步。
多人对话也能分开保留各自声音——这是 ElevenLabs 收费最贵的那档能力。
4. 有声书 / 故事模式
EPUB / PDF 丢进去,自动分章节,多角色可以分派不同声音,渲染完导出 .m4b。批量做有声书,直接省掉一整条外包产线。
5. 全局听写
系统级快捷键(macOS 是 ⌘+⇧+Space),任何输入框都能实时转文字,还支持接一个本地 LLM 做文字润色。开会记录、码字、采访转写,随叫随到。
6. 批量队列
大量音频 / 视频任务排队跑,每个任务有独立进度;也可以监视一个文件夹,新文件进来自动处理。适合批产场景。
三、技术架构:三层结构,本地优先
VoiceStudio 的技术栈是标准的"桌面壳 + 本地服务"分层:
| 层 | 技术 | 职责 |
|---|---|---|
| 桌面壳 | Electron(正在从 Tauri v2 迁移,最后一个 Tauri 版本会 sunset) | 窗口、托盘、热键、更新 |
| 前端 | React + Vite + Zustand | UI、工作区交互 |
| 后端 | FastAPI,监听 localhost:3900 | 引擎注册表、配音/长音频流水线、OpenAI 兼容 API、MCP Server |
| 存储 | omnivoice_data/(SQLite) | 项目、声音、设置、日志,全在本地磁盘 |
所有推理都在本机完成。GPU 自动检测:NVIDIA 走 CUDA,Apple Silicon 走 MPS/MLX,Linux 走 ROCm,没独显就退回 CPU(代价是速度)。
v0.5.0 还加了远程 Worker:用 join code + 扫码,把重活卸到另一台有 GPU 的机器上跑——自己机器配置不够也能玩。
引擎是"注册表式"设计:OmniVoice(默认)、Kokoro、Chatterbox Turbo、XTTS、Piper、Qwen3 TTS、CosyVoice、GPT-SoVITS……装哪个、用哪个、跑在哪块卡上,一个 Model Catalogue 面板全搞定。
四、给开发者:三个接入姿势
VoiceStudio 真正杀手锏的地方,是它不止是个桌面软件,还是一个本地语音后端:
姿势一:OpenAI 兼容 API,一行代码切换
后端镜像了 OpenAI 的音频接口。原来调 api.openai.com 的代码,改个 base_url 就能切到本地:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:3900/v1",
api_key="local", # loopback 不做鉴权,非空字符串即可
)
speech = client.audio.speech.create(
model="tts-1",
voice="my-cloned-voice",
input="Your local voice pipeline, zero cloud dependency.",
)
speech.stream_to_file("output.mp3")
cURL 快速验证:
curl http://localhost:3900/v1/audio/speech \
-H "Content-Type: application/json" \
-d '{"model": "tts-1", "input": "Made on my own hardware.", "voice": "default", "response_format": "wav"}' \
--output speech.wav
支持 TTS(mp3/opus/aac/flac/wav/pcm)、STT(json/srt/vtt…)、WebSocket 流式实时转录。
姿势二:MCP Server,让 AI Agent 直接"开口"
Claude Desktop、Cursor 等客户端配置:
{
"mcpServers": {
"voicestudio": {
"url": "http://localhost:3900/mcp"
}
}
}
配置好后,AI 就能直接调 generate_speech、clone_voice、transcribe 三个工具——语音能力从一个外部 API 依赖,变成了 Agent 的本地工具。
姿势三:Agent Skills,一行安装
npx skills add debpalash/VoiceStudio
装完有两个 skill 可选:voicestudio(音频工作流:合成语音、转录音频)和 voicestudio-maintainer(仓库维护工作流)。Claude Code、Codex、Cursor 等 skills.sh 兼容的 agent 都能用。
五、安装与硬件:门槛要说清楚
四种安装方式,丰俭由人:
| 方式 | 命令 / 操作 |
|---|---|
| 安装包 | GitHub Releases 下载:Windows MSI、macOS DMG、Linux AppImage |
| Docker | docker run -d -p 127.0.0.1:3900:3900 -v omnivoice-data:/app/omnivoice_data --name voicestudio palashdeb/omnivoice-studio:stable |
| 一键脚本 | curl -fsSL voicestudio.sh/install | sh |
| 源码 | git clone + bun install + bun run dev |
硬件要求(官方口径):
| 项目 | 最低 | 推荐 |
|---|---|---|
| 内存 | 8 GB | 16 GB+ |
| 显存 | 4 GB(TTS 可卸载到 CPU) | 8 GB+(RTX 3060 级) |
| 磁盘 | 10 GB(模型+缓存) | 20 GB+ SSD |
| GPU | 可选,CPU 可跑 | CUDA / MPS / ROCm |
三个坑提前说:
- Intel Mac 跑不了本地后端(PyTorch 没有对应 wheel),只能连远程;
- Linux 需要 glibc 2.39+;
- 首次启动要自动下载默认模型,慢,且 Hugging Face 可能要走镜像。
六、优缺点与同类对比
| 维度 | VoiceStudio | ElevenLabs | GPT-SoVITS |
|---|---|---|---|
| 数据路径 | 本地处理,默认不联网 | 音频/文本上云 | 本地 |
| 成本 | 软件免费,自备硬件 | 订阅/按量计费 | 免费 |
| 离线可用 | 装好模型即可离线 | 需联网 | 可离线 |
| 功能范围 | 克隆/配音/有声书/听写全家桶 | 平台级但按功能收费 | 仅声音克隆 |
| 可定制性 | 引擎/模型/API 全开放 | 受平台限制 | 中等 |
| 维护 | 自管更新、磁盘、算力 | 服务商负责 | 自管 |
优点:数据主权、零订阅、离线可用、六大工作流全家桶、OpenAI 兼容 API + MCP + Skills 三通道接入、引擎注册表可扩展、远程 Worker 借 GPU。
缺点:硬件门槛不低(推荐 16GB 内存 + 8GB 显存);项目处于活跃 Beta(README 明确警告 main 分支可能有破坏性变更,要用 latest release);首次模型下载慢;维护全靠自己。
七、合规红线:先讲清楚再动手
两个底线,必须划清:
- 模型许可证:应用是 AGPL-3.0,但下载的模型保留上游许可。默认 OmniVoice 权重是 CC-BY-NC(非商用)!要商用,请在同一个安装里换 CosyVoice、GPT-SoVITS 这类商用友好引擎。
- 克隆授权:只克隆你有权使用的声音。别人的声音,先拿到授权。
另外:远程功能是手动开启的;使用统计(analytics)默认关闭,就算开了也只发白名单内的、不含内容的元数据——文本、音频、文件名、项目,一律不上传。
八、写在最后:你的电脑,就是你的 ElevenLabs
VoiceStudio 的火,本质上是数据主权的火。
当每个月的配音账单够买两杯咖啡、当声音素材终于不用离开自己的硬盘、当 AI Agent 能直接在本地"开口说话"——云端的便利确实香,但"我的声音我做主"这件事,用过就回不去了。
行动号召:去 GitHub 搜
debpalash/VoiceStudio,下载一个装到你的机器上,拖 10 秒人声进去,敲一句话,点生成。
然后你会发现:原来 ElevenLabs 的"全家桶",自己电脑就能跑。
参考资料:
- GitHub:debpalash/VoiceStudio(README、docs、CHANGELOG)
- byteiota:VoiceStudio: Local Voice Cloning With a Drop-In OpenAI API(2026-09-15)
- ProvenLabs:VoiceStudio: The Free, Local ElevenLabs Alternative(2026-09-02)
- 今日头条 / 科技师等中文社区报道(2026-09 上旬)
互动话题:你还在为哪款"每月订阅"的 AI 工具交保护费?评论区聊聊,下一期我们就拆它。
全文约 3200 字,覆盖 VoiceStudio 的功能工作流、技术架构、开发者接入、安装配置、优缺点对比与合规边界。如果你觉得有帮助,转发给身边做口播、做有声书、做 AI 应用的朋友。
关键词:VoiceStudio;声音克隆;本地优先AI;ElevenLabs替代;视频配音;开源语音工具;MCP语音集成

138

被折叠的 条评论
为什么被折叠?



