Voicebox 是一个开源的 AI 语音工作室,整个运行在你自己的电脑上。它把语音相关的三件事做进同一个桌面应用:用几秒钟的录音克隆出一个声音、把文字转成语音(支持 23 种语言)、在任何输入框里用全局热键说话转文字。它还能让 AI 编程助手用你克隆的声音开口说话。项目代码托管在 GitHub(jamiepine/voicebox),star 数 5.16 万,MIT 协议,免费使用。

它要解决的问题很具体:主流的语音工具是两家云服务各管一半——ElevenLabs 管语音生成(输出),WisprFlow 管语音听写(输入)。二者都是订阅制,你的声音样本和录音要上传到对方服务器。Voicebox 把这两半合并成一套开源软件,放在本地运行:模型文件、声音数据、录音内容全部留在你的机器上,不经过任何第三方服务器。

适合谁用:在意语音数据隐私的个人用户,想在本地做语音合成的开发者,以及想把 AI Agent 接上真实语音的爱好者。硬件门槛不高,CPU 也能跑,只是慢一些(GPU 支持情况见下文)。

一个应用包揽语音输入与输出

这里的「输入」「输出」指语音的两个方向。输出方向:把文字变成声音,叫 TTS(Text-to-Speech,文字转语音),语音克隆就属于这一类。输入方向:把声音变成文字,叫 STT(Speech-to-Text,语音转文字),听写功能属于这一类。Voicebox 把两个方向都做了,还在中间加了一个本地大模型,用来润色听写文本、给声音配「人格」,让整套流程闭环。

作为 ElevenLabs 和 WisprFlow 的开源本地替代,Voicebox 在功能上对标两家之和,在隐私上是另一套逻辑:云服务把声音数据放到自己的服务器,Voicebox 把一切留在本机。

语音克隆与 7 个生成引擎

语音克隆是核心功能之一:提供几秒钟的参考录音,就能零样本克隆出这个声音(零样本指不需要大量训练数据,几秒样本即可)。也可以直接用内置的 50 多个预设音色(来自 Kokoro 和 Qwen CustomVoice 引擎)。

生成引擎一共 7 个,各有侧重:Qwen3-TTS 支持高质量多语言克隆;LuxTTS 轻量(约 1GB 显存),CPU 上也能做到 48kHz 输出;Chatterbox Multilingual 语言覆盖最广,支持阿拉伯语、印地语、斯瓦希里语等 23 种语言;Chatterbox Turbo 体积小(3.5 亿参数),支持 [laugh]、[sigh] 这类带情绪的副语言标签;HumeAI TADA 能生成 700 秒以上的连贯音频;Kokoro 模型极小(8200 万参数),CPU 推理也快。

单次生成最长支持 5 万字符:长文本会自动按句子边界切块,逐块生成后做交叉淡入拼接(crossfade),避免段落间生硬断裂。生成后还可以叠加 8 种后期效果(音高、混响、延迟、合唱、压缩等),基于 Spotify 开源的 pedalboard 音频库。

全局听写:说话代替打字

在系统里按住快捷键说话,松开后语音就被转成文字,直接贴进当前光标所在的输入框。macOS 上支持自动粘贴,剪贴板内容会被暂存、粘贴后恢复,不会被覆盖。转写用的是 OpenAI Whisper 模型(本地运行,也有更快但质量略降的 Turbo 版本)。

每个听写片段会保留原始录音和转写文本,之后可以换更大的 Whisper 模型重新转写,或让本地大模型清理「嗯、啊」之类的口头语再贴入。

给 AI Agent 一张嘴

Voicebox 内置了 MCP 服务器。MCP(Model Context Protocol,模型上下文协议)是 AI 工具之间互操作的标准接口,让 Claude Code、Cursor 这类 AI 编程助手能调用外部能力。接入后,AI 助手可以通过 voicebox.speak 这个工具调用,用你克隆的声音念出任务完成通知、回答问题——本质上任何支持 MCP 的 Agent 都能获得一个会说话的出口。

接入方式是一行命令(以 Claude Code 为例):claude mcp add voicebox,指向本机的 127.0.0.1:17493 端口即可。不依赖 MCP 的程序也可以用 REST API(HTTP 接口)直接调用 /speak,让脚本、自动化流程也能用克隆的声音说话。每个 AI 客户端还可以绑定不同的声音(比如 Claude Code 用 A 声音、Cursor 用 B 声音),说话时屏幕上会显示对应的状态胶囊,你能分辨是谁在发声。

本地运行的技术底子

技术栈是典型的现代桌面应用组合:桌面壳用 Tauri(Rust 编写,比 Electron 更省内存),前端 React + TypeScript,后端 FastAPI(Python),本地数据库 SQLite,语音模型推理走 MLX(Apple Silicon)或 PyTorch。本地的文本润色和声音人格由内置的 Qwen3 大模型(0.6B/1.7B/4B 三档)承担,与 TTS/STT 共用同一套运行时和显存,不额外占资源。

平台支持:macOS(Apple Silicon 和 Intel)、Windows(NVIDIA CUDA 或任意显卡走 DirectML)、Linux(CUDA/ROCm)、Intel Arc,另有 Docker 镜像。CPU 兜底,任何机器都能跑,只是速度不同。

硬件门槛与上手成本

实际开销主要是首次下载模型:7 个 TTS 引擎、Whisper 和 Qwen3 按需下载,都可以单独卸载释放磁盘。生成时 GPU 越快越省时间,但 CPU 也能完成全部功能。对照云服务的持续性订阅费用,Voicebox 本体免费,代价是本机的磁盘、显存和配置时间。

结语

如果你同时需要语音克隆、全局听写和 Agent 语音输出,Voicebox 是目前少有的、把这三件事全部本地化的开源方案。声音数据不出机器,是它区别于云服务最核心的一点;是否值得迁移,取决于你对隐私的看重程度和电脑的配置。