
Voicebox 是一款免费开源的本地 AI 语音工作室,把声音克隆、文字转语音、语音转文字和多轨音频编辑放进同一个桌面应用。它支持 7 种 TTS 引擎和 23 种语言,既能用一段短录音创建声音档案,也能使用预设声音生成旁白。
它更适合愿意在自己的电脑上下载并运行模型的创作者、播客制作者、无障碍工具用户和开发者。Voicebox 不要求注册账号,声音样本、生成记录和模型推理留在本机;代价是首次下载体积较大,生成速度也会明显受 CPU、显卡和内存影响。
产品功能
- 声音克隆与预设声音:可以上传或录制声音样本建立个人声音档案,也能使用 Kokoro、Qwen CustomVoice 等引擎提供的预设声音。
- 多引擎语音生成:内置 Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual、Chatterbox Turbo、HumeAI TADA 和 Kokoro,可按语言、速度、显存占用和表现力切换。
- 全局听写与转写:通过快捷键在其他应用中录音,使用 Whisper 在本地转写;可选的小型 Qwen3 模型还能清理口头语、标点和自我修正。
- 多轨故事编辑:Stories 编辑器可把不同声音片段放入时间轴,调整顺序、间隔和轨道后导出完整音频。
- 语音后期处理:提供变调、混响、延迟、合唱、压缩、增益和高低通滤波等效果,并可保存效果预设。
- REST API 与 MCP:本地服务提供生成、播放、转写和声音档案接口,MCP 客户端可调用
voicebox.speak等工具让编码智能体播报结果。

产品特点
Voicebox 的优势是把语音输入与输出放在同一套本地工作流里。用户可以先用 Whisper 听写,再让本地小模型整理文本,最后用克隆声音朗读;开发者也能通过 REST API 或 MCP 把这条链路接入自己的应用和智能体。Tauri 桌面端配合本地 Python 服务,避免了必须把声音上传到商业云平台的前提。
它并非零门槛的在线工具。官方给出的最低配置是 8GB 内存和 5GB 可用空间,建议准备 16GB 以上内存、10GB 以上空间以及支持 CUDA 的 NVIDIA 显卡。CPU 模式可以运行,但速度会慢很多;Linux 暂无预编译桌面安装包,需要按官方说明从源码构建。Windows 安装包目前还可能触发 SmartScreen 未识别应用提示。
使用教程
- 前往官方 Download 页面。macOS 可选择 Apple Silicon 或 Intel 版本,Windows 64 位用户下载 MSI;Linux 用户按官方仓库说明从源码构建。
- 安装并启动 Voicebox。首次使用某个 TTS 引擎时,应用会自动下载模型;官方列出的模型体积约从 350MB 到 8GB 不等。
- 进入 Profiles,点击 + New Profile,填写名称、主要语言和可选说明。
- 上传 WAV、MP3 或 M4A 文件,或直接录制 10 至 30 秒清晰语音。应使用自己的声音、已获明确授权的声音或具有合法许可的素材。
- 进入 Generate,选择声音档案和 TTS 引擎,输入文字后点击 Generate。生成完成后可以试听、下载,记录也会保存在本地历史中。
- 需要多角色内容时,进入 Stories 新建项目,将生成片段加入不同轨道,调整时间线后导出音频。
- 需要连接智能体时,在 Voicebox 的 MCP 设置中确认本地服务,然后按照官方文档把
http://127.0.0.1:17493/mcp添加到支持 MCP 的客户端。

使用场景
- 视频与播客旁白:用自己的声音档案批量生成旁白,再通过多轨时间线组织不同角色和段落。
- 本地语音听写:在文档、聊天和开发工具中通过全局快捷键输入长文本,减少键盘录入。
- 无障碍与个人辅助:在获得声音权利的前提下,为无法持续说话的人保留或生成个人化语音。
- 游戏和互动角色原型:用多种声音档案与语气控制制作角色对白,适合验证叙事和交互方案。
- 智能体语音通知:通过 MCP 或 REST API 让本地智能体播报任务完成、错误和需要确认的信息。
价格
Voicebox 采用 MIT 许可证,桌面应用与源代码均可免费使用,没有账号、云端订阅或应用内升级费用。用户仍需要承担本地硬件、磁盘空间、电力和模型下载流量;如果为了更快生成而升级显卡或部署远程 GPU,也会产生额外成本。
使用评价
Voicebox 适合重视隐私、希望同时处理听写和语音生成,并且能接受本地模型资源占用的用户。七种 TTS 引擎、时间线编辑、后期效果和 MCP 接口让它不只是一个简单的声音克隆演示,而是一套可以继续扩展的语音工作流。
不足主要集中在安装体积、硬件要求和平台成熟度。低配置电脑可以使用 CPU 模式,但不适合追求实时生成;不同引擎对中文、情绪标签和声音档案的支持并不相同,切换模型前需要查看兼容说明。声音克隆也有明确的权利边界:官方无法替用户验证样本所有权,冒充、诈骗、绕过声纹验证或未经许可的商业使用都不应被接受。
官方资料
数据统计
相关导航


Orpheus TTS

荐即梦AI

Podcast

网易天音

逗哥配音

音述 AI












