Voicebox

13小时前更新 7 0 0

免费开源的本地AI语音工作室,支持声音克隆、听写、多轨编辑与MCP。

所在地:
全球
语言:
中文、英语等23种语言
收录时间:
2026-07-28

Voicebox 是一款免费开源的本地 AI 语音工作室,把声音克隆、文字转语音、语音转文字和多轨音频编辑放进同一个桌面应用。它支持 7 种 TTS 引擎和 23 种语言,既能用一段短录音创建声音档案,也能使用预设声音生成旁白。

它更适合愿意在自己的电脑上下载并运行模型的创作者、播客制作者、无障碍工具用户和开发者。Voicebox 不要求注册账号,声音样本、生成记录和模型推理留在本机;代价是首次下载体积较大,生成速度也会明显受 CPU、显卡和内存影响。

产品功能

  • 声音克隆与预设声音:可以上传或录制声音样本建立个人声音档案,也能使用 Kokoro、Qwen CustomVoice 等引擎提供的预设声音。
  • 多引擎语音生成:内置 Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual、Chatterbox Turbo、HumeAI TADA 和 Kokoro,可按语言、速度、显存占用和表现力切换。
  • 全局听写与转写:通过快捷键在其他应用中录音,使用 Whisper 在本地转写;可选的小型 Qwen3 模型还能清理口头语、标点和自我修正。
  • 多轨故事编辑:Stories 编辑器可把不同声音片段放入时间轴,调整顺序、间隔和轨道后导出完整音频。
  • 语音后期处理:提供变调、混响、延迟、合唱、压缩、增益和高低通滤波等效果,并可保存效果预设。
  • REST API 与 MCP本地服务提供生成、播放、转写和声音档案接口,MCP 客户端可调用 voicebox.speak 等工具让编码智能体播报结果。
Voicebox多轨故事编辑器
Voicebox 官方界面展示多角色语音片段、轨道排列与音频导出流程

产品特点

Voicebox 的优势是把语音输入与输出放在同一套本地工作流里。用户可以先用 Whisper 听写,再让本地小模型整理文本,最后用克隆声音朗读;开发者也能通过 REST API 或 MCP 把这条链路接入自己的应用和智能体。Tauri 桌面端配合本地 Python 服务,避免了必须把声音上传到商业云平台的前提。

它并非零门槛的在线工具。官方给出的最低配置是 8GB 内存和 5GB 可用空间,建议准备 16GB 以上内存、10GB 以上空间以及支持 CUDA 的 NVIDIA 显卡。CPU 模式可以运行,但速度会慢很多;Linux 暂无预编译桌面安装包,需要按官方说明从源码构建。Windows 安装包目前还可能触发 SmartScreen 未识别应用提示。

使用教程

  1. 前往官方 Download 页面。macOS 可选择 Apple Silicon 或 Intel 版本,Windows 64 位用户下载 MSI;Linux 用户按官方仓库说明从源码构建。
  2. 安装并启动 Voicebox。首次使用某个 TTS 引擎时,应用会自动下载模型;官方列出的模型体积约从 350MB 到 8GB 不等。
  3. 进入 Profiles,点击 + New Profile,填写名称、主要语言和可选说明。
  4. 上传 WAV、MP3 或 M4A 文件,或直接录制 10 至 30 秒清晰语音。应使用自己的声音、已获明确授权的声音或具有合法许可的素材。
  5. 进入 Generate,选择声音档案和 TTS 引擎,输入文字后点击 Generate。生成完成后可以试听、下载,记录也会保存在本地历史中。
  6. 需要多角色内容时,进入 Stories 新建项目,将生成片段加入不同轨道,调整时间线后导出音频。
  7. 需要连接智能体时,在 Voicebox 的 MCP 设置中确认本地服务,然后按照官方文档把 http://127.0.0.1:17493/mcp 添加到支持 MCP 的客户端。
Voicebox创建声音档案界面
Voicebox 可通过上传、录音或系统音频创建声音档案;使用他人声音前应取得授权

使用场景

  • 视频与播客旁白:用自己的声音档案批量生成旁白,再通过多轨时间线组织不同角色和段落。
  • 本地语音听写:在文档、聊天和开发工具中通过全局快捷键输入长文本,减少键盘录入。
  • 无障碍与个人辅助:在获得声音权利的前提下,为无法持续说话的人保留或生成个人化语音。
  • 游戏和互动角色原型:用多种声音档案与语气控制制作角色对白,适合验证叙事和交互方案。
  • 智能体语音通知:通过 MCP 或 REST API 让本地智能体播报任务完成、错误和需要确认的信息。

价格

Voicebox 采用 MIT 许可证,桌面应用与源代码均可免费使用,没有账号、云端订阅或应用内升级费用。用户仍需要承担本地硬件、磁盘空间、电力和模型下载流量;如果为了更快生成而升级显卡或部署远程 GPU,也会产生额外成本。

使用评价

Voicebox 适合重视隐私、希望同时处理听写和语音生成,并且能接受本地模型资源占用的用户。七种 TTS 引擎、时间线编辑、后期效果和 MCP 接口让它不只是一个简单的声音克隆演示,而是一套可以继续扩展的语音工作流。

不足主要集中在安装体积、硬件要求和平台成熟度。低配置电脑可以使用 CPU 模式,但不适合追求实时生成;不同引擎对中文、情绪标签和声音档案的支持并不相同,切换模型前需要查看兼容说明。声音克隆也有明确的权利边界:官方无法替用户验证样本所有权,冒充、诈骗、绕过声纹验证或未经许可的商业使用都不应被接受。

官方资料

数据统计

相关导航

暂无评论

none
暂无评论...