📢gitzw.com上线了,功能陆续更新中,如有问题或反馈请在下方反馈/建议中给我们留言。
30 分钟掌握 Voicebox:本地 AI 语音工作室

30 分钟掌握 Voicebox:本地 AI 语音工作室

📌 At a glance

Voicebox 是一个开源的本地 AI 语音工作室,支持克隆声音、生成多语言语音和语音输入输出。本教程将帮助你快速上手并将其集成到你的项目中。

🎯 入门📖 7 chapters⏱ ≈28 min read🔄 Updated 2026-07-20📅 Source as of 2026-07
Source:github.com/jamiepine/voicebox★ 43,432

1. 了解 Voicebox:功能与优势

本章要解决的是让你对 Voicebox 有个全面的了解,知道它能干嘛,有哪些好处。读完这章之后,你会明白为什么选择 Voicebox 而不是其他类似工具。

首先,确保你已经访问了 Voicebox 的官网 voicebox.sh,对这个项目有了初步的印象。我们先来聊聊 Voicebox 是什么。

什么是 Voicebox?

Voicebox 是一个 本地化的 AI 语音工作室,简单来说就是个免费开源的应用程序,可以替代市场上的一些收费产品比如 ElevenLabs 和 WisprFlow。它的主要功能包括:

  • 克隆声音:只需要几秒钟的声音样本就能克隆一个人的声音。
  • 生成语音:支持 23 种语言,通过 7 种不同的文本转语音引擎生成高质量的语音。
  • 语音输入:可以通过全局热键进行语音输入,并且支持无障碍自动粘贴等功能。
  • 个性化代理声音:你可以为任何智能助手设置特定的声音。

和其他云端服务不同,Voicebox 不仅负责输出(如 ElevenLabs),还负责输入(如 WisprFlow)。而且它自带一个本地的语言模型来进行微调和个人化设置。

主要特点

接下来具体看看 Voicebox 的一些亮点:

特性 描述
完整隐私 所有的模型、声音数据和录音都保存在你的机器上,不会上传到云服务器
多种 TTS 引擎 支持 Qwen3-TTS, Qwen CustomVoice, LuxTTS 等七种引擎
声音克隆和预设 可以从少量样本零样本克隆声音,或者使用 Kokoro 和 Qwen CustomVoice 提供的 50+ 预设声音
支持多种语言 包括英语、阿拉伯语、日语、印地语、斯瓦希里语等多种语言
后期处理效果 提供变调、混响、延迟、合唱、压缩和滤波器等后期处理选项
生动的演讲 使用 Chatterbox Turbo 和 Qwen CustomVoice 实现笑声、叹息等非言语标记控制以及自然的语言交付控制
没有长度限制 自动分块和交叉淡入淡出长篇脚本、文章或章节
故事编辑器 多轨道时间线用于对话、播客和叙事
输入方式多样 全局听写热键支持推按启动模式和切换模式,在 macOS 上经过无障碍验证的自动粘贴功能,在每个文本字段中都有内置麦克风,并采用基于 Whisper 的语音识别技术
输出代理声音 单次函数调用 voicebox.speak 就可以让任何支持 MCP 的代理(如 Claude Code, Cursor, Cline)用你克隆的声音跟你交流
角色个性 可以为任意角色配置自由形式的人物设定,并通过绑定的本地语言模型进行创作、改写或回复;这些模式也可以通过 MCP 被代理调用
API 首选 提供 REST API 和内置的 MCP 服务器方便集成到自定义应用和代理
原生性能 使用 Rust 编写的 Tauri 架构而不是 Electron

实际应用场景举例

假设你想制作一段视频解说,但是不想自己配音。你可以先录制一小段解说员的声音作为样本,然后用 Voicebox 克隆这个声音。接着利用 Story Editor 来编写脚本并调整好各个部分的时间轴。最后使用其中一个 TTS 引擎将文字转换成音频,并添加适当的后期处理效果。这样就可以得到一段听起来非常专业的解说音频了!

总结一下

  • Voicebox 是一个集成了声音克隆和生成能力的强大工具。
  • 它的所有操作都在本地完成,保证了用户的隐私安全。
  • 提供丰富的功能选项和技术支持,满足各种复杂的使用需求。

希望你看完这一章之后对 Voicebox 已经有了比较清晰的认识!

2. 安装 Voicebox:跨平台指南

本章我们要搞定 Voicebox 的安装,确保你能在自己的电脑上顺利启动这个强大的 AI 语音工作室。读完这一章,你就能在本地运行 Voicebox 并开始克隆声音了。

首先,你需要确认你的系统符合要求。Voicebox 支持 macOS、Windows、Linux 以及一些特定的 GPU 加速选项(比如 CUDA 或 ROCm)。如果你不确定自己的系统是否支持,可以去项目的 GitHub 页面查一下详细信息

我们先来下载安装包。打开浏览器,访问 Voicebox 的官方网站,然后点击页面上的 "Download" 按钮。你会看到不同操作系统对应的下载链接,根据你的系统选择合适的文件下载。

接着,找到你刚刚下载的安装包。如果是 Windows 用户,双击 .exe 文件;macOS 用户双击 .dmg 文件;Linux 用户则解压 tar 包并进入目录。按照屏幕上的提示一步步来就行。

# 如果你是 Linux 用户,可能需要执行以下命令来解压和运行
tar -xvf voicebox-linux.tar.gz
cd voicebox-linux
./voicebox

如果你遇到权限问题,在 Linux 上可以尝试加上 sudo

sudo ./voicebox

如果一切顺利,你应该能看到 Voicebox 的主界面弹出来。这表示安装成功啦!如果没有看到界面或者出现了错误提示,请检查是不是下载的文件有问题,或者参考官方文档中的故障排除部分。

举个例子来说,假设你在 Windows 上工作,并且已经下载好了 .exe 文件。双击后会有一个进度条显示安装过程,完成后桌面上会出现一个 Voicebox 图标的快捷方式。点击图标就可以启动程序了。

本章小结

  • 我们从官网下载了适合自己系统的 Voicebox 安装包。
  • 根据不同的操作系统进行了相应的安装步骤。
  • 成功启动了 Voicebox 主界面。
  • 注意了一些常见的安装问题及解决方法。

3. 克隆声音:从音频样本开始

本章我们要搞定如何用 Voicebox 克隆声音,从准备一些音频样本开始。读完之后,你就能上传自己的录音,让 Voicebox 学习并生成类似的声音了。

首先,确保你已经完成了上一章的安装步骤,并且成功打开了 Voicebox 的主界面。如果没有的话,赶紧回头补一下吧!

准备音频样本

克隆声音的第一步是要有一些高质量的音频样本。这些样本应该是你要克隆的人说话的内容,比如一段对话或者朗读的文字。尽量找那些发音清晰、背景噪音少的片段。

上传音频样本

  1. 打开 Voicebox 后,你会看到一个欢迎界面。点击左侧菜单栏中的“Clones”选项卡。

  2. 在“Clones”页面上,点击右上角的“New Clone”按钮。

  3. 这时候会弹出一个新的窗口让你设置新克隆的基本信息。填入名字和描述后,点击“Next”。

    新建克隆

  4. 接下来就是上传音频的部分了。你可以通过拖拽文件的方式将你的音频文件放到指定区域,也可以点击“Browse Files”按钮手动选择文件。

    上传音频

  5. 选择好文件后,点击“Upload”。Voicebox 会开始处理你的音频样本。

    # 假设你已经在终端中进入了 Voicebox 的目录
    ./voicebox upload my_sample.wav
  6. 处理完成后,你会看到进度条完成并且界面上出现了一个新的克隆项。

训练模型

  1. 点击你刚刚创建的克隆项旁边的“Train”按钮。

  2. Voicebox 会自动开始训练模型。这个过程可能需要几分钟时间,具体取决于你的硬件性能和音频样本的数量。

    训练模型

  3. 训练完成后,你会看到状态变为“Ready”,这意味着你可以开始使用这个克隆声音了。

使用克隆声音

  1. 回到主界面的顶部导航栏,点击“Generate Speech”选项卡。

  2. 在文本框中输入你想说的话。

  3. 下拉选择器找到你刚才训练好的克隆声音,并选择它。

  4. 点击“Generate”按钮,Voicebox 就会生成相应的声音。

    # 假设你已经在终端中设置了所需的环境变量
    voicebox speak --text "你好世界" --clone "我的声音"
  5. 播放生成的声音文件,确认是否符合预期。

实际案例

假设你现在想要为一部短片制作旁白,并且希望用某个角色的真实声音来做配音。你可以先录制几段该角色的对白作为音频样本上传到 Voicebox 中进行训练。然后,在编写剧本的时候可以直接在脚本中添加标记好的文本内容,并调用已训练好的克隆声音来生成最终的配音文件。

常见问题与解决方法

  • 上传失败:检查你的网络连接是否正常;确保音频格式支持(通常支持 WAV 或 MP3);如果问题依然存在,请查看日志或联系开发者获取帮助。
  • 训练时间过长:增加更多的计算资源可以帮助加快训练速度;确保你的机器有足够的内存和存储空间。
  • 生成语音质量不佳:尝试提供更多样化的音频样本;调整预处理设置以改善音质;考虑更换不同的 TTS 引擎看看是否有更好的表现。

本章小结

  • 我们学习了如何准备适合用于克隆的声音样本。
  • 完成了在 Voicebox 中创建新克隆的过程,并上传了自己的音频数据。
  • 观察到了训练模型的状态变化以及如何使用已训练好的克隆声音来生成语音输出。
  • 解决了一些可能出现的问题及其对应的解决方案。

4. 生成语音:选择合适的 TTS 引擎

生成语音:选择合适的 TTS 引擎

这章我们要聊聊怎么在 Voicebox 里挑选一个合适的文本转语音(TTS)引擎,这样生成出来的声音才能更符合我们的需求。读完这章,你会知道有哪些可用的 TTS 引擎,以及如何根据具体情况进行选择和配置。

首先,确保你已经按照之前的步骤安装好了 Voicebox,并且有一个可以用来测试的克隆声音。如果没有的话,回头去第二章和第三章补一下课吧。

我们先来看一下目前 Voicebox 支持的 TTS 引擎。主要有两个选项:

引擎名称 特点
qwen 默认引擎,性能不错
tacotron2 另一个强大的开源 TTS 引擎

接下来,我们就用这两个引擎分别生成一些语音,比较一下效果。

使用默认引擎 qwen

我们先试试默认的 qwen 引擎。打开终端,输入以下命令:

voicebox speak --text "这是一个测试句子" --clone "我的声音" --engine qwen

执行这个命令后,你应该会听到一段由 qwen 生成的语音。注意听它的音色、流畅度和自然程度。

使用 tacotron2 引擎

接着换一个引擎试试看。同样在终端中运行以下命令:

voicebox speak --text "这是一个测试句子" --clone "我的声音" --engine tacotron2

这次换成 tacotron2 后,再仔细听听生成的声音有什么不同之处。

对比两个引擎的效果

通过刚才的操作,你应该能感受到两个引擎之间的差异。一般来说:

  • qwen 更加高效快速,适合大多数应用场景。
  • tacotron2 提供更高的音质和更加自然的表现力,但在某些情况下可能会稍微慢一点。

如果你对音质要求特别高,并且不介意等待更长时间来生成语音文件的话,可以选择 tacotron2;反之,则推荐使用默认的 qwen 引擎。

实际案例

假设你在做一个儿童教育应用,并且需要为每个角色分配不同的声音。在这种情况下,你可以先试用 qwen 来快速生成大量对话内容;如果发现某些角色的声音不够自然或者有缺陷的地方,则切换到 tacotron2 进行精细调整。

常见问题与解决方法

  • 找不到指定的 TTS 引擎:确保你使用的引擎名称拼写正确,并且该引擎已经被正确安装在系统中。
  • 生成速度慢:如果选择了计算量较大的引擎(如 tacotron2),可以考虑升级硬件配置或优化其他软件资源占用情况。
  • 输出声音异常:检查你的音频样本是否足够多样且高质量;也可以尝试调整预处理参数以获得更好的结果。

本章小结

  • 我们了解了 Voicebox 目前支持的不同 TTS 引擎及其特点。
  • 学习了如何在命令行中指定具体的 TTS 引擎来生成语音。
  • 通过实际操作对比了两种主流引擎的区别,并给出了相应的使用建议。
  • 探讨了几种常见的问题及其解决策略。

5. 添加情感标签:让语音更自然

这章我们要聊聊怎么给生成的语音加上情感标签,让说话更有感觉、更自然。读完之后,你就能让你的角色笑一笑、叹口气了。

上一章我们已经选好了 TTS 引擎,并生成了一些基本的语音。为了继续,你需要确保 Voicebox 已经安装并且至少克隆了一个声音。

第一步:选择正确的 TTS 引擎

首先,我们需要使用支持情感标签的 TTS 引擎。根据 README 文档,只有 Chatterbox Turbo 支持这些标签。所以,我们先确认一下当前使用的引擎是不是 Chatterbox Turbo。

voicebox config set tts_engine chatterbox_turbo

执行这个命令后,你应该能在终端看到类似“Successfully updated configuration”的消息。

第二步:输入文本并添加情感标签

接下来,在生成语音的文本中加入一些情感标签。例如,如果你想让角色在说话中间插入笑声和叹息声,可以这样写:

你好!今天天气真好。[laugh] 我们一起去公园吧?[sigh]

然后使用以下命令生成带有情感标签的语音:

voicebox speak -t "你好!今天天气真好。[laugh] 我们一起去公园吧?[sigh]"

这条命令会调用 Chatterbox Turbo 引擎来处理包含情感标签的文本,并生成对应的语音文件。

注意事项

  • 确保语法正确:所有的情感标签都需要用方括号包裹起来,比如 [laugh] 或者 [sigh]
  • 检查引擎设置:如果你没有按照第一步修改引擎设置为 chatterbox_turbo,那么这些标签会被当作普通文本输出。
  • 查看支持的标签:目前支持的情感标签包括 [laugh], [sigh], [gasp] 等。具体有哪些可以参考官方文档或帮助菜单。

实际案例

假设我们在制作一部动画片,其中一个角色是个爱开玩笑的小男孩。我们可以利用 Chatterbox Turbo 的情感标签来增强他的个性:

嘿!你知道吗?明天就是周末啦![laugh][laugh] 我们可以去游乐场玩儿哦![excited]

通过上面这段文字中的 [laugh][excited] 标签,我们可以让小男孩的声音听起来充满活力和快乐感。

本章小结

  • 我们学习了如何选择支持情感标签的 TTS 引擎 Chatterbox Turbo。
  • 实践了在文本中添加 [laugh], [sigh] 等情感标签的方法。
  • 通过实际例子展示了如何利用这些标签来丰富角色的声音表现力。
  • 提醒大家注意语法正确性和引擎设置的重要性。

6. 应用后处理效果:优化音频输出

这章我们要聊聊怎么给生成的语音加点料,让它听起来更好听。读完之后,你会知道怎么调整音调、加回声或者压缩音频,让你的声音作品更加专业。

首先,确保你已经安装好了 Voicebox,并且熟悉基本的操作流程。特别是上一章里提到的情感标签部分,虽然这里不直接用到,但对理解整体工作流程有帮助。

第一步:启动 Voicebox 并打开设置

我们先打开 Voicebox 应用程序。如果你之前设置了全局热键或者其他偏好选项,记得确认一下是否正常工作。

点击左下角的齿轮图标进入设置页面:

点击齿轮图标 -> 进入 Settings 页面

第二步:找到后处理效果选项

在设置页面里找到“Post-processing”(后处理)选项卡。在这里你可以看到各种音频特效的开关和参数调节。

Settings -> Post-processing

常见的后处理效果包括:

效果 描述
Pitch Shift 调整音高
Reverb 加入空间感或混响
Delay 添加延迟效果
Chorus 类似合唱的效果
Compression 控制音频动态范围
Filters 使用滤波器调整频率响应

第三步:调整音调(Pitch Shift)

我们先来试试调整音调吧。找到“Pitch Shift”滑块,默认情况下它是关闭的(值为 0)。试着将其向右移动增加音高,向左移动则降低音高。

Pitch Shift 滑块 -> 向右移增加音高

示例:

假设你想让某个角色的声音更高一点,就像他喝了兴奋剂一样:

Pitch Shift 设置为 +2 半度

这样角色说话的时候会显得更有精神一些。

第四步:加入混响(Reverb)

接着我们来加点混响效果。混响可以让声音听起来像是在一个房间里发出的一样,增加空间感。

找到“Reverb”滑块,默认也是关闭的(值为 0)。适当提高这个数值会让声音更饱满些。

Reverb 滑块 -> 调整至合适的位置

示例:

如果你想让一个角色的声音听起来像是在一个大厅里说话:

Reverb 设置为 0.5 到 0.7 之间

这样角色的声音就会有一种开阔的感觉。

第五步:添加延迟(Delay)

延迟效果可以模拟声音经过一段时间才到达你的耳朵的情况,通常用于制造一种距离感或者电子音乐的感觉。

找到“Delay”相关的设置项,一般会有时间间隔和反馈强度两个参数可以调节。根据需要进行适当的调整。

Delay 时间间隔 -> 调整至合适的时间长度 (例如 500ms)
Delay 反馈强度 -> 调整至合适的强度 (例如 0.3)

示例:

如果你想给一个机器人角色加上机械感的声音延迟:

Delay 时间间隔: 500ms, 反馈强度: 0.3

这样每次说话都会有轻微的回声效果,增强机器人的感觉。

第六步:保存设置

完成以上各项设置后别忘了保存更改。大多数时候 Voicebox 会自动保存你的设置,但保险起见还是手动确认一下。

点击 Save 按钮或退出 Settings 页面时系统会自动保存设置。

实际案例

假设你在制作一段科幻电影中的对话场景,其中一个角色是一个高级机器人助手。你可以通过以下方式优化他的声音:

  1. 提升音调 - 让机器人听起来更有科技感。
  2. 加入适量混响 - 给他一点空间感。
  3. 添加微弱延迟 - 增强机械回应的效果。

具体操作如下:

  • 将 Pitch Shift 设置为 +1 半度。
  • 将 Reverb 设置为 0.4。
  • 设置 Delay 时间间隔为 400ms 和反馈强度为 0.25。

通过这样的设置组合,你可以创造出一个既有科技感又不失人性化的机器人声音效果。

如果你遇到问题...

  • 常见错误: 如果某些参数不起作用,请检查是否选择了正确的 TTS 引擎。
  • 实用技巧: 不同类型的音频可能适合不同的后处理效果组合。多尝试几种看看哪种最适合你的需求。
  • 注意事项: 太极端的效果可能会破坏原有的声音特性,请适度使用这些工具来增强而不是掩盖原本的特点。

本章小结

  • 学习了如何访问和启用 Voicebox 中的各种后处理效果。
  • 实践了如何调整音调、添加混响和延迟等常见音频特效。
  • 掌握了一些实用技巧和注意事项,在实际项目中更好地应用这些工具来优化音频输出质量。

7. 集成到项目:使用 API 和 MCP

这章我们要搞定怎么把 Voicebox 集成到你的项目里,让你的应用也能用上本地生成的语音。读完这一章,你就能在自己的软件中调用 Voicebox 的 API 或者通过 MCP 协议来控制语音输出了。

首先,确保你已经安装并配置好了 Voicebox,并且至少克隆了一个声音或者选择了预设的声音。这样我们就有了可供使用的语音资源。

我们先来看如何使用 Voicebox 提供的 REST API 来生成语音。假设你想在一个简单的 Python 脚本中调用这个 API:

import requests

url = "http://localhost:3000/api/v1/generate"
payload = {
    "text": "你好,世界!",
    "voice_id": "your_voice_id_here",  # 替换为你的 voice ID
    "engine": "qwen3-tts"
}
response = requests.post(url, json=payload)

if response.status_code == 200:
    with open("output.wav", "wb") as f:
        f.write(response.content)
else:
    print(f"Error: {response.text}")

这段代码会向 Voicebox 发送一个 POST 请求,请求生成一段文本的语音,并保存为 output.wav 文件。注意替换 "your_voice_id_here" 为你实际使用的 voice ID。

如果你遇到 Connection refused 错误,检查一下 Voicebox 是否已经在后台运行,并且监听的是默认端口 3000。如果不是,默认情况下启动 Voicebox 后应该会自动打开浏览器界面,如果没有的话可以手动访问 http://localhost:3000 查看是否正常工作。

接着,我们来看看如何通过 MCP 协议与 Voicebox 进行交互。MCP 是一种用于机器学习模型通信的标准协议,在这里我们可以用来控制多个 AI 模块之间的对话和行为。

假设你要让 Claude Code 使用你克隆的声音进行回复,你可以发送以下格式的消息给 Claude:

{
    "function_call": {
        "name": "voicebox.speak",
        "arguments": {
            "text": "{{message}}",
            "voice_id": "{{your_voice_id}}"
        }
    }
}

这里的 {{message}} 是你需要转换成语音的具体文本内容,而 {{your_voice_id}} 是之前提到的那个唯一的 voice ID。Claude 收到这条消息后就会调用 Voicebox 来合成指定的文字为音频,并播放出来。

为了更好地理解这些过程,想象一下你在开发一款智能助手应用,用户可以通过文本输入框提交问题或指令。当用户提问时,你的应用不仅需要根据用户的意图返回答案文本,还需要通过上面的方法将答案转化为带有特定人物特征的声音反馈给用户。

本章小结

  • 学习了如何使用 Voicebox 的 REST API 在 Python 中生成语音。
  • 掌握了如何通过 MCP 协议让其他 AI 模块调用 Voicebox 的功能。
  • 注意事项包括检查服务是否正常运行以及正确设置 voice ID 参数。

FAQ

安装时报错:提示缺少依赖库怎么办?

在安装过程中如果遇到缺少依赖库的问题,请确保您的系统已经安装了所有必要的依赖项。对于不同的操作系统,可能需要手动安装特定的库或工具包。您可以参考官方文档中的“Troubleshooting”部分获取详细的解决方法。

在Windows上安装时遇到权限问题如何处理?

如果您在Windows上安装Voicebox时遇到权限问题,可以尝试以管理员身份运行安装程序。右键点击下载的MSI文件,选择“以管理员身份运行”,然后按照提示完成安装过程。

如何切换不同的TTS引擎?

要切换不同的TTS引擎,在Voicebox的应用界面中找到设置选项或偏好设置区域,通常会有一个下拉菜单或者按钮允许您选择当前使用的语音合成引擎。根据您的需求选择合适的引擎即可。

使用预设声音和克隆声音有什么区别?

预设声音是由开发者预先训练好的几种固定的声音模型,用户可以直接使用而无需提供任何音频样本。而克隆声音则是通过上传一段目标人物的音频来创建一个个性化的语音模型,这个过程称为零样本克隆(zero-shot cloning)。使用克隆声音可以获得更接近原始说话者的声音效果。

Voicebox与其他类似产品如ElevenLabs有何不同之处?

相比ElevenLabs这样的云端服务提供商,Voicebox是一个本地运行的应用程序,这意味着所有的数据处理都在用户的设备上进行,保证了更高的隐私性和安全性。此外,Voicebox还支持多种语言、提供了更多的TTS引擎选择,并且集成了语音输入功能和智能代理交互能力。

在Linux系统上如何从源码构建并运行Voicebox?

由于目前没有为Linux提供预编译二进制文件,您需要自行从源代码构建Voicebox应用程序。请访问voicebox.sh/linux-install,该页面包含了详细的步骤指导以及所需的开发环境配置信息。按照说明操作即可成功部署Voicebox到Linux环境中。

使用全局热键进行文字转语音时有哪些注意事项?

当启用全局热键功能后,请注意以下几点:

  1. 确保所设定的快捷键组合不会与现有软件冲突。
  2. 在某些应用窗口内可能会禁用全局热键,请查阅具体软件的帮助文档了解相关信息。
  3. 激活热键后立即开始讲话以便准确捕捉到您的语音内容。
  4. 如果麦克风音量过低或过高都可能导致识别不准确,请调整至合适水平。

🔗 Related