# 终于!!AI Agent 也能开口说话了:这个开源工具把语音克隆、听写、MCP 全打通
**作者**: AFei Liang
**日期**: 2026-07-08T02:19:25.000Z
**来源**: [https://x.com/afei_AI/status/2074679720176992758](https://x.com/afei_AI/status/2074679720176992758)
---

我现在,几乎每天都在用 Claude Code、Cursor 这类 AI 编程工具
但是,有一个体验一直很割裂
AI 已经能读代码、改代码、跑测试、修 bug
可它和我们的交互,大多数时候还是停留在文字
你得盯着终端
你得看它输出了什么
你得等它问你下一步怎么做
如果跑一个长任务,中间它卡住了、报错了、完成了,你不看屏幕,其实是不知道的

今天给大伙推荐一个很有意思的开源项目

截至我 2026 年 7 月 6 日查询,这个项目已经有 38K+ Star,MIT 开源
它官方的定位是:
> The open-source AI voice studio. Clone, dictate, create.
简单说,就是一个本地优先的 AI 语音工作室
但我觉得,它真正有意思的地方,不只是“开源版 ElevenLabs”
而是:
> 它开始把 AI Agent 从“只会打字”,往“能听、能说、能接入本地工作流”这个方向推了一步

# 为什么现在值得看?
因为 Voicebox 在 2026 年 4 月 25 日发布了 v0.5.0
这个版本叫 The Capture release
从这个版本开始,它不再只是一个语音克隆工具
它把全局听写、Captures、Voice Personality、MCP Server 都放进来了
也就是说,它的重点开始从“生成声音”,变成“打通语音输入和输出”
这正是它和普通 TTS 工具拉开差异的地方
# Voicebox 是什么?
先看下 Voicebox 能做什么
它可以:
1. 克隆声音
2. 生成语音
3. 全局听写
4. 转写录音
5. 做多轨语音故事
6. 通过 REST API 调用
7. 通过 MCP 让 Agent 开口说话
注意最后一点
这也是我觉得它最值得写的地方
如果只是声音克隆,现在类似工具已经不少了
如果只是文字转语音,也不稀奇
但 Voicebox 把“语音输入”和“语音输出”放在一个本地应用里
还给 Claude Code、Cursor、Cline 这类 Agent 留了接口
这就不是单点功能了
它更像是在你的电脑上放了一个本地语音层
AI 可以听你说
也可以用你指定的声音,说给你听
# 以前的 Agent,太安静了
我们现在用 AI Agent 写代码,大概是这样的:
你给它一个任务
它开始读文件、改文件、跑命令
中途如果遇到问题,它在终端里问你
如果任务完成,它也只是在屏幕上输出一段文字
这在短任务里没问题
但一旦任务变长,就麻烦了
比如你让 Claude Code 跑一个较大的重构
它可能要等依赖安装、等测试跑完、等日志输出
你不可能一直盯着它
但是你一离开,它一旦需要确认,你又错过了
所以 Agent 的下一步体验,我觉得一定不是“更长的文本输出”
而是更自然的输入输出
其中一个方向,就是声音
不是为了炫技
而是为了让 AI 从一个终端里的工具,变成电脑上的一个工作伙伴
任务完成了,它可以说一句:
“构建完成,测试通过。”
需要你确认时,它可以直接提醒:
“这里有一个破坏性改动,需要你确认。”
这类信息,用语音其实非常合适
# Voicebox 的关键:MCP Server
Voicebox 内置了 MCP Server
如果你还没接触过 MCP,可以简单理解为:
> MCP 是让 AI Agent 调用外部工具的一套协议
以前 Agent 只能在自己的聊天框或终端里输出文字
接了 MCP 之后,它就可以调用本地工具
比如查数据库、读文件、操作浏览器,或者让 Voicebox 开口说话
它默认挂在本地:
```
http://127.0.0.1:17493/mcp
```
也就是说,只要 Voicebox 在本机运行,支持 MCP 的客户端就能连上它
比如 Claude Code,可以这样添加:
```
claude mcp add voicebox \
--transport http \
--url http://127.0.0.1:17493/mcp \
--header "X-Voicebox-Client-Id: claude-code"
```
添加之后,Agent 就能调用 Voicebox 提供的工具
核心工具包括:
1. voicebox.speak:用指定声音朗读文本
2. voicebox.transcribe:把音频转成文字
3. voicebox.list_captures:列出最近的录音和转写
4. voicebox.list_profiles:列出可用的声音档案
其中最直观的,就是 voicebox.speak
官方文档里的调用方式大概是这样:
```
voicebox.speak({
text: "Deploy complete.",
profile: "Morgan",
engine: "qwen"
})
```
以后你可以给不同 Agent 绑定不同声音
Claude Code 一个声音
Cursor 一个声音
Cline 一个声音
这样你不用看屏幕,也能知道是谁在说话
这个设计我觉得挺妙
因为它不是简单给 AI 加个播放器
它是在本地建立了一个“Agent 语音出口”

# 不只是说话,还能听写
Voicebox 的另一个重要功能,是全局听写
按住快捷键,说话,松开
它会把语音转成文字,然后贴到你当前聚焦的输入框里
这个体验有点像 WisprFlow
但 Voicebox 的重点是本地优先
你的录音、转写、声音样本,都保存在本机数据目录里
它用 Whisper 做语音转文字
支持 Base、Small、Medium、Large、Turbo 这些模型档位
同时还有一个 Captures 页面
你每次听写、录音、上传音频,都能在里面看到对应的音频和文本
后面还可以重新转写、精修文本,甚至把某段录音变成声音样本
这就把语音输入和语音输出接起来了
你可以说话给电脑
电脑也可以用某个 voice profile 回你
这就是我前面说的“语音 I/O”

# 它不是单一模型,而是一个语音工作台
Voicebox 目前支持多个 TTS 引擎

它还支持 23 种语言
不同引擎侧重点不一样
有的适合多语言
有的适合轻量本地推理
有的支持更丰富的语气标签
比如 Chatterbox Turbo 可以识别 [laugh]、[sigh] 这类标签
但官方也提醒了,不是所有引擎都支持
如果你换成其他引擎,这些标签可能会被当成普通文本读出来
这点非常重要
因为很多 AI 语音工具最容易让人误会的地方,就是“看起来都能做”,但实际每个模型能力边界不一样
Voicebox 把这些引擎放在一个应用里,至少让你可以根据场景切换

# 对内容创作者也有用
如果你做播客、短视频配音、知识类音频,Voicebox 也不只是生成一条音频
它有一个 Stories Editor

可以做多轨时间线
比如你要做一段两个人对话
A 角色一条轨道
B 角色一条轨道
背景音一条轨道
再去调整每段音频的位置、长度、音量
这就比“输入一段文本,下载一个 mp3”更像工作台
当然,它现在还不是专业 DAW
但对很多 AI 内容生产场景来说,已经够用了
尤其是做对话类、故事类、教学类音频,比单条生成方便很多
# Voice Personality:给声音加人设
Voicebox 还有一个很有意思的功能,叫 Voice Personalities
你可以给某个声音档案写一段人格描述
比如这个声音是什么性格,怎么说话,表达风格是什么
然后在生成语音前,先让本地 Qwen3 LLM 改写文本
再交给 TTS 读出来
也就是说,它不是单纯“换个音色”
它可以先把内容改成这个角色会说的话,再用这个声音读出来
这对 Agent 来说更有想象力
因为以后不同 Agent 不只是声音不同
它们的表达方式也可以不同
一个偏严谨
一个偏简短
一个偏吐槽
这就开始接近“本地角色化 Agent”了
# 安装门槛要说清楚
Voicebox 很强,但它不是完全无门槛
官方文档里写到,目前 macOS 和 Windows 有安装包
Linux 预构建版本还在路上,暂时更适合按文档自行构建或用 Docker 相关方式
首次运行时,它会按你使用的引擎下载模型
模型大小差异很大
轻的可能几百 MB
重的可能到几 GB
硬件允许的话,建议从 Qwen 1.7B 开始,4个多G的大小

硬件方面:
最低 8GB RAM
推荐 16GB+ RAM
如果你想要更接近实时的生成体验,最好有 CUDA NVIDIA GPU

CPU 也能跑
但速度就别期待太高
这类本地 AI 工具都是这样
它省掉的是云端订阅和数据上传
但成本会转移到你的电脑硬件上
# 还有一个风险,必须提醒
语音克隆一定要谨慎
这个功能本身很强,但也很容易被滥用
我的建议很简单:
只克隆你自己有权使用的声音
比如自己的声音、团队明确授权的声音、项目里可合法使用的声音
不要拿别人的公开视频、直播切片、课程音频去克隆
尤其不要用来冒充别人
技术越强,边界越要讲清楚
Voicebox 官方也有 Responsible Use 相关说明
大伙如果真要用,建议先看一遍
另外,MCP Server 也是本地工具
官方文档里写到,它绑定在 127.0.0.1,目前没有认证
这个边界在个人电脑上通常可以接受
但如果你把它暴露到局域网、远程服务器,或者共享主机上,就要小心
不要随便把本地语音接口暴露出去

# 我为什么看好这个方向?
因为 AI 工具正在从“网页聊天框”,变成“系统里的工作流”
以前我们用 ChatGPT,是打开网页问一句
现在用 Claude Code、Cursor、Codex,是把 AI 放进项目里,让它读代码、改文件、跑命令
下一步,它需要更自然地参与我们的电脑工作流
声音就是其中一个入口
你不一定每天都要让 AI 读长文
但你会希望它在关键时刻提醒你
你不一定每天都要语音写代码
但你会希望它能把一段想法快速转成文本
你不一定要做一个完整虚拟人
但你会希望不同 Agent 有不同的可感知身份
Voicebox 做的事情,正好卡在这个位置
它把本地 TTS、STT、voice profile、MCP、REST API 都放在一起
这不是一个单点小工具
而是一个能被其他工具调用的本地语音基础设施
# 总结
Voicebox 最吸引我的地方,不是“免费”
也不是“开源版 ElevenLabs”
而是它把 AI 语音能力放回了本地电脑
让声音数据留在本机
让 Agent 可以通过 MCP 调用
让语音输入和语音输出形成一个闭环
如果你只想快速生成几条配音,它能用
如果你想做多角色语音内容,它也能用
如果你在折腾 Claude Code、codex 这类 Agent,那它更值得关注
因为它代表的不是“AI 会说话了”这么简单
而是:
> AI Agent 开始拥有本地语音层了
这一步看起来小
但对长期使用 AI 工具的人来说,体验会完全不一样
后续我也会继续分享,如何在我的文章转视频的项目中对接 voicebox,最终使用自己或指定的克隆声音完成音频的合成,而不是让 AI 随机合成,这样在音频合成方面就会稳定很多!
## 相关链接
- [AFei Liang](https://x.com/afei_AI)
- [@afei_AI](https://x.com/afei_AI)
- [Upgrade to Premium](https://x.com/i/premium_sign_up)
- [10:19 AM · Jul 8, 2026](https://x.com/afei_AI/status/2074679720176992758)
- [22 Views](https://x.com/afei_AI/status/2074679720176992758/analytics)
---
*导出时间: 2026/7/8 10:45:40*