免费开源TTS模型Confucius 4-TTS:本地声音克隆实战与WeSight集成 ✍ 苍何🕐 2026-06-28📦 8.1 KB 🟢 已读 𝕏 文章列表 文章介绍了如何利用网易有道开源的免费TTS模型Confucius 4-TTS实现本地声音克隆。作者展示了将该模型集成到WeSight桌宠中,实时使用复刻音色进行任务播报的过程。该模型仅1.3B大小,支持14种语言的无参考文本克隆,并提供了详细的本地部署代码及在Mac和远程服务器上的运行方案。 TTS声音克隆开源本地部署WeSightConfuciusAgent语音合成AI工具教程 # 终于找到免费开源TTS模型,克隆声音不要钱,本地电脑也能跑 **作者**: 苍何 **日期**: 2026-06-27T09:58:25.000Z **来源**: [https://x.com/canghe/status/2070808965844250747](https://x.com/canghe/status/2070808965844250747) ---  大家好,我是苍何。 前几天夜深人静的时候,在油管上又刷到我喜欢的博主更新了视频。  声音太好听了,当时有点儿激动,没忍住,花了些时间,把娜娜住进了我的 WeSight。 现在,我只要在 WeSight 中开启任务,WeSight 的桌宠就能播放娜娜的声音,实时播报任务完成情况。实时告诉我她在做什么,发送任务后,我再也不用盯着了。 比如简单任务,娜娜会说她开始想一下,然后查看结果,最后还带着开心情绪的语气告诉我任务完成啦: *(视频内容)* 再比如在 WeSight 中调 Claude Code 来 Coding,更有意思,哈哈哈。  这个感觉还挺棒的,特别是夜深人静 vibe coding,感觉就没那么孤独了,而且也能有暖心提醒,可以专心去做其他事情了。 最为🐂🍺 plus 的是,你甚至可以自定义本地 TTS 模型,实现 token 自由的来享受。 本地 TTS 模型我用的 Confucius4-TTS。只有 1.3B 大小,无需参考文本可以无约束声音克隆,很适合本地部署。  现在,你只需要在 WeSight 中开启桌面宠物(在设置-通用-桌面宠物)。  然后开启自定义音色,为每一个宠物自定义你喜欢的音色。  目前支持 2 种模式,你可以配置 MiniMax 的 API 也可以选择共用 WeSight 中 MiniMax 的 API key,也可以自定义 API,甚至可以选择本地的 TTS 配置。 还可以上传一个参考音频,几秒钟快速复刻一个还原度很高的音色。  比如我上传了一段娜娜口播的音频,点击「开始复刻」,就能在 WeSight 的桌宠中使用该音色。也就是文章一开始的那 2 个视频。  说实话,一开始选择本地部署 TTS,除了想节省 token,也是想着好好利用一些公司里的 dgx spark。 也做了一番调研,太大参数的本地肯定搞不了,太小的,不少效果又不行,在确认技术选型之前,我还是对 Confucius 4-TTS 对做很多的测试验证。你看:  这个视频大家都有印象吧,我想复刻小女孩的声音  我本地 mac 通过 Remotion 远程连接到 dgx 主机,dgx 本地部署了 Confucius 4-TTS 开源模型,负责将声音进行复刻。  然后给到我复刻后的音频: 我闲的无聊,把这个配音,放到原视频中去,挺有意思,哈哈哈。  后文中的音频 X 上放不了,我把原文放在评论区了,感兴趣的可以看看哈 我老婆看我瞎倒腾啥,也想来玩下,她先录了个音,这是原始音频: 好,我现在用她的音色, 经过我本地的 Confucius 4-TTS 模型复刻,来一口地道的英语给小橘子讲讲三字经吧。 还不过瘾,我直接让她来个日语介绍下武汉。 感觉还挺相似的你别说,语调和情绪都还挺到位,不大像是本地模型能跑出来的。 Confucius 4-TTS 一共支持 14 种语言,中文、英文、日语、韩语、德语、法语、西班牙语、印尼语、意大利语、泰语、葡萄牙语、俄语、马来语、越南语,说后面还会持续增加。  这个是我喜欢的博主娜娜的原声,我试了把她复刻为不同的语言。 先来一个卢森堡语的带货口播:  再来一个韩国口音的带货口播:  是不是很 nice,我感觉这个对出海跨境电商和内容创作真的有用,不用自己再找人录不同语种的口播了。 然后我还把我自己的声音克隆了,复刻后,我直接让自己来给大家播放个 AI 早报: 平时高德导航我都是开的小团团语音包,我还蛮想复刻一个小团团音色的,于是我随便录了一段音频,不过车里声音有些吵。 可能是杂音噪音问题,复刻出来的效果没达到我的要求。 大家在使用 Confucius 4-TTS 模型本地复刻的时候,一定要录制干净没有杂音的纯声,这样出来的效果会好一些。 本地部署最大的好处就是省 Token,其实部署起来也不麻烦,甚至,你在自己的 Mac 都能跑的起来。 首先,你需要把开源代码拉到本地来。 ``` git clone https://github.com/netease-youdao/Confucius4-TTS.git cd Confucius4-TTS ``` 然后构建 conda 环境,如果你已经有了就可以不用再新构建了,只需要激活启动下。 ``` conda create -n confuciustts python=3.10 -y conda activate confuciustts ``` > conda 环境简单理解就是给这个项目单独开一个「房间」,装它自己需要的依赖,不会跟你电脑上其他项目打架。 接下来就可以安装依赖: ``` pip install -r requirements.txt ``` 这里时间会比较久,按照要求来安装依赖就好了。 搞定后,你可以执行以下代码测试,注意修改自己的音频参考文件: ``` python example.py \ --prompt_wav path/to/reference.wav \ --text "Hello, this is a test of zero-shot voice cloning." \ --lang en \ --out output.wav \ --config config/inference_config.yaml ``` 当然也可以不在 dgx 上直接测试,可以通过 Tailscale 在 mac 上远程执行测试。 最后用 fastAPI,将模型服务封装出去给到 WeSight 使用,就算是完成了。 我看了下 Confucius 4-TTS 的技术架构,是「语音编码器 + LLM」架构,通过两阶段 Text 2 Semantic(文本→语义 Token)+ Semantic 2 Acoustic(语义 Token→梅尔频谱图)。 然后使用 BigVGAN 声码器输出最终音频。  说实话,本地部署 TTS,可以不用考虑成本的使用,这一点还挺舒服的。 而且 Confucius 4-TTS 只有 1.3 B,本地就能跑,Apache 2.0 协议,商用也没问题,这对个人开发者和内容创作者来说,真的太友好了。 如果你也想让自己的 Agent 「开口说话」,强烈建议去试试。当然也可以使用 WeSight 来体验哦。 稍微留意了下 Confucius 4-TTS 居然又是有道开源的,还记得WeSight其实是站在有道开源的 LobsterAI 做的二开。 有道的 AI 现在现在越来越有一种「闷声干大事」的感觉了。不搞发布会刷存在感,就是一个接一个往外丢开源项目,TTS、Agent 框架、多模态,全都 Apache 2.0,拿来就能用。 好啦,觉得有用的话,点个赞吧,你们的支持是我持续折腾的最大动力。 你最想复刻谁的声音?评论区聊聊。 ## 相关链接 - [@canghe](https://x.com/canghe) - [14K](https://x.com/canghe/status/2070808965844250747/analytics) - [5:58 PM · Jun 27, 2026](https://x.com/canghe/status/2070808965844250747) - [14.1K Views](https://x.com/canghe/status/2070808965844250747/analytics) - [View quotes](https://x.com/canghe/status/2070808965844250747/quotes) --- *导出时间: 2026/6/28 14:21:39*
G GitHub 新手指南:写给非程序员的入门说明 随着 AI 工具的普及,GitHub 已不再仅限于程序员使用。本文面向非程序员,旨在科普 GitHub 的基础概念与使用方法。文章详细介绍了首页 Dashboard、Explore 探索页、Trending 热榜、Topics 主题分类以及 Collections 合集等核心功能。同时,讲解了如何利用 Search 搜索具体需求、阅读 README 项目说明书、以及通过 Star 收藏有价值的项目。最后总结了从发现到收藏的完整使用路径,帮助非技术人群将 GitHub 作为发现新工具、了解技术趋势的重要信息入口。 技术 › 工具与效率 ✍ veyhon🕐 2026-05-17 GitHub新手指南非程序员AI工具开源教程工作流Agent效率工具科普
6 69个最佳开源AI仓库推荐(2026年4月) 文章精选了69个经过实战验证、维护活跃的开源AI仓库,旨在替代昂贵的API订阅。内容涵盖完整的AI技术栈,包括本地大模型推理、RAG知识库构建、AI智能体框架、提示词与评估、模型微调、工具链及部署等十大领域,为开发者、研究人员和独立黑客提供免费的生产级AI工具清单。 技术 › 工具与效率 ✍ self.dll🕐 2026-04-29 开源AI工具LLMAgentRAG模型微调OllamaLangChain本地部署资源合集
一 一个人的 AI 视频生产线:从 MiniMax 到本地声音克隆与数字人 文章详细记录了作者构建个人 AI 视频生产线的全过程。包括从 MiniMax 云端声音克隆迁移到本地 IndexTTS2 以降低成本和延迟,解决参考音频漂移问题;接入 HeyGen 数字人实现虚拟分身,并通过脚本自动化视频合成与人脸裁切。文章分享了具体的代码配置、生产流程(脚本、配音、字幕、合成)以及避坑指南,适合高频视频创作者参考。 技术 › 视频生成 ✍ 雪踏乌云🕐 2026-07-28 AI视频声音克隆IndexTTS2HeyGen数字人FFmpeg工作流Mac开发本地部署TTS
d dashi-ppt 我们也测了,第一还是 slide-maker 文章对比了 slide-maker 和 dashi-ppt 两款 AI PPT 生成工具。在基于 Opus 5 模型的统一评测中,slide-maker 的无图版和带图版分别获得 94.5 和 91.5 分,击败了获得 83.5 分的 dashi-ppt。评测指出,slide-maker 胜在代码生成带来的高自由度和原生可编辑性,而 dashi-ppt 虽导出效果好,但受限于模板,内容结构被强行适配,导致丢分。 技术 › Skill ✍ Martin(小马)🕐 2026-07-27 PPT生成评测slide-makerdashi-pptOpusAgent对比工具评测开源AI工具
开 开源神器Toonflow让小说秒变AI短剧 开源神器Toonflow可将小说或剧本快速转换为AI短剧,2小时内完成出片。工具支持自动编剧、分镜、角色设计和视频生成,采用三层Agent协作与本地记忆,跨平台本地部署,低成本高效。 技术 › 短剧 ✍ 开发者Hailey🕐 2026-07-23 AI短剧Toonflow开源视频生成Agent本地部署低成本
3 30分钟把二次元老婆/老公搬上桌面!Codex 桌宠完整教程 本文介绍了如何利用一张 IP 设定图,在 Codex 中快速生成动态桌宠。文章详细讲解了从角色准备、生成包含多种状态和视角的动画图集,到最终打包安装的全流程,探讨了将 AI 工具个人化、使其成为工作伙伴的意义。 技术 › Codex ✍ Kimberly🕐 2026-07-21 Codex桌宠AI工具教程个性化IP设定动画Hatch PetAgent工作流
财 财报分析Skill保姆级教程:5分钟装好 文章介绍了GitHub上热门的开源美股分析项目Day1Global-Skills,包含科技股财报深度分析、价值评估等5个工具。作者详细讲解了在Claude、Claude Code和Codex中的安装步骤,提供了实战提示词模板,并分享了在财报季的高效使用流程及注意事项。 技术 › Skill ✍ JinYu金鱼🕐 2026-07-20 ClaudeCodex财报分析美股教程Day1Global-Skills安装指南AI工具投资辅助开源
4 42k star 的 CLIProxyAPI:一份订阅喂饱所有 AI 工具 文章介绍了开源工具 CLIProxyAPI,它能将 Claude、ChatGPT 等 AI 订阅账号通过 OAuth 转换为本地 API 接口,从而让只支持 API Key 的国产工具(如字节 Trae)或开源 Agent 复用同一个订阅。文章详解了其安装、配置步骤及工作原理,同时也指出了合规风险和使用门槛。 技术 › 工具与效率 ✍ Niko爱学习🕐 2026-07-16 CLIProxyAPIAI工具API代理Claude开源开发效率TraeCursorAgent
耗 耗时 7 天,我们开源了腾讯 WorkBuddy 实战蓝皮书 作者苍何联合团队经过 7 天努力,正式开源了腾讯 WorkBuddy 实战蓝皮书。该书包含使用手册、实战案例、进阶系统及岗位路线图,旨在填补 WorkBuddy 详细教程的空白,帮助用户通过 AI 提升办公效率。 技术 › Hermes ✍ 苍何🕐 2026-07-13 WorkBuddy实战指南开源AI办公腾讯提效教程案例HermesAgent
A AI 全自动生成图书号短视频实战流程 本文详细拆解了使用 Codex、HyperFrames、VoxCPM 及 fast-whisper 等开源工具,全自动生成图书号短视频的完整技术链路。流程涵盖资料收集、文案生成、语音克隆、音频后期处理及字幕对齐等关键环节,旨在构建一套可复用的 AI 自媒体生产工作流。 技术 › 短剧 ✍ Bytec🕐 2026-07-10 AI视频CodexHyperFramesVoxCPMFFmpeg工作流自媒体TTSAgent教程
终 终于!!AI Agent 也能开口说话了:这个开源工具把语音克隆、听写、MCP 全打通 文章介绍了一款名为 Voicebox 的开源 AI 语音工作室工具。它不仅支持语音克隆、生成和全局听写,更关键的是通过内置 MCP Server,让 Claude Code、Cursor 等 AI Agent 能够调用本地语音层,实现“能听、能说”的交互闭环,弥补了 Agent 只能文字交互的短板。 技术 › TTS ✍ AFei Liang🕐 2026-07-08 VoiceboxMCP语音克隆Agent开源听写Claude本地部署AI语音工作流
3 30 分钟给你的 Agent 搭好永久记忆 本文介绍了一种为编码 Agent 添加持久记忆的轻量级方案。针对 Agent 上下文窗口有限且容易遗忘历史信息的问题,作者选择了开源项目 EverOS。与传统的黑箱向量数据库不同,EverOS 将记忆存储为本地 Markdown 文件,透明且可编辑。文章详细讲解了从环境准备、安装初始化到验证记忆写入与检索的全过程,帮助开发者在半小时内赋予 Agent 跨会话的长期记忆能力。 技术 › Agent ✍ AYi🕐 2026-06-24 Agent记忆系统EverOS教程向量库MarkdownLLM开发工具本地部署CLI