📚 Wiki 知识库

技术 / TTS

9 篇
清除

我测试了5个声音克隆项目,最后留下了这一个

本文分享了作者在制作AI视频过程中,从使用MiniMax云端API转向本地部署IndexTTS2的实践经验。作者详细对比了两者在中英混排发音、音频格式、离线能力、声线一致性及成本等方面的优缺点,最终选择了IndexTTS2以保障视频工作流的可控性与稳定性。

技术TTS ✍ 雪踏乌云🕐 2026-07-2912.4 KB

文章转视频实战:从音频处理到 Cue 校准的技术复盘

作者分享了将文章转化为网页视频的全过程。文章详细探讨了从使用 Voicebox 生成 TTS 音频的尝试,到发现逐段生成音色漂移、整段切分不准等问题,最终采用“整章音频 + cue 时间轴”的解决方案。内容涵盖了 TTS 技术选型、前端播放逻辑以及踩坑后的工具化思考。

技术TTS ✍ AFei Liang🕐 2026-07-107.8 KB

LiveTalking:目前商用程度最高的实时交互数字人引擎

文章测评了 LiveTalking 这款实时交互数字人引擎,称其为目前市场上商用能力最强的产品。作者指出其支持多种主流模型(ernerf、musetalk 等),具备声音克隆及可打断的实时对话能力,且兼容 WebRTC 等多种流媒体协议。该工具已广泛用于无人直播、AI 客服等变现场景。

技术TTS ✍ 鸟哥 | 蓝鸟会 (@NFTCPS)🕐 2026-07-081002 B

终于!!AI Agent 也能开口说话了:这个开源工具把语音克隆、听写、MCP 全打通

文章介绍了一款名为 Voicebox 的开源 AI 语音工作室工具。它不仅支持语音克隆、生成和全局听写,更关键的是通过内置 MCP Server,让 Claude Code、Cursor 等 AI Agent 能够调用本地语音层,实现“能听、能说”的交互闭环,弥补了 Agent 只能文字交互的短板。

技术TTS ✍ AFei Liang🕐 2026-07-0812.0 KB

免费开源TTS模型Confucius 4-TTS:本地声音克隆实战与WeSight集成

文章介绍了如何利用网易有道开源的免费TTS模型Confucius 4-TTS实现本地声音克隆。作者展示了将该模型集成到WeSight桌宠中,实时使用复刻音色进行任务播报的过程。该模型仅1.3B大小,支持14种语言的无参考文本克隆,并提供了详细的本地部署代码及在Mac和远程服务器上的运行方案。

技术TTS ✍ 苍何🕐 2026-06-288.1 KB

HyperFrames + F5:批量文章转视频实战

本文详述了一套将技术文章批量转化为带克隆旁白视频的自动化工作流。作者通过结合 HyperFrames 与 F5-TTS,将文章拆解为口播脚本,针对不同技术风格定制视频界面,并重点解决了文本对齐、技术术语发音及字体显示等常见问题,提供了完整的从脚本到成片的质量验收标准。

技术TTS ✍ AFei Liang🕐 2026-06-2410.3 KB

ElevenLabs 推出 Dubbing V2:端到端 AI 配音模型

ElevenLabs 发布全新 Dubbing V2 端到端 AI 配音模型。该模型摒弃了传统的“转写-翻译-合成”三段式流程,直接基于原始表演进行声音建模。它支持 90 多种语言和口音,能完美保留原说话人的音色、情绪、呼吸节奏及身份特征,实现音色穿越和情绪保真。同时支持音频、视频及文字输入,提供限时免费体验。

技术TTS ✍ 小互🕐 2026-05-292.3 KB