HyperFrames + F5:批量文章转视频实战 ✍ AFei Liang🕐 2026-06-24📦 10.3 KB 🟢 已读 𝕏 文章列表 本文详述了一套将技术文章批量转化为带克隆旁白视频的自动化工作流。作者通过结合 HyperFrames 与 F5-TTS,将文章拆解为口播脚本,针对不同技术风格定制视频界面,并重点解决了文本对齐、技术术语发音及字体显示等常见问题,提供了完整的从脚本到成片的质量验收标准。 F5-TTSHyperFrames工作流视频制作语音合成AgentCodexHermes自动化内容创作 # 我用 HyperFrames + F5,把三篇文章批量做成了带克隆旁白的视频 **作者**: AFei Liang **日期**: 2026-06-23T07:19:21.000Z **来源**: [https://x.com/afly813/status/2069319381092646942](https://x.com/afly813/status/2069319381092646942) ---  这次我干了一件挺适合内容创作者的事: 把三篇已经写好的技术文章,分别做成 1920×1080 横屏视频,而且每条都有旁白,声音还尽量贴近我提供的那段录音。 三篇文章分别是: - 零成本跑通 Hermes 全模态,这样配置,不亚于主流模型全模态能力 - Codex 这些功能你开了等于白装 - Hermes Agent 可以接入 iMessage了,三分钟完成配置「完整攻略」 最后做出来不是三条套模板的视频,而是每篇单独定风格、单独写口播、单独建目录、单独导出。 先看结果。 *(视频内容)* 当然 瑕疵肯定是有的,比如语速太快,吐字有时候不清楚等, 这个都是可以后期再优化 主要看过程!! 你也可以将此文发给 codex ,它会知道如何按照步骤一步一步来做!!  ## 第一步:别急着做视频,先把文章拆成“可讲”的内容 文章和视频不一样。 文章可以慢慢读,可以来回翻;视频不行,观众一秒钟没跟上,后面就容易飘走。 所以我第一步不是直接把 Markdown 丢给工具,而是先把每篇文章拆成 7 个小段。每个小段只讲一件事: - Hermes 全模态这篇,重点是“免费 API 怎么接进 Agent 工作流” - Codex 功能避坑这篇,重点是“哪些功能真有用,哪些别乱开” - Hermes 接 iMessage 这篇,重点是“从前置条件到手机实测的完整流程” 每条视频都配了一份 `narration_script.md`,也就是最终旁白稿。这样后面不管是生成音频,还是对齐画面节奏,都有一个稳定的文本底稿。  我的目录是这样分的: ``` hermes-multimodal-video/ codex-features-video/ hermes-imessage-video/ ``` 每个目录里面都有: ``` DESIGN.md narration_script.md index.html assets/ audio/ renders/ ```  这个结构很重要。不要把三条视频混在一个目录里,不然后面你改音频、改截图、重渲染时,很容易自己把自己绕进去。 ## 第二步:每篇文章单独选风格 这次我没有用一个统一模板套三条视频。 原因很简单:三篇文章的气质不一样。 Hermes 全模态那篇,讲的是模型、API、Agent、全模态工作流,所以我用了偏深色的技术感界面,绿色和蓝色做高亮,截图放在右边,左边放判断和步骤。  Codex 功能避坑那篇,内容其实更像“功能优先级清单”。如果也做成赛博风,就会显得太重。所以我用了浅色底、红黑强调,更像一张操作台上的风险标记。  Hermes 接 iMessage 这篇,核心是消息网关和手机实测,所以画面里保留了聊天气泡、终端截图、状态检查这些元素,让观众一眼知道这是在配置通信链路。  当然, 风格的选择也可以完全让 codex 帮你来做分析, 最后自己选择即可 这里有个小经验:技术视频不要只堆大标题。 标题负责告诉观众“这一段讲什么”,截图负责证明“这一步真的做到了”,数字和命令负责让人记住关键点。三层信息都在,视频才不像空洞的 PPT。 ## 第三步:用 F5-TTS 做克隆旁白 旁白这块,我一开始也比较谨慎。 Edge TTS 很稳,但它主要是通用语音合成,不是拿一段录音就能高质量克隆的路线。 真正要“参考这段录音的声音”,还是更适合用 F5-TTS 这种带参考音频和参考文本的方案。 可以自己录段口播稿作为参考音频,但这里有个坑,非常关键。 F5-TTS 不是随便丢一段音频进去就完事。它需要: 1. 参考音频不要太长 2. 参考文本要和参考音频内容对齐 3. 技术词要在旁白稿里写成更接近真实读法的形式 比如模型名、API、Full Access、Auto review、iMessage、Node.js 这些词,如果文本写得太随意,TTS 就可能读得很怪。 所以旁白稿里我尽量写成自然口播: ``` 模型选 agnes two point zero flash Node 大于等于十八点十七 Custom Direct API Full Access Auto review iMessage ``` 不是每个词都硬翻中文,也不是把英文一个字母一个字母念出来。 ## 最大的坑:旁白一开始全是杂音 这个问题挺典型。 一开始生成出来的旁白,听起来不是口播,而是一团杂音。这个时候不能急着怪视频合成,也不能马上换工具。 我先把问题拆开看: - 如果 MP4 里音频有问题,可能是合成阶段出错 - 如果 WAV 本身就是杂音,那就是 TTS 生成阶段出错 - 如果响度正常但听不清,可能是参考音频和参考文本不匹配 最后定位下来,问题出在 F5-TTS 的参考音频和参考文本。 F5 会对参考音频做截断,如果你给它的参考文本还是完整长录音的文本,那它实际听到的音频和你告诉它的文字就对不上。对不上以后,声音就容易崩。 修法也很直接: 先把参考音频裁成可控长度,再把 `ref_text` 改成和这段裁剪音频完全一致的文本。  修完后,再用 F5 生成三段完整旁白: ``` hermes-multimodal-video/audio/narration-f5.wav codex-features-video/audio/narration-f5.wav hermes-imessage-video/audio/narration-f5.wav ``` 然后统一做响度处理: ``` loudnorm=I=-17:TP=-2:LRA=11 48000 Hz stereo ``` 这样最后放进视频时,音量不会忽大忽小,也不会一个视频响、另一个视频闷。 ## 第四步:合成视频,不要只看“能不能导出” 视频能导出,不代表成片没问题。 这次我踩到的另一个小坑是字体。 有些中文小标签一开始变成了方块字。原因是我把章节标签用了纯等宽字体,英文没问题,中文 fallback 没接好,就显示成方块。 解决方式也简单:技术截图里的英文命令继续保留等宽字体,但视频界面上的中文标签改回系统中文字体。这样既不丢技术感,也不会出乱码。 还有英文术语粘连的问题,比如: ``` HermesAgent FullAccess Node.js版本 ``` 这类问题不是 TTS 的问题,是画面文字换行逻辑太粗暴,把中英文之间的空格吃掉了。 我把文本换行逻辑改成按英文单词、空格、中文字符分别处理,最后画面上就恢复成: ``` Hermes Agent Full Access Node.js 版本 ``` 这种细节看起来小,但公众号视频、B 站视频里非常明显。观众不一定说得出来哪里怪,但会觉得画面不专业。 ## 第五步:最后一定要验收 我最后做了三类检查。 第一类是视频参数: - 是否真的是 1920×1080 - 是否是横屏 - 是否有音轨 - 音频是不是 AAC - 采样率是不是 48kHz 第二类是画面抽帧: - 中文有没有方块 - 英文术语有没有粘连 - 截图有没有挡住正文 - 大标题有没有超出画面 第三类是音频抽检: - WAV 本身有没有声音 - 响度是否正常 - ASR 能不能识别出核心内容  这一步很重要。 因为“听起来像杂音”和“模型偶尔读错一个词”是两类完全不同的问题 前者说明生成链路坏了,必须返工 后者是 TTS 质量问题,可以通过改写旁白稿继续优化 这次最终 ASR 能识别出: ``` Hermes Agent API Key Custom Direct API Codex Full Access Auto review iMessage Node 18.17 ``` 说明音频不是杂音,至少语音识别能稳定抓到主干内容。 ## 最后导出的三个文件 三条成片分别是: ``` hermes-multimodal-video/renders/hermes-multimodal-video-f5-voiceover.mp4 codex-features-video/renders/codex-features-video-f5-voiceover.mp4 hermes-imessage-video/renders/hermes-imessage-video-f5-voiceover.mp4 ``` 参数也都确认过: ``` 1920×1080 横屏 H.264 视频 AAC 48kHz 双声道音频 时长约 46 到 48 秒 ``` ## 这套流程最值得复用的地方 如果你也想把文章批量变成视频,我觉得最值得抄的不是某个命令,而是这个顺序: ``` 文章拆段 写成口播稿 每篇单独定风格 挑文章里的关键截图 生成克隆旁白 合成视频 抽帧检查 ASR 检查 最后再交付 ``` 尤其是克隆旁白这一步,不要只看“模型跑完了没有” 一定要检查参考音频、参考文本、旁白文本、技术词读法、最终 WAV、最终 MP4 任何一环没对齐,都可能出现听起来很玄学的问题 这次最有价值的经验就是:声音崩了不要乱换工具,先把链路拆开。到底是参考音频错、参考文本错、TTS 生成错,还是视频封装错,一层一层排,问题很快就会露出来。 最后成品出来之后,具体的细节再进行优化优化, 其实整套流程就很适合批量化了。 文章负责深度,HyperFrames 负责画面节奏,F5-TTS 负责声音一致性。 只要前面的口播稿和素材整理得好,一篇文章做成一条横屏解说视频,就不再是从零开始。 ## 相关链接 - [AFei Liang](https://x.com/afly813) - [@afly813](https://x.com/afly813) - [2.1K](https://x.com/afly813/status/2069319381092646942/analytics) - [零成本跑通 Hermes 全模态,这样配置,不亚于主流模型全模态能力](https://x.com/afly813/status/2067150507945374100) - [Codex 这些功能你开了等于白装](https://x.com/afly813/status/2066454931461042601) - [Hermes Agent 可以接入 iMessage了,三分钟完成配置「完整攻略」](https://x.com/afly813/status/2068499321801314317) - [3:19 PM · Jun 23, 2026](https://x.com/afly813/status/2069319381092646942) - [2,123 Views](https://x.com/afly813/status/2069319381092646942/analytics) --- *导出时间: 2026/6/24 09:47:35*
装 装完 Codex 不知道干什么?这 6 个 GitHub Skills 让你做视频搞钱 文章介绍了 6 个适用于 Codex 的 GitHub Skills,涵盖动效生成、视频剪辑、批量制作、AI 生成及中文剪辑等工具,帮助用户构建自动化视频工作流以提升效率。 技术 › Codex ✍ Kay🕐 2026-07-30 Codex视频制作AgentSkill自动化HyperFramesRemotionAI剪辑工作流
C Codex + Hyperframes + HeyGen +声音克隆:零基础自媒体变现全开源 作者分享了利用 Codex、Hyperframes、HeyGen 和 IndexTTS2 等工具构建的自动化视频工作流,实现了零基础、低成本的短视频制作与变现。文章详细介绍了各工具的选型理由、工作流架构及成本账单,旨在帮助读者通过 AI 技术解决内容生产的效率问题。 技术 › 工具与效率 ✍ 雪踏乌云🕐 2026-07-27 AI自媒体视频制作HeyGen声音克隆CodexHyperFrames自动化变现工作流
用 用Codex做自媒体,我建议你先装好这10个Skill 本文推荐了10个Codex Skill,覆盖自媒体创作全流程:选题、素材、创作、设计、发布及复盘。这套工具链能帮助新手将重复性工作自动化,构建高效的内容生产流水线,但账号成功仍需依赖个人选题判断与持续输出。 技术 › 工具与效率 ✍ zhouluobo🕐 2026-07-19 Codex自媒体AI工具Skill工作流Agent自动化内容创作效率复盘
新 新蓝人计划(1)|别抄作业,先搭好你的AI 写作闭环 文章记录了作者从盲目模仿大佬工作流失败,到顿悟后构建个人最小可用 AI 写作闭环的过程。作者强调新手不应照搬复杂流程,而应基于自身写作习惯(如草稿、优化、配图、发布),利用 Codex 等 AI 工具搭建简单可跑通的系统,并主张通过“先完成再迭代”的方式持续优化。 技术 › 工具与效率 ✍ 劳伦斯🕐 2026-02-20 AI写作工作流AgentCodex实操教程效率提升Openclaw内容创作自动化个人知识库
构 构建超越单一模型的持久 AI 系统 文章指出,模型只是可随时替换的引擎,真正的价值在于构建围绕模型的系统。作者介绍了利用 Hermes 工具从简单的问答、一次性任务,进化到生成可共享的产物、封装可复用的技能,最终形成自动化运行的循环系统,以实现 AI 效用的复利增长。 技术 › Hermes ✍ ericosiu🕐 2026-07-25 AI系统HermesSkillAgent工作流自动化技能封装
图 图书解读视频制作教程与实践案例 文章介绍了如何利用 Codex、AI 图片、AI 配音和 HyperFrames 制作 60-90 秒的中文图书解读短视频。作者以《活着》为例,详细分享了选书、脚本写作、图片生成约束、声音选择、字幕对齐及剪辑转场等全流程,并将经验封装成 Skill,为想做自媒体的人提供了一条不露脸、低门槛的内容创作路径。 技术 › Skill ✍ Smartpig🕐 2026-07-21 AI视频图书解读CodexHyperFrames自媒体工作流自动化AIGC短视频教程
使 使用 Hermes Agent Blender MCP 免费构建 3D 产品模型 文章介绍了 Hermes Agent Blender MCP 工具,它能将文字描述直接转化为可编辑的 Blender 3D 场景。用户无需深入学习 Blender 的复杂节点和参数,只需描述想法,Agent 即可自动完成建模、材质、灯光和渲染。这种方式大大降低了 3D 创作门槛,特别适合产品模型快速制作。 技术 › Hermes ✍ Julian Goldie SEO🕐 2026-07-18 3D建模BlenderAgentAI设计产品渲染自动化HermesMCP创意工具工作流
生 生财有术亦仁:未来十年最大机会是Agent|新手搭建全景实战教程 本文介绍了生财有术创始人亦仁关于Agent是未来十年最大机会的观点,并提供了从零开始搭建个人AI Agent的全景实战教程。文章对比了Coze等平台工具与自建方案的优劣,详细讲解了如何利用Hermes、飞书CLI和Codex三个核心工具构建具备记忆、执行和进化能力的Agent,帮助企业与个人重构工作流。 技术 › Agent ✍ aix阿乐🕐 2026-07-17 Agent实战教程Hermes飞书CLICodex工作流AI员工开源工具方法论
如 如何在2026年建立你的第一个AI团队 文章介绍了2026年构建AI团队的完整指南,强调多智能体协作模式。通过设定研究员、起草人、批评家和润色者四种角色,利用Bloome等工具实现高效的AI工作流。涵盖市场调研、内容创作、文档审查等实际应用场景,并提供任务路由系统的具体配置方法,帮助用户低成本提升效率。 技术 › Agent ✍ Rahul🕐 2026-07-14 AIAgent多智能体工作流效率工具Bloome自动化团队管理路由系统内容创作
我 我用 Codex 修复了工作流中的“最后 1 公里”,实现了视频音频的秒级校准 作者为了解决视频制作中音频与画面手动同步的痛点,设计开发了本地工具 Web Video Studio。该工具集成了项目扫描、音频生成、可视化校准和自动化录屏准备等功能,利用 Codex 快速修复开发过程中的 Bug,成功实现了从文章到视频的高效工作流,提升了内容制作的生产力。 技术 › Codex ✍ AFei Liang🕐 2026-07-13 工作流Codex自动化视频制作Web Video Studio效率工具
有 有嘴就行!AI一键生成小红书和公众号内容的自动化工作流 本文介绍了如何利用 AI 将一篇长文自动转化为适配小红书和公众号的“内容发布包”。作者详细阐述了从 Brief 撰写、图文卡片拆解、图片生成到公众号文章改写的全流程,并提供了封装好的开源 Skill 和具体 Prompt,旨在帮助创作者实现跨平台内容的高效生产与分发。 技术 › Agent ✍ Kimberly🕐 2026-07-12 AI工具小红书公众号内容创作工作流自动化PromptCodexSkill开源
普 普通人不会搭建知识库?方法超简单1分钟教会你 文章指出很多人搭建知识库失败的根本原因在于资料难以持续稳定地“入库”。作者介绍了通过 WorkBuddy 与 ima 知识库的组合,利用自然语言指令和自动化文件夹监控,将网页链接、本地文件等低成本地沉淀到知识库中,从而将知识库从简单的收藏夹转变为能辅助内容生产的数字助理。 技术 › 工具与效率 ✍ SakuAI🕐 2026-07-10 知识库WorkBuddyima工作流AI工具自动化内容创作Agent效率提升