AI 全自动生成图书号短视频实战流程 ✍ Bytec🕐 2026-07-10📦 10.2 KB 🟢 已读 𝕏 文章列表 本文详细拆解了使用 Codex、HyperFrames、VoxCPM 及 fast-whisper 等开源工具,全自动生成图书号短视频的完整技术链路。流程涵盖资料收集、文案生成、语音克隆、音频后期处理及字幕对齐等关键环节,旨在构建一套可复用的 AI 自媒体生产工作流。 AI视频CodexHyperFramesVoxCPMFFmpeg工作流自媒体TTSAgent教程 # AI 全自动生成图书号短视频 **作者**: Bytec **日期**: 2026-07-09T01:20:06.000Z **来源**: [https://x.com/Bytec99/status/2075372048994672994](https://x.com/Bytec99/status/2075372048994672994) ---  昨天用 Codex + HyperFrames 跑通了一条图书号短视频,收获了很多朋友的喜欢,有朋友咨询我怎么搞的,今天就写个详细的流程拆解。 > **Bytec@Bytec99**: [原文链接](https://x.com/Bytec99/status/2075027179176632465) > > 交个作业:我也跟着 @369Serena 老师串了下全自动生成书籍短视频的流程,中间有部分节点用了自己熟悉的项目 > 整体流程是: > 前面用微信读书 Skill 自动抓书评,提炼读者最有共鸣的点; > 中间用 VoxCPM 自动配音; > 再用 fast-whisper 生成字幕时间轴; > 最后用 Codex + HyperFrames 自动生成视频; > >  核心是在 @369Serena 老师流程的基础上,做了部分改造,然后把这套流程整理成了一个可复用的 Skill。以后我只需要给一本书名,或者让它推荐一本书,就可以按这套流程继续做下一条视频。 中间我只保留两个确认点:文案确认一次,图片确认一次。剩下的配音、字幕、BGM、视频合成和预览,尽量都交给 AI 自动完成。 下面把我的实际流程拆一下,也把关键节点用到的开源项目和参数放出来。 # 1. 准备工具 这条链路里,生成视频我实际用到的是 HyperFrames,它的好处是可以用 HTML / CSS / JS 做视频合成。对 AI Agent 来说,这比传统剪辑工程更容易操作:背景图、字幕、书名作者、音频轨道、转场,都可以直接写在代码里。 这次实际用到的工具和开源项目主要有: 1、HyperFrames 用来做视频合成、预览和最终渲染。 2、微信读书 Skill 用来查书籍信息、热门划线、书评和读者反馈。 3、VoxCPM 用来做本地语音生成,无需调任何API。 https://github.com/OpenBMB/VoxCPM 4、faster-whisper 用最终音频转写,拿真实字幕时间轴(音画同步的关键,严格来说是字幕)。 https://github.com/SYSTRAN/faster-whisper 5、FFmpeg 用来做声音后期、BGM ducking、音频裁剪和格式转换。 https://github.com/FFmpeg/FFmpeg > BGM ducking(背景音乐闪避/回避)是音频处理里的一个术语。 > 指的是:当有更重要的声音出现时,自动把背景音乐(BGM)的音量压低 6、yt-dlp 处理公开视频和音频素材时会用到。 https://github.com/yt-dlp/yt-dlp # 2. 整体流程 我的图书号视频流程现在大概是这样: 1. 给一本书名,或者让 AI 推荐一本书 2. 用微信读书 Skill 查资料 3. 生成 30 秒左右的中文旁白 4. 我确认文案 5. 拆字幕句子和画面段落 6. 生成 3-4 张统一风格背景图 7. 我确认图片 8. 生成完整旁白音频(VoxCPM) 9. 用最终音频转写并对齐字幕(faster-whisper) 10. 加 BGM,并做自动 ducking 11. 用 HyperFrames 生成预览 12. 确认后渲染 MP4 # 3. 资料收集:先把书理解清楚 图书号视频最怕空泛。如果只让 AI 直接写“推荐一本书”,很容易变成没有信息密度的鸡汤。 所以要先做资料收集。这一步推荐用微信读书 Skill,先查: 1. 书籍基本信息 2. 作者信息 3. 热门划线 4. 公开书评 5. 读者常见反馈 微信读书 Skill 配置如图:  微信读书skill安装示意 按照提示安装skill并配置API key即可。 这一步不是为了把资料全部塞进视频,而是为了找到一个适合 30 秒短视频的切口。比如《纳瓦尔宝典》,可以讲财富,也可以讲判断力,也可以讲自由。但一条 30 秒视频不可能讲完整本书,所以会让 Codex 选一个最适合传播的角度,再开始写旁白。 # 4. 先写旁白,不急着做画面 先生成旁白,不急着做图,也别急着配音。 原因很简单:文案是整条视频的骨架。文案方向错了,后面声音再好、画面再漂亮,也只是在补救。 旁白要求是 30 秒左右,中文自然口播,不要像书评摘要,也不要有明显 AI 腔。比如少用“不是……而是……”,少用强行排比,不要一上来就说“这本书告诉我们”。 这一步生成后,codex会让我确认旁白稿、预计时长、传播角度和资料来源摘要。确认文案后,再进入图片和音频环节。 # 5. 生成 3-4 张统一风格背景图 图书号视频不需要每秒都换画面。所以更倾向于 30 秒视频用 3-4 张图,每张图对应一个旁白段落,切换点卡在断句处。 这里要敲个重点,一定要提示 Codex,不要把文字做进图片里。 尤其是中文,AI 生成图片时很容易自己就把书名、作者、字幕画进去,然后出错。所以我的做法是:明确图片只负责氛围,书名、作者、字幕都放到 HyperFrames 里,用 HTML / CSS 叠加。 同一条视频里,3-4 张图的色调、镜头语言和光线质感要一致。图片出来后,会再发我确认一次,确认后才继续做音频和合成。  生成的图片示意 # 6. 生成旁白音频 旁白音频这一步,我用的是本地 VoxCPM,相信各位也听到了,效果真的非常好极力推荐! 我用的是可控声音克隆模式:上传一段自己的参考音频,模型克隆音色,同时可以使用控制指令调节语速、情绪或风格。  可控声音克隆的使用 这里有个坑和大家分享:尽量一次性生成完整旁白,不要一句一句生成后再拼接。分段生成很容易出现音色、情绪和节奏不一致的问题。 我目前比较稳定的参数是: ``` --cfg-value 2.0 --inference-timesteps 10 ``` 如果只是快速测试,可以先用: ``` --inference-timesteps 8 ``` 正式版本我更倾向于 inference-timesteps=10。 inference-timesteps 可以理解为生成过程里的推理步数,步数更高通常更稳定,但生成速度会慢一点。 cfg-value 会影响模型对条件的跟随强度,我现在用 2.0,主要是为了在自然感和稳定性之间取平衡。 # 7. 声音后期和 BGM 原始旁白直接放进视频里,通常还不够像短视频口播,所以会用 FFmpeg 做一层轻后期。 当前参数是: ``` volume=-2dB, highpass=f=70, lowpass=f=13500, acompressor=threshold=-20dB:ratio=2.2:attack=18:release=180:makeup=1.5, aecho=0.7:0.14:34:0.06, loudnorm=I=-16:TP=-1.5:LRA=8, aresample=48000 ``` 简单说,highpass=f=70 用来去掉低频浑浊感,lowpass=f=13500 避免声音太刺,acompressor 让旁白更稳,aecho 加一点点空间感,loudnorm=I=-16:TP=-1.5:LRA=8 把响度处理到更适合短视频播放的水平。 BGM 不是简单铺一层音乐,因为它很容易和旁白打架。用 FFmpeg 的 sidechaincompress 做 ducking:旁白说话时,BGM 自动压低;旁白停顿时,BGM 稍微回来。 参数方向是: ``` sidechaincompress=threshold=0.012:ratio=8:attack=45:release=650:makeup=1.4 ``` 如果 BGM 前奏太长,可以直接从中间开始截,比如: ``` -ss 19 ``` 短视频只有 30 秒左右,前奏太长会拖节奏,直接从情绪进入点开始更合适。 # 8. 字幕对齐 字幕对齐很关键。很多视频看起来粗糙,不是因为画面不好,而是字幕和声音错位。 我的处理方式是:最终旁白音频生成后,再跑 faster-whisper。参数是: ``` --language zh --compute-type int8 ``` 这里有个细节:只用 faster-whisper 的时间点,不完全使用它识别出来的文字。因为书名、人名、专有名词很容易被识别错。 所以我的规则是:时间用 faster-whisper,文本用已经确认过的最终旁白。这样字幕既能对齐声音,又不会被识别错误带偏。切图点也根据最终字幕断句来定,而不是平均切。 # 9. HyperFrames 预览和导出 最后进入视频合成。 注意要先开预览,不直接渲染。因为调视频时,经常只是改一点点:字幕上移一点、字体粗一点、BGM 大一点、图片切换慢一点。如果每次都导出 MP4,效率太低。  导出前要让codex跑检查 ``` npx hyperframes lint npx hyperframes inspect npx hyperframes validate ``` 主要检查有没有报错、布局有没有溢出、字幕有没有遮挡、文本对比度够不够、音频轨道有没有接上。确认没问题后,再渲染 MP4。 # 10. 总结 把这篇流程给 Codex,再结合自己的素材和审美调两轮,基本就能跑出一条可用的图书号视频。 等链路真正跑顺之后,文案和图片确认也可以省略,变成每天自动跑几条候选视频。最后人只负责挑选、微调和发布。 这也是我觉得 AI 做自媒体最有意思的地方:不是只生成一次内容,而是把一个内容品类,做成一条可以持续复用的生产流程。快去试试 ## 相关链接 - [Bytec](https://x.com/Bytec99) - [@Bytec99](https://x.com/Bytec99) - [2.8K](https://x.com/Bytec99/status/2075372048994672994/analytics) - [Jul 9](https://x.com/Bytec99/status/2075027179176632465) - [@369Serena](https://x.com/369Serena) - [18K](https://x.com/Bytec99/status/2075027179176632465/analytics) - [@369Serena](https://x.com/@369Serena) - [https://github.com/OpenBMB/VoxCPM](https://github.com/OpenBMB/VoxCPM) - [https://github.com/SYSTRAN/faster-whisper](https://github.com/SYSTRAN/faster-whisper) - [https://github.com/FFmpeg/FFmpeg](https://github.com/FFmpeg/FFmpeg) - [https://github.com/yt-dlp/yt-dlp](https://github.com/yt-dlp/yt-dlp) - [Upgrade to Premium](https://x.com/i/premium_sign_up) - [8:10 AM · Jul 10, 2026](https://x.com/Bytec99/status/2075372048994672994) - [2,816 Views](https://x.com/Bytec99/status/2075372048994672994/analytics) - [View quotes](https://x.com/Bytec99/status/2075372048994672994/quotes) --- *导出时间: 2026/7/10 10:28:03*
图 图书解读视频制作教程与实践案例 文章介绍了如何利用 Codex、AI 图片、AI 配音和 HyperFrames 制作 60-90 秒的中文图书解读短视频。作者以《活着》为例,详细分享了选书、脚本写作、图片生成约束、声音选择、字幕对齐及剪辑转场等全流程,并将经验封装成 Skill,为想做自媒体的人提供了一条不露脸、低门槛的内容创作路径。 技术 › Skill ✍ Smartpig🕐 2026-07-21 AI视频图书解读CodexHyperFrames自媒体工作流自动化AIGC短视频教程
用 用 Codex + Hyperframes 拆解抖音爆款视频工作流 本文详细介绍了利用 Codex 和 Hyperframes 拆解并复刻抖音爆款视频的完整工作流。内容涵盖从工具准备、视频规格定义、旁白脚本生成、TTS 音频处理(使用剪映/Codex 优化磁性人声),到利用 Hyperframes 进行代码化视频生成及字幕对齐的全过程。作者强调通过 AI Agent 实现自动化批量生产,降低自媒体创作门槛,帮助普通人利用 AI 技术在视频领域获取收益。 技术 › AI 视频制作 ✍ Serena🕐 2026-07-05 CodexHyperframes工作流TTS视频剪辑自媒体AIGCRemotion教程抖音
C Codex自动化剪辑基础篇:一条视频是怎样被自动做出来的? 本文深入解析了Codex进行自动化剪辑的底层逻辑,主要涵盖三部分:通过建立分类素材库解决画面问题;利用AI配音或TTS技术解决声音问题;借助参考视频和FFmpeg等工具实现画面与声音的合理编排。文章旨在帮助读者搭建专属的自动化视频剪辑工作流。 技术 › Codex ✍ xilo🕐 2026-07-27 Codex自动化剪辑视频制作素材库TTSFFmpegAI视频Remotion工作流
装 装完 Codex 不知道干什么?这 6 个 GitHub Skills 让你做视频搞钱 文章介绍了 6 个适用于 Codex 的 GitHub Skills,涵盖动效生成、视频剪辑、批量制作、AI 生成及中文剪辑等工具,帮助用户构建自动化视频工作流以提升效率。 技术 › Codex ✍ Kay🕐 2026-07-30 Codex视频制作AgentSkill自动化HyperFramesRemotionAI剪辑工作流
一 一个人的 AI 视频生产线:从 MiniMax 到本地声音克隆与数字人 文章详细记录了作者构建个人 AI 视频生产线的全过程。包括从 MiniMax 云端声音克隆迁移到本地 IndexTTS2 以降低成本和延迟,解决参考音频漂移问题;接入 HeyGen 数字人实现虚拟分身,并通过脚本自动化视频合成与人脸裁切。文章分享了具体的代码配置、生产流程(脚本、配音、字幕、合成)以及避坑指南,适合高频视频创作者参考。 技术 › 视频生成 ✍ 雪踏乌云🕐 2026-07-28 AI视频声音克隆IndexTTS2HeyGen数字人FFmpeg工作流Mac开发本地部署TTS
C Codex + Hyperframes + HeyGen +声音克隆:零基础自媒体变现全开源 作者分享了利用 Codex、Hyperframes、HeyGen 和 IndexTTS2 等工具构建的自动化视频工作流,实现了零基础、低成本的短视频制作与变现。文章详细介绍了各工具的选型理由、工作流架构及成本账单,旨在帮助读者通过 AI 技术解决内容生产的效率问题。 技术 › 工具与效率 ✍ 雪踏乌云🕐 2026-07-27 AI自媒体视频制作HeyGen声音克隆CodexHyperFrames自动化变现工作流
3 30分钟把二次元老婆/老公搬上桌面!Codex 桌宠完整教程 本文介绍了如何利用一张 IP 设定图,在 Codex 中快速生成动态桌宠。文章详细讲解了从角色准备、生成包含多种状态和视角的动画图集,到最终打包安装的全流程,探讨了将 AI 工具个人化、使其成为工作伙伴的意义。 技术 › Codex ✍ Kimberly🕐 2026-07-21 Codex桌宠AI工具教程个性化IP设定动画Hatch PetAgent工作流
用 用Codex做自媒体,我建议你先装好这10个Skill 本文推荐了10个Codex Skill,覆盖自媒体创作全流程:选题、素材、创作、设计、发布及复盘。这套工具链能帮助新手将重复性工作自动化,构建高效的内容生产流水线,但账号成功仍需依赖个人选题判断与持续输出。 技术 › 工具与效率 ✍ zhouluobo🕐 2026-07-19 Codex自媒体AI工具Skill工作流Agent自动化内容创作效率复盘
用 用AI剪视频可行吗?分享我用Codex+ChatCut和Hyperframes剪视频的全操作过程 文章分享了使用Codex结合ChatCut和Hyperframes两个插件进行AI视频剪辑的全流程。ChatCut适合处理基础拼接、字幕和旁白等模板化任务;Hyperframes擅长制作简单动画和文字效果。作者详细介绍了安装、需求明确、素材处理、修改及剪辑等步骤,适合新手学习。 技术 › 工具与效率 ✍ 探路AI🕐 2026-07-15 AI视频CodexChatCutHyperframes视频剪辑教程新手指南
别 别再研究一堆 AI 工具了:我用 Codex 做完一条图书号视频后,发现关键其实是流程 作者分享使用 Codex 制作《悉达多》图书号视频的经验,指出核心在于流程而非工具。文章详细拆解了从找参考、拆解声音节奏、定稿旁白、生成音频到画面合成与字幕对齐的完整工作流,并对比了不同声音生成路线,强调先定旁白后做画面、字幕需按最终音频对齐等关键原则。 技术 › Codex ✍ Kimberly🕐 2026-07-15 AI视频工作流图书号短剧制作AgentSkill短视频HyperFrames
我 我用 Codex + Remotion 制作唐朝纸片分层动画的完整教程 本教程详解如何利用 Codex、Remotion、Imagegen 和 F5-TTS 构建本地视频流水线,制作具有纵深感的“纸片分层动画”。文章从确定镜头、素材分层、Remotion 动画编排到音频合成进行了全流程拆解,核心在于将背景、主角、配角拆分为独立素材,并通过代码精准控制层级与运动。 技术 › 工具与效率 ✍ 季白羽🕐 2026-07-13 RemotionAIGC视频制作动画教程CodexTTS工作流FFmpeg
别 别再乱装 Codex Skills 了,真正值得先装的是这几类 文章指出,使用 Codex Skills 不应像逛插件商店一样盲目安装,而应围绕核心工作流进行选择。作者推荐了三个安装阶段:第一阶段优先安装前端设计类(如 frontend-design)和浏览器验收类 Skill,以实现从“写页面”到“审页面”的闭环;第二阶段安装研究类(如 last30days)和内容类 Skill,用于产出高质量长文;第三阶段按需补全 Figma 和销售类 Skill。此外,作者建议通过自定义 AGENTS.md 来固化工作流程,提升 Agent 的执行稳定性。 技术 › Codex ✍ MuscleMan🕐 2026-07-06 CodexClaude CodeAgent前端开发工作流AI编程Agent-BrowserResearchContent-Strategy教程