我用Codex+Skill自动生成数字人口播动画视频的工作流 ✍ kanvis🕐 2026-07-17📦 14.8 KB 🟢 已读 𝕏 文章列表 本文详细拆解了一套利用Codex和Skill将公众号文章自动转化为“数字人口播+动画”视频的可复现工作流。涵盖了从文章改写、数字人生成、语音转录、动画卡自动生成到最终质检封装的全过程,旨在解决内容创作者重复出镜和机械包装的痛点。 数字人视频自动化工作流AIGCWhisper视频剪辑动画生成 # 我把一篇公众号文章,用Codex+skill自动变成了“数字人口播 + 动画”的完整视频 **作者**: kanvis **日期**: 2026-07-16T10:32:25.000Z **来源**: [https://x.com/kanvis_chen/status/2077703507076161793](https://x.com/kanvis_chen/status/2077703507076161793) ---   > 这是一套通从文字、口播、数字人到动画包装的可复现codex工作流。本文不讨论“按一下按钮就能全自动”的幻想,而是拆解一个真正可以落地、可以修改、可以复用的生产系统。 ## 先看结果:这条视频里,哪些东西是自动完成的? 你看到的成片长度为 2 分 25 秒,画面是一位数字人在讲解,视频下半部分会随着口播内容出现不同的信息卡:关键词、流程、对比、结论和评论区引导。 > **kanvis@kanvis_chen**: [原文链接](https://x.com/kanvis_chen/status/2077702889976602884) > > 我刚用一套codex+skill自动化流程,把一篇公众号文章变成了 2 分 25 秒的“数字人口播 + 15 张同步动画卡”视频。 > 没有逐句手动打关键帧,也没有反复面对镜头重拍。 > 评论区完整拆解这条生产链路: > >  >  这条视频的生产过程里,我没有逐句手动打动画关键帧,也没有一遍遍重新面对镜头录制。自动化流程完成了以下工作: 1. 从原始视频中提取音频; 2. 使用本地 Whisper large-v3 识别中文口播; 3. 根据逐字稿和时间轴划分信息段落; 4. 自动提炼每一段最值得被视觉化的内容; 5. 生成 15 张与口播同步的动画信息卡; 6. 将数字人/自拍视频画面、原字幕、动画卡和原声组合成竖屏成片; 7. 自动检查字体、文字越界、色彩对比度和运行时错误; 8. 渲染并重新封装原始音轨。 > **kanvis@kanvis_chen**: [原文链接](https://x.com/kanvis_chen/status/2076574427794612520) > > 最近发现已经完全可以用codex+skill 做出自己的数字人教学视频了,逼真程度非常棒。 > >  最终输出规格是 1080×1920、30fps、H.264 + AAC,时长与原素材保持一致。  ## 为什么要做这套流程? 数字人真正有价值的地方,并不是“把真人替换成一个虚拟形象”。 如果只是把一张脸放在画面中央连续说两分钟,观众仍然会觉得单调。它解决了出镜问题,却没有解决信息表达问题。 真正耗费时间的通常是另外三件事: - 怎样把长文章改写成自然的口播; - 怎样判断哪句话需要画面辅助; - 怎样让动画准确出现在对应的话语附近。 所以这套工作流的核心不是数字人模型,而是把“内容理解、时间轴规划和视觉包装”串成一条流水线。 我把它概括成五层: ``` 文章层 → 口播层 → 数字人层 → 动画层 → 质检与交付层 ``` 每一层只解决一个明确问题,上一层的结构化结果成为下一层的输入。这样做的好处是:任何一层效果不好,都可以单独重做,而不必推翻整条视频。 ## 第一层:先把文章变成“能说出来的话” 文章和口播是两种不同的内容形态。 文章允许读者停下来、回看和思考;视频里的句子如果太长、信息太密,观众还没听懂,下一句就已经开始了。 因此不要直接把文章原文交给数字人朗读。先让 Codex 或你自己的内容 Skill 完成一次“口语化重构”。 目前我主要用的是DBS skill来给我完成口语化的转述 这里有完整的项目地址:https://github.com/dontbesilent2025/dbskill 一个合格的口播稿至少需要满足四点: ## 1. 开头十秒必须建立反差 例如这条视频的开头不是解释工具,而是直接说: > 屏幕前的这个人不是我,而是我的数字人。 这句话同时完成了身份反转、好奇心建立和主题说明。 ## 2. 一句话只承担一个核心信息 把复合句拆开。尤其是包含“因为、所以、但是、同时”的句子,通常可以拆成两到三句。 ## 3. 把抽象观点改成具体对象 不要只说“它很适合内容创作者”,而要继续说明: - 会写文字但不擅长面对镜头的人; - 不方便真人出镜的人; - 有大量内容要录、却没有时间反复拍摄的人。 具体对象既方便观众对号入座,也方便后续生成“三类人”的动画卡。 ## 4. 提前埋入可视化节点 流程、数字、对比、列表、结论和行动指令,是最适合做动画的内容。写口播稿时就有意识地保留这些结构,后续自动包装会更稳定。 目前我大概工作有这三种可视化的内容形式: 1.分别是纯素材类型 2.纯特效素材+数字人类型 3.纯特效素材+真人拍摄素材  ## 第二层:生成数字人素材 数字人方案大致可以分为云端和本地两类。 ## 云端方案 优点是门槛低、生成快、环境维护少。适合想先验证内容方向,或者每月产量不算特别大的创作者。 缺点是单次或订阅成本更高,模型、声音和数据受平台限制,批量自动化也取决于平台有没有开放接口。 ## 本地方案 优点是数据留在本机、参数更可控、可以与自己的脚本和工作流深度整合。 缺点是模型部署、显存、依赖和推理速度都需要自己处理。模型效果也不是“参数越大越好”,通常要在多个模型中实际筛选。 我的建议是: - 第一次做,先用云端验证内容是否有人看; - 当产量、隐私或定制要求明显提高,再考虑本地部署; - 不要一开始就在模型安装上投入数天,却还没有做出第一条能发布的视频。 ## 第三层:转录不是为了字幕,而是为了动画时间轴 拿到数字人/真人拍摄的视频后,下一步是转录。 很多人把语音识别理解成“自动生成字幕”。在这套流程里,转录更重要的作用是给每句话建立时间坐标。 例如: ``` { "start": 91.4, "end": 101.1, "text": "我测试了云端和本地部署两种方案" } ``` 有了开始和结束时间,自动化程序才能知道“云端 VS 本地”的卡片应该在第 91 秒出现,而不是凭感觉放在时间轴上。 本次流程直接复用了本机 F 盘已经存在的 Faster-Whisper large-v3 模型,通过 GPU 完成中文识别。2 分 25 秒的视频转录耗时约 18 秒,共得到 43 个语义段落。 这里有三个实践经验: ## 1. 模型不要重复下载 先扫描本机已有模型和缓存,再决定是否下载。大型语音模型经常占用数 GB,重复副本既浪费磁盘,也容易让不同脚本引用不同版本。 ## 2. 识别结果必须做轻量校对 这次识别里出现了“塞出模型”“加机器”等同音错误。时间戳可以保留,但展示在动画卡上的文字必须修正为“筛出模型”“剪辑”等符合上下文的内容。 ## 3. 不要把逐字稿全部搬到画面上 动画卡不是字幕。字幕负责逐字可读,动画卡负责让观众记住重点。 ## 第四层:如何自动决定一条视频需要多少张动画卡? 卡片太少,画面长时间没有变化;卡片太多,观众会觉得信息在不断轰炸。 我采用的是“时长 × 信息密度”的判断方式。 对于 1 到 3 分钟的口播视频,中等信息密度下,可以把 8 到 12 秒作为一张卡的基础节奏。然后根据内容调整: - 数据、数字和并列观点很多:节奏加快; - 叙事和情绪铺垫较多:节奏放慢; - 视频很短:至少保留 5 次视觉变化; - 单张卡停留超过 15 秒:卡内要有多阶段动画,而不是一张静态图片。 这条 145 秒的视频最终使用了 15 张卡,平均约 9.7 秒一张。具体结构如下: 1. 这不是我,而是数字人; 2. 真人还是数字人; 3. 最适合的三类人; 4. 公众号文章进入 Codex; 5. 文章到口播、动画和数字人的完整链路; 6. 不用剪辑、不用反复重拍; 7. 点赞和留言反馈; 8. 大量教程录制的真实需求; 9. 用数字人替代真人; 10. 云端与本地两条路线; 11. 云端门槛低、生成快; 12. 本地控制强、4070 也能运行; 13. 当前速度与表情细节的局限; 14. 后续优化方向; 15. 评论区行动引导。 ## 第五层:把人物和动画放在同一个视觉系统里 这条视频的原始素材是 9:16 竖屏,因此输出继续使用 1080×1920,避免为了换画幅而裁掉人物。 版式采用上下结构: - 上半部分保留数字人和原视频字幕; - 下半部分显示当前口播对应的信息卡; - 视频区域使用白色拍立得边框和浅蓝色胶带; - 信息卡使用暖纸张背景、黑色大标题和有限的强调色。 这里最重要的不是某一种“漂亮风格”,而是建立一致的视觉语法。 本次只重复使用了几种运动: - 标签淡入; - 标题逐字上移出现; - 说明文字从左侧进入; - 强调线从左到右生长; - 装饰圆点轻微弹出; - 卡片结束前淡出。 重复的运动会形成节奏。每张卡都使用完全不同的特效,反而更像模板拼盘。 这里有个很多人会忽略的技巧,就是先把样稿发给codex进行风格固定  ## 第六层:自动质检比自动生成更重要 自动生成一段 HTML 或动画并不难。难的是保证 15 张卡在不同时间点都没有问题。 这次流程在渲染前检查了四类风险: ## 字体检查 所有字体都使用本地文件并显式声明,避免渲染机器缺少系统字体后出现排版变化。 ## 布局检查 在多个时间点抽样,检查标题、说明文字和装饰元素是否超出画布。 ## 色彩对比度 第一次检查发现黄色标签上使用白字,对比度不足。随后将这一类标签改为深色文字,最终 52 项对比度检查全部通过。 ## 音轨检查 动画渲染器输出的是画面轨。完成后必须用 FFmpeg 把原始 AAC 双声道重新封装回最终 MP4,并再次检查时长、分辨率、帧率和音轨。 如果没有最后一步,很容易得到一条“画面看起来正常,但没有声音”的视频。 ## 最容易踩的五个坑 ## 坑一:把字幕当动画 整屏都是逐字稿,只会增加阅读负担。动画卡应该提炼信息,而不是复制语音。 ## 坑二:数字人一直全屏 人物长期占满画面,其他信息只能压在脸和身体上。提前规划视频区与信息区,可以显著提升可读性。 ## 坑三:先追求最强模型,再验证选题 工具只是生产环节。一个没人关心的话题,即使用最贵的数字人和最复杂的动画,也不会自然获得传播。 ## 坑四:忽略本地磁盘空间 渲染两分多钟的 1080×1920 视频时,中间帧会占用大量空间。本次第一次渲染就在 51% 因临时磁盘空间不足中断,迁移到空闲 20GB 以上的 D 盘后才顺利完成。 ## 坑五:一次生成后不抽帧 至少检查开头、流程转折、数据对比和结尾 CTA。自动检测可以发现越界,人工抽帧能发现“技术上没错,但视觉上不好看”的问题。 ## 你可以怎样复刻? 最小可用版本只需要四个组件: 1. 一个能把文章改成口播稿的模型或 Skill; 2. 一个云端或本地数字人生成方案; 3. Whisper/Faster-Whisper,用于生成带时间轴的转录; 4. 一个能按时间轴渲染 HTML 动画的合成工具,例如 HyperFrames。 5. 一个可视化调整的操作界面(目前优化中) 建议按以下顺序搭建: ``` 第 1 周:只跑通文章 → 口播 → 数字人 第 2 周:加入转录和 5 张固定样式的信息卡 第 3 周:加入自动分镜和多种卡片内容 第 4 周:加入字体、越界、对比度和音轨质检 ``` 不要一上来就追求“完全自动”。先让每个环节可用、可替换、可检查,再逐步减少人工确认。 ## 最后 数字人并不会自动让内容变好,但它可以把创作者从重复出镜、反复拍摄和机械包装中解放出来。 真正值得搭建的不是一个“数字人按钮”,而是一条能理解你的文章、组织你的口播、规划画面重点,并且稳定交付视频的生产流水线。 如果你想看下一篇更具体的实操,我可以继续拆解: - 文章转口播 Skill 应该怎样写; - 如何根据逐字稿自动生成 storyboard; - 如何制作可重复使用的动画卡; - 如何把整套流程封装成一条命令。 评论区留下「想看教程」,我还会继续把完整配置和工程结构拆出来。 目前我每次一些细微的调整都是通过对话让codex,但还挺费token,于是乎,我萌生了能不能搞一个类似剪映的编辑器,调整一下特效大小,移动位置,还有出现的时间线,于是有了下面的图。  但调改BUG,做到一半,我发现chatcut也有类似的功能,不过他是一个闭源的程序,好像要扣积分。 现在让我挺纠结的,我是停止开发?开始干脆开源干翻chatcut? 由评论区的各位决定,希望各位可以一键三连,这篇文章用了足足三天准备,如果没有看明白,可以评论区留言,后续会出第二期教程或者解答。 ## 相关链接 - [kanvis](https://x.com/kanvis_chen) - [@kanvis_chen](https://x.com/kanvis_chen) - [5.1K](https://x.com/kanvis_chen/status/2077703507076161793/analytics) - [15h](https://x.com/kanvis_chen/status/2077702889976602884) - [25K](https://x.com/kanvis_chen/status/2077702889976602884/analytics) - [Jul 13](https://x.com/kanvis_chen/status/2076574427794612520) - [74K](https://x.com/kanvis_chen/status/2076574427794612520/analytics) - [https://github.com/dontbesilent2025/dbskill](https://github.com/dontbesilent2025/dbskill) - [Upgrade to Premium](https://x.com/i/premium_sign_up) - [6:34 PM · Jul 16, 2026](https://x.com/kanvis_chen/status/2077703507076161793) - [5,197 Views](https://x.com/kanvis_chen/status/2077703507076161793/analytics) - [View quotes](https://x.com/kanvis_chen/status/2077703507076161793/quotes) --- *导出时间: 2026/7/17 09:42:07*
A AI 内容创作变现零基础入门指南 这是一篇面向零基础的 AI 内容创作变现指南。文章提出内容创作的核心在于“选题”和“定版”,而重复劳动可由 AI 接管。作者系统拆解了短文、长文、图片、短视频、长视频五种内容形式的变现路径,详细阐述了如何利用 AI 进行新闻稿写作、评测分析、电商设计及视频翻译搬运,并附有具体的实操流程和爆款案例。 技术 › 工具与效率 ✍ Ren🕐 2026-07-13 AIGC内容创作变现工作流短文写作AI绘图视频剪辑零基础教程自媒体工具推荐
A AI 内容创作变现零基础入门指南 这是一篇面向零基础新手的 AI 内容创作变现指南。文章提出“人只做判断,AI 包办执行”的核心思路,并详细拆解了短文、长文、图片、短视频、长视频五种内容形式的变现路径。针对每种形式,作者分析了 AI 适配的原因、实操工作流及相关工具,涵盖了从选题侦察、资料搜集到成品分发的全流程自动化策略。 技术 › LLM ✍ Ren🕐 2026-07-13 AI变现内容创作AIGC工作流提示词短剧效率工具自媒体视频剪辑图文设计
T Talking-Head-Recut Skill:AI 驱动的视频自动剪辑与动图文案同步 文章介绍了 HyperFrames 项目中的 `/talking-head-recut` Skill,该功能利用 AI Agent 读取文字记录,自动为视频添加与语音同步的动态图形。演示流程包含:AI 自动调研撰写脚本、通过 HeyGen CLI 调用虚拟数字人生成视频、提取网页设计风格以及自动添加字幕和配乐。整个过程无需人工剪辑,展示了 AI 在视频自动化生产领域的强大能力。 技术 › Skill ✍ HeyGen🕐 2026-07-12 HeyGen视频生成AIAgent自动化动效设计CLIHyperFrames视频剪辑数字人工作流
A AI短剧2026最新工作流与SOP 本文作者总结了2026年度AI视频创作的最新SOP,涵盖了从选题、剧本生成(如使用Agent工具)、分镜拆解、资产管理到视频生成与剪辑的全流程。重点介绍了Seedance 2.0、故事版玩法及各类辅助工具(如LibTV、小云雀)的实战应用,强调了在工具快速迭代中,选题能力与资产库管理的重要性。 技术 › 短剧 ✍ 行者AI视频🕐 2026-07-09 AI视频Seedance工作流SOP分镜剧本生成AIGC资产管理视频剪辑Agent
用 用 Codex + Hyperframes 拆解抖音爆款视频工作流 本文详细介绍了利用 Codex 和 Hyperframes 拆解并复刻抖音爆款视频的完整工作流。内容涵盖从工具准备、视频规格定义、旁白脚本生成、TTS 音频处理(使用剪映/Codex 优化磁性人声),到利用 Hyperframes 进行代码化视频生成及字幕对齐的全过程。作者强调通过 AI Agent 实现自动化批量生产,降低自媒体创作门槛,帮助普通人利用 AI 技术在视频领域获取收益。 技术 › AI 视频制作 ✍ Serena🕐 2026-07-05 CodexHyperframes工作流TTS视频剪辑自媒体AIGCRemotion教程抖音
最 最强视频创作工作流:Image2 + Seedance 2.0 闭环实践 本文介绍了一套用于跨境电商视频创作的顶级工作流,利用 Topview 平台串联 Image2 和 Seedance 2.0,实现了从产品图到直播视频、品牌短片的一键生成。文章详细拆解了 Image2 负责静态画面精确控制、Seedance 2.0 负责动态运镜的互补逻辑,并提供了多宫格分镜、数字人带货、Live 图制作等实战案例及提示词模板。 技术 › 工具与效率 ✍ 饼干哥哥AGI(2.0)🕐 2026-07-01 视频生成AIGC跨境电商SeedanceTopview提示词工程工作流数字人Image2实战教程
保 保姆级教程!用 Seedance 2.0+ GPT2.0 做爆款短剧 本文是一篇零基础的 AI 短视频制作教程,详细介绍了利用 Seedance 2.0 和 GPT 2.0 从脚本策划到成片输出的完整工作流。内容涵盖如何利用 LLM 进行脚本拆解与分镜设计,使用三视图锁定角色一致性,掌握镜头景别与节奏控制,以及通过提示词生成高质量视频素材并进行后期剪辑。 技术 › 短剧 ✍ Biteye🕐 2026-04-29 AI视频Seedance教程脚本创作视频剪辑AIGC短剧制作工作流提示词GPT2.0
C Claude Opus 4.7 + Veo 3.1 创意工厂:日产 550 条广告视频的 AI 系统 文章介绍了利用 Claude Opus 4.7 和 Veo 3.1 构建的自动化广告视频生成系统。该系统每天可生产 550 条具备电影级光影和表现力的动画视频,实现零成本、分钟级制作。通过全自动的概念迭代、场景变换和性能反馈,将创意转化为视觉故事并自动扩展,标志着测试速度取代创意成为新的竞争优势。 技术 › Claude ✍ Alessandro🕐 2026-04-19 AI视频生成自动化营销Veo广告技术AIGC工作流视频剪辑
A AI复活亲人视频变现教程 文章介绍了一种利用AI技术制作“复活亲人”视频的变现玩法。作者分享了通过“小题大做”工具进行面部替换和视频生成的具体操作步骤,包括提示词编写和视频剪辑公式(配乐、字幕等)。此外,文章还详细讲解了账号定位、起号技巧、接单话术及流量变现策略,单笔收益在66至200元之间。 职场 › 职业发展 ✍ Anqi知识分享🕐 2026-04-17 AIAI视频变现副业数字人工具与效率AIGC自媒体视频剪辑
A AI 影视作品感的正确工作流 针对 Seedance 2.0 等工具,指出用户因缺乏前期设计导致成片质量不佳的问题。文章提出了一套从“一句话故事”到“后期收尾”的六步标准工作流,强调通过情绪曲线、六镜头分镜表、基准镜头一致性控制及节奏时长分配等导演思维,提升 AI 影视的叙事连贯性和作品感,并附带了可复用的实操模板。 技术 › AIGC ✍ Adam也叫吉米🕐 2026-04-01 AI影视工作流Seedance导演思维分镜提示词AIGC短剧创作视频剪辑
纳 纳米Work实测:跨三家大模型制作宣传片 作者体验了纳米Work产品,通过两个真实任务测试其Agent能力。该产品成功调用多家大模型完成了产品宣传片剪辑及文案落地页制作。产品具有全过程透明、支持多模型切换及移动端接管等特点,展示了AI作为工作伙伴的巨大潜力。 技术 › Agent ✍ 花叔🕐 2026-07-29 纳米WorkAgent大模型工作流自动化产品设计视频剪辑AI办公
一 一个人的 AI 视频生产线:从 MiniMax 到本地声音克隆与数字人 文章详细记录了作者构建个人 AI 视频生产线的全过程。包括从 MiniMax 云端声音克隆迁移到本地 IndexTTS2 以降低成本和延迟,解决参考音频漂移问题;接入 HeyGen 数字人实现虚拟分身,并通过脚本自动化视频合成与人脸裁切。文章分享了具体的代码配置、生产流程(脚本、配音、字幕、合成)以及避坑指南,适合高频视频创作者参考。 技术 › 视频生成 ✍ 雪踏乌云🕐 2026-07-28 AI视频声音克隆IndexTTS2HeyGen数字人FFmpeg工作流Mac开发本地部署TTS