数字人口播实战攻略 ✍ Rachel🕐 2026-07-17📦 7.6 KB 🟢 已读 𝕏 文章列表 文章介绍了如何利用 MiniMax 和 HeyGen 制作数字人口播视频的完整流程,并封装为 Codex Skill 实现自动化。详细讲解了声音克隆、画面驱动、素材准备及 API 调用技巧,特别强调先生成 15 秒样片以降低风险,适合知识口播和短视频批量生产。 数字人MiniMaxHeyGenCodexSkill视频生成自动化工作流API短视频 # 99% 的人没看出来的数字人口播实战攻略 **作者**: Rachel **日期**: 2026-07-16T11:53:26.000Z **来源**: [https://x.com/Zesee/status/2077723280534851786](https://x.com/Zesee/status/2077723280534851786) ---  昨天发了一条数字人讲 FDE 的口播视频,很多人的第一反应不是问我用了哪个工具,不相信这真的是数字人。我把整条数字人口播流程做成了一个可以复用的 Codex Skill。 GitHub 仓库:https://github.com/Jingyi-Wu-Richael/rachel-digital-human-production 我的最终工作流是: 素材检查 → MiniMax 生成配音 → HeyGen 15 秒样片 → 人工确认 → HeyGen 完整版 → 下载验片 → 状态归档 这套方案适合知识口播、短视频批量生产、课程讲解、产品介绍、多语言内容和固定 IP 数字人账号。  ## 一、整条链路怎么分工 这套方案的核心,是把声音和画面拆开。 - MiniMax:负责声音克隆和 TTS。 - HeyGen:负责人像驱动、口型、表情和动作。 - Codex:负责检查素材、调用流程、记录状态、控制风险。 完整链路是: 1. 准备真人录音,用 MiniMax 海外版克隆声音。 2. 把文案交给 MiniMax TTS,生成克隆音色的 MP3。 3. 准备一张清晰正面人像。 4. 把人像和 MiniMax 生成的 MP3 上传到 HeyGen。 5. 先生成 15 秒样片,确认后再生成完整视频。 这里最容易犯的错是:声音已经由 MiniMax 克隆完成,却又让 HeyGen 重新配音。 如果目标是保留 MiniMax 的克隆音色,就应该把 MiniMax 生成的音频上传到 HeyGen,用这个音频驱动画面。不要切回 HeyGen 的 `script + voice_id` 方案,否则声音相似度会被覆盖。 ## 二、HeyGen和 Minimax 模式怎么选 第一次操作,建议直接用 `Image-to-Video`,调用api key即可,一次2min的视频大约消耗2刀。 它比较轻:不用一开始就训练 Avatar,只要上传一张人像和一段音频,就能快速看到口型、表情、脸部稳定性和构图是否可用。 我的建议: - 单条测试:先用 Image-to-Video。 - 固定账号长期生产:再做 Photo Avatar。 - 没验证前不要急着训练 Avatar,测试阶段越轻越好。 再说 MiniMax,我的建议: - 第一次测试:用海外版 Voice Clone 克隆声音,再用 TTS 生成 MP3。 - 追求质量:优先选 `speech-2.8-hd`。 - 追求速度和批量预览:可以用 `speech-2.8-turbo` 先跑测试。   ## 三、素材准备:不用复杂,但必须干净 声音克隆效果不好,很多时候不是模型不行,而是样本不干净。 MiniMax 当前官方要求里,声音样本需要满足: - 格式:MP3、M4A 或 WAV。 - 时长:至少 10 秒,最多 5 分钟。 - 文件大小:不超过 20 MB。 - 可选提示音频:少于 8 秒,并且要提供与音频完全对应的文字。 实操里我更建议录 30 到 90 秒:单人、无背景音乐、无明显混响和电流声,音量稳定,语速接近日常口播,不要用过度降噪、变速或压缩严重的二手音频。  人像也一样,要干净: - 正脸看镜头,五官无遮挡。 - 露出头、肩和上半身,人物占画面约 50% 到 70%。 - 嘴部清晰,不要被头发、手、滤镜遮挡。 - 竖屏短视频优先用 9:16 或接近 9:16 的图片。 - HeyGen Assets API 支持 PNG、JPEG 图片;普通素材上传单文件上限为 32 MB。 嘴部越清晰,口型越稳定;声音越干净,克隆越像本人。  ## 四、怎么放进 Codex 执行 我会把每个数字人项目都按同一个目录结构放: ``` project/ ├── inputs/ │ ├── portrait.jpg │ ├── voice-source.mp3 │ └── script.md ├── work/ │ ├── voiceover-full.mp3 │ ├── preview-15s.mp3 │ └── job-state.json └── outputs/ ├── preview-15s.mp4 └── final-1080p.mp4 ``` 然后对 Codex 说: ```text 请用 MiniMax 海外版声音克隆和 HeyGen API 制作数字人口播。 输入: - 文案:inputs/script.md - 人像:inputs/portrait.jpg - 声音样本:inputs/voice-source.mp3 - MiniMax 密钥来自环境变量 MINIMAX_API_KEY - HeyGen 密钥来自环境变量 HEYGEN_API_KEY 流程: 1. 先检查素材。 2. 先生成 15 秒样片。 3. 样片确认后再生成完整版。 4. 所有任务 ID 写入 work/job-state.json。 5. 不要在日志、脚本或文档中显示完整密钥。 ``` 这一步的重点是标准化。 你不需要相信自己每次都记得所有细节。你只需要把正确流程写进 Skill,让 Codex 每次按流程执行。 ## 五. 这个 Skill 固定了什么 仓库地址: https://github.com/Jingyi-Wu-Richael/rachel-digital-human-production 调用方式: ```text 用 $rachel-digital-human-production 做这条视频,先只做 15 秒样片。 ``` 它固定了: - 固定目录结构。 - 先检查文案、人像和声音样本。 - MiniMax 负责声音,HeyGen 负责画面。 - 永远先生成 15 秒样片。 - 样片没有明确确认,不生成完整版。 - 每一步记录 `voice_id`、`asset_id`、`video_id` 和状态。 - 失败不盲目重试,避免重复扣费。 - 最终 MP4 必须完整检查。 - 不把 API Key、授权 header、临时下载链接写进日志或状态文件。 ## 六、小tips 数字人视频最容易踩坑的地方,是成片不自然。 常见问题包括:声音不像本人、中文口型跟不上、脸部轻微变形、嘴角和下巴运动奇怪、眨眼和肩部动作不自然、构图不适合短视频平台。 所以我把“15 秒样片”写成强制步骤。先用 15 秒确认声音、口型、画面和构图。确认没问题,再跑完整视频。 相关链接: - GitHub 仓库:https://github.com/Jingyi-Wu-Richael/rachel-digital-human-production - MiniMax Voice Clone 官方文档:https://platform.minimax.io/docs/guides/speech-voice-clone - HeyGen Image to Video 官方文档:https://developers.heygen.com/image-to-video - HeyGen Assets 官方文档:https://developers.heygen.com/assets ## 相关链接 - [Rachel](https://x.com/Zesee) - [@Zesee](https://x.com/Zesee) - [35K](https://x.com/Zesee/status/2077723280534851786/analytics) - [https://github.com/Jingyi-Wu-Richael/rachel-digital-human-production](https://github.com/Jingyi-Wu-Richael/rachel-digital-human-production) - [https://github.com/Jingyi-Wu-Richael/rachel-digital-human-production](https://github.com/Jingyi-Wu-Richael/rachel-digital-human-production) - [https://github.com/Jingyi-Wu-Richael/rachel-digital-human-production](https://github.com/Jingyi-Wu-Richael/rachel-digital-human-production) - [https://platform.minimax.io/docs/guides/speech-voice-clone](https://platform.minimax.io/docs/guides/speech-voice-clone) - [https://developers.heygen.com/image-to-video](https://developers.heygen.com/image-to-video) - [https://developers.heygen.com/assets](https://developers.heygen.com/assets) - [Upgrade to Premium](https://x.com/i/premium_sign_up) - [7:53 PM · Jul 16, 2026](https://x.com/Zesee/status/2077723280534851786) - [35.6K Views](https://x.com/Zesee/status/2077723280534851786/analytics) - [View quotes](https://x.com/Zesee/status/2077723280534851786/quotes) --- *导出时间: 2026/7/17 09:19:27*
T Talking-Head-Recut Skill:AI 驱动的视频自动剪辑与动图文案同步 文章介绍了 HyperFrames 项目中的 `/talking-head-recut` Skill,该功能利用 AI Agent 读取文字记录,自动为视频添加与语音同步的动态图形。演示流程包含:AI 自动调研撰写脚本、通过 HeyGen CLI 调用虚拟数字人生成视频、提取网页设计风格以及自动添加字幕和配乐。整个过程无需人工剪辑,展示了 AI 在视频自动化生产领域的强大能力。 技术 › Skill ✍ HeyGen🕐 2026-07-12 HeyGen视频生成AIAgent自动化动效设计CLIHyperFrames视频剪辑数字人工作流
装 装完 Codex 不知道干什么?这 6 个 GitHub Skills 让你做视频搞钱 文章介绍了 6 个适用于 Codex 的 GitHub Skills,涵盖动效生成、视频剪辑、批量制作、AI 生成及中文剪辑等工具,帮助用户构建自动化视频工作流以提升效率。 技术 › Codex ✍ Kay🕐 2026-07-30 Codex视频制作AgentSkill自动化HyperFramesRemotionAI剪辑工作流
我 我把 TikTok 运营塞进了 Codex:选品、拆账号、找达人,一句话跑完整个流程 作者将 TikTok 运营工作流封装成 Codex Agent Skill,结合达人精灵 MCP 数据,实现选品、账号诊断、类目研究和增长规划的自动化。文章详细介绍了四个核心技能的安装、配置及具体 Prompt 使用方法,解决了 AI 运营中的幻觉与流程混乱问题。 技术 › Agent ✍ Aron厚玉🕐 2026-07-28 TikTok运营CodexSkillMCP自动化选品达人营销Agent技能工作流数据分析
C Codex + Hyperframes + HeyGen +声音克隆:零基础自媒体变现全开源 作者分享了利用 Codex、Hyperframes、HeyGen 和 IndexTTS2 等工具构建的自动化视频工作流,实现了零基础、低成本的短视频制作与变现。文章详细介绍了各工具的选型理由、工作流架构及成本账单,旨在帮助读者通过 AI 技术解决内容生产的效率问题。 技术 › 工具与效率 ✍ 雪踏乌云🕐 2026-07-27 AI自媒体视频制作HeyGen声音克隆CodexHyperFrames自动化变现工作流
我 我是如何用 Codex 做自己的个人IP生图工作流的 作者分享了如何利用 Codex 构建个人 IP 生图工作流的经验。通过借鉴优秀项目,将思路从拼图改为拼提示词,开发了封面图和段落图两个 Skill。文章详细介绍了风格确定、人物特征锚定、内容总结及安全区适配等优化过程,强调了 AI、代码与人在工作流中的职责分工。 技术 › Codex ✍ naiyue777🕐 2026-07-26 CodexAI绘图个人IP工作流Skill自动化设计开源项目
打 打造爆款短视频的AI Agent实战 作者分享了如何构建一个能自动制作爆款视频的AI Agent。该代理通过分析数据寻找热门格式,利用Kimi、Seedance等工具自动完成脚本、剪辑和分发,并根据反馈自我优化。月成本仅111美元,收入达14700美元,实现了全自动化的内容生产闭环。 技术 › Agent ✍ Fokki🕐 2026-07-23 AI Agent短视频自动化KimiSeedance变现工作流视频生成
H HyperFrames Storyboard: 掌控 AI 视频输出的分镜流程 文章介绍了 HyperFrames 的新功能 Storyboard,通过模仿电影制作中的分镜流程,让 AI 在生成视频前先制定计划、草图和布局,允许用户在低成本阶段进行修改和指导,从而提高视频生成的可控性和效率。 技术 › AI视频 ✍ HeyGen🕐 2026-07-23 AI视频分镜HyperFramesHeyGen自动化工作流视频生成
图 图书解读视频制作教程与实践案例 文章介绍了如何利用 Codex、AI 图片、AI 配音和 HyperFrames 制作 60-90 秒的中文图书解读短视频。作者以《活着》为例,详细分享了选书、脚本写作、图片生成约束、声音选择、字幕对齐及剪辑转场等全流程,并将经验封装成 Skill,为想做自媒体的人提供了一条不露脸、低门槛的内容创作路径。 技术 › Skill ✍ Smartpig🕐 2026-07-21 AI视频图书解读CodexHyperFrames自媒体工作流自动化AIGC短视频教程
用 用Codex做自媒体,我建议你先装好这10个Skill 本文推荐了10个Codex Skill,覆盖自媒体创作全流程:选题、素材、创作、设计、发布及复盘。这套工具链能帮助新手将重复性工作自动化,构建高效的内容生产流水线,但账号成功仍需依赖个人选题判断与持续输出。 技术 › 工具与效率 ✍ zhouluobo🕐 2026-07-19 Codex自媒体AI工具Skill工作流Agent自动化内容创作效率复盘
有 有嘴就行!AI一键生成小红书和公众号内容的自动化工作流 本文介绍了如何利用 AI 将一篇长文自动转化为适配小红书和公众号的“内容发布包”。作者详细阐述了从 Brief 撰写、图文卡片拆解、图片生成到公众号文章改写的全流程,并提供了封装好的开源 Skill 和具体 Prompt,旨在帮助创作者实现跨平台内容的高效生产与分发。 技术 › Agent ✍ Kimberly🕐 2026-07-12 AI工具小红书公众号内容创作工作流自动化PromptCodexSkill开源
A AI 视频创作的新范式:Codex + Remotion 文章探讨了将视频制作转化为代码工程的“视频即代码”新范式。通过结合 Codex(负责编写和迭代代码)与 Remotion(负责 React 组件渲染视频),创作者可以实现视频的组件化、参数化和版本控制,解决高频生产中的可控性与复用难题。文章详细介绍了工作流、工具链选型、项目结构搭建以及避坑指南,强调了从单次生成向系统化生产转变的重要性。 技术 › Codex ✍ 知识猫图解🕐 2026-07-03 视频生成RemotionCodex视频工程工作流AI创作React自动化组件化Agent
把 把 Codex 变成内容工厂:7 类创作者 Skill 配置表 本文针对不同类型的创作者(如公众号长文、小红书图文、短视频、知识付费、商业广告等),推荐了对应的 Codex Skill 配置清单。文章列出了每个方向所需的 10 个核心技能,旨在帮助用户搭建高效的内容生产工作流,涵盖资料整理、设计辅助、视频剪辑、课程制作及客户转化等场景。 技术 › Codex ✍ Ando|AI自救实验🕐 2026-06-17 CodexSkill内容创作工作流AI工具小红书短视频知识付费带货效率提升