# Codex自动化剪辑基础篇:一条视频是怎样被自动做出来的?
**作者**: xilo
**日期**: 2026-07-26T09:14:51.000Z
**来源**: [https://x.com/xilo2991/status/2081307246739517629](https://x.com/xilo2991/status/2081307246739517629)
---

这篇内容偏理论,可能没有多少人会看。但是如果你想让Ai帮你做出高质量视频,想要通过自动化批量生产视频提效或变现。
一定要花点时间看看这篇文章,包有用的。
朋友们,好久不见呀!
前段时间,我写过两篇关于Codex自动化剪辑的文章,朋友们抬爱都获得了还不错的流量。然后文章发了以后,就有很多朋友问我一些自动化剪辑的问题。
想了想,可能给大家拆解一下我用Codex进行自动化剪辑的底层逻辑和思路,会有用一些。基本上你们在𝕏上看到的我发的电商广告、图书带货、动画科普这些demo,都是基于这一套底层逻辑搭建起来的。
希望朋友们在读过以后,也能根据自己的需求,DIY出自己的专属视频剪辑工作流。
# 00. 视频的本质

在正式开始之前,我们可以先看两个视频。


大家刚才看到的这两个视频,其实差别还挺大的。
一个是动画科普,一个是图书介绍。无论是内容、画面风格,还是最后呈现出来的效果,看起来都不像是同一类视频。
但如果我们暂时把内容、风格、效果这些表现形式拿掉,一条视频最基础的结构其实非常简单。
视频,本质上就是画面和声音的合理编排。
所以,用Codex做自动化剪辑要考虑的也就是三件事。
第一是怎么解决画面,第二是怎么解决声音,第三是怎么把它们合理的编排在一起。
# 01. 怎么解决画面?
我们先来看第一个问题,画面从哪里来。
如果只是偶尔做一条视频,可能需要什么画面,就临时去找什么画面。
但如果你想长期、稳定地做自动化剪辑,我觉得最关键的一步,就是花点时间去建立自己的素材库。
补充一点解释。
这里说的素材,简单理解,就是所有可以直接剪进最终视频里的原始画面。
可以是自己拍摄的视频,也可以是AI生成的画面、从素材网站下载的视频,或者图片和录屏。
把这些画面提前筛选、分类,放到一个Codex可以调用的文件夹里面,就是我这里说的素材库。
## 为什么要花时间搭建素材库?
主要原因是素材库可以帮我们有效控制画面的质量。
如果每做一条视频,都让Codex临时去网上寻找素材,或者用Ai直接生成,那整体的一个质量、风格都很难保证,最后做出来的效果也不太可能会稳定。
但有了素材库就不一样了。
一条素材进入素材库以前,我们已经先检查过它的画面内容、清晰度、人物或产品是否正确,以及它大概适合表达什么内容。
剩下的工作,无非是让Codex从素材库里挑选出合适的内容,再决定使用哪几秒、放到哪个位置,如何安排素材前后顺序。
所以只要素材库搭建好,画面质量问题基本可以解决七八成。
## 怎么搭建素材库?
筛选是第一步,完成筛选以后我们还需要对素材进行分类整理,把不同素材放进不同文件夹里。
比方说做电商视频,抖音上的广告素材虽然千奇百怪,但你按照产品维度拆分开,无非就是产品展示、功能功效展示、使用场景展示。
然后功能又可以分为功能A、功能B、功能C......
如果你的素材很多,你还可以做进一步的细分,比方说按照拍摄视角继续分成全景、中景、近景、特写、俯拍、仰拍、固定镜头、移动镜头这些。
又或者说是像我前面展示那种动画科普视频,虽然部分素材是Codex直接生成的,但是也有很多画面展示效果是读取素材库的。
比方说角色动作库、画面布局库、A-roll/B-roll动效库。

所以它整个出来的效果,就会比平时看到的一些视频效果要好很多。
素材库的搭建和分类,没有固定形式,不管是你自己设计还是让Codex设计都没有问题。核心关键在于,让Codex理解这套素材库的运行规则。
拿我自己搭建的电商素材库来说。
我们的素材库,其实主要分成了三个层级。

第一层,是按照产品维度去搭建的,包括产品外观展示、产品功能展示、使用场景展示。
第二层,则是在第一层基础上,做进一步细分,比方说产品外观有正面、侧面,产品功能有A、BC.....
第三层,则是增加了镜头语言,按照拍摄产品的景别、视角、拍摄方式这些维度,对每一个素材进行了不同的编号和命名。
有很多朋友问过我,搭建了这么大的素材库,token消耗会不会很大?
其实不会的。
分类以后,Codex真正需要筛选的素材可能只有几十条。
比方说当前镜头需要的是产品展示,Codex就只需要找到产品展示文件夹。
文件夹里可能有几百上千条关于产品展示的素材。但是按照特写、中景、全景继续缩小以后,每个景别可能只剩下几十条。
所以Codex不需要先把整个素材库全部过一遍,更不需要给几千条素材逐条抽帧、逐条理解。
它只要从我提前设定好的分类里,找到最适配的那部分素材就可以了。
## 怎么筛选素材?
OK,朋友们可能还会有的疑问,就是什么样的素材,是适合进素材库的?
我自己评估的标准就只有两点,素材质量合格,并且可复用性高。
素材质量合格这点非常好理解。
评估一条素材到底是好还是不好,其实是非常容易的。画面清晰不清晰,产品拍得正不正确,人物表情自然不自然,这些你肉眼一看就能看出来。
所以只要你在收集素材的时候,稍微花点时间筛选一下,把那些画质模糊的、拍摄角度奇怪的、或者产品展示不清楚的素材直接过滤掉就可以了。
剩下能进素材库的,基本上都是质量合格的素材。
复用性高怎么理解呢?
就是找到你所有素材资产中,哪些部分是可以被重复使用的。
比方说我的动画科普视频。
在这条视频里我可能用了一个角色走路的动画,这个动画就是可复用的素材。因为下个视频,或者下下个视频,只要有类似的表达场景,我都可以用得上。
又或者说电商素材。
我们所有的素材片段,无非就是从各个角度去展示产品,以及从各个角度去展示产品的使用场景。
只要确保拍摄质量是OK的,这些素材其实全部都是可以复用的。
在这个基础上,我们其实还做了一个新的动作。

视频剪完之后发出去以后,我们会定期对这些视频去做复盘,去做分析。
分析过程中,我们就会发现有一些素材片段,它的数据会比其他素材片段的数据要好。
比方说完播率更高,或者停留时长更长。
所以这些素材片段,我们就会在它命名里面加一个字母S,代表高质量的素材。
下次用Codex去剪辑的时候,它就会优先去选择这一部分有爆款潜质的素材。
 — 未授权读取目录
# 第二部分:怎么解决声音

画面解决以后,第二个问题就是声音。
声音这块其实主要就是两部分,一个是人声配音,一个是BGM和音效。
## 人声配音怎么解决?
基本上就是三种方式。
第一种是自己配音。
如果你自己的表达和声音状态比较稳定,自己录制肯定是最自然的。并且你录制的声音是你自己的专属声音,它实际上对你的账号IP会有明显加持作用。
第二种是让AI克隆自己的声音。
如果你觉得自己录音没有情绪,或者不善于表达,也可以考虑让AI克隆自己的声音。
比较好用的开源方案是VoxCPM。你只要提供一段干净、清晰、没有背景音乐和环境噪声的参考音频,它就可以学习你的音色,再用这个音色生成新的文案。
第三种是直接使用平台提供的现成音色。
比方说我们在网上看到很多那种猴哥配音、蜡笔小新配音、容嬷嬷配音,都是现成训练好的AI音色。你只要提供文案,就可以按照对应声音生成。
这里比较推荐的方案是火山引擎的豆包语音API。基本上主流热门的音色都有,而且和剪映里用的配音是同一套语音模型,非常适合用来制作娱乐或带货营销类视频。
不过这个是收费的,一条1分钟左右的配音,大概需要4毛钱。免费的方案也有,例如微软的Edge-TTS,如果你对声音的情感要求没那么高,也是OK的。
## BGM和音效怎么解决?
这里其实可以参考画面搭建素材库的方式,给BGM和音效也搭建一个素材库。
拿音效来说。
虽然市面上可用的音效有几千上万种,但实际上,同一个类型或赛道的视频,能用到的音效其实是有数的。
所以你可以先去收集几条对标账号的视频,分析他们一般会使用哪些类型的音效。
比方说电商带货视频,可能就是产品出现的"叮"一声、功能展示的"嗖"一声、价格出现的"duang"一声,还有转场的"唰"一声。
你把这些音效类型总结出来以后,再去对应地找到这些音效,放到本地的素材库里面,Codex就可以直接调用了。
BGM也是一样的逻辑。
看对标账号的视频,分析音乐风格,分析音乐情绪和节奏,然后储存到素材库里。
我自己用得比较多的音效来源是咸鱼,几块钱就可以买到别人精心整理好的音效素材库。BGM的话,可以试试杨樾和43Music团队做的一个音频API服务,免费用户每个月可以调用300首音乐,自动化剪辑怎么都够了。
或者如果你不需要频繁变更音乐的,也可以去爱给网上找一些免版权的BGM,下载几首固定用就可以了。
# 第三部分:怎么把画面和声音合理编排
画面和声音都准备好以后,最后一个问题,就是怎样把它们合理地编排在一起。
这个问题听起来很复杂,但其实最简单的做法,就是先找一个参考视频。
你想做什么类型、什么节奏、什么风格的视频,就先找一条对应的视频交给Codex。
找到参考视频以后,让Codex分析和学习,理解这种类型的视频是怎么组织内容的。
比如开头用什么方式吸引注意力,中间怎样解释问题,什么时候切换画面,每个镜头大概停留多久,画面节奏是越来越快还是逐渐放慢,以及不同位置分别需要什么类型的画面。
这里其实比较重要的是,让Codex把参考视频背后的编排规律提取出来。
了解视频编排规律以后,Codex就知道每个位置需要找什么类型的素材,以及整条视频应该保持什么节奏。
另外,很多朋友在找参考视频时,可能会有一个误区。

会觉得必须找到一条和自己想做的内容完全一样的视频,再把整条视频交给AI。
但如果我们做的是原创内容,很多时候根本找不到这样一条完全对应的参考视频。
所以参考不一定非要是一条完整的视频,也可以来自很多条不同的视频。
还是拿我前面展示的动画科普视频来说。
它的画面是Codex根据我的文案理解语义以后,再去匹配和生成的。这里面的画面,就是我给Codex找了非常多的参考片段。
比方说动效参考。
看到别人视频里某种文字出现方式、图形运动方式或者转场效果比较好,可以把对应片段录下来丢给Codex分析。
又或者可以去找一些有设计感的网站,然后丢给Codex,让Codex分析网站动效。
分析以后,再把这些动效整理成一个可复用的动效库,就可以做到稳定产出需要的动画效果。
还有画面和布局参考。
比方说哪个视频的标题位置比较好,哪个画面的主体和文字排布比较清楚,哪一种信息卡片、图表或者配色比较适合,都可以分别截图保存下来。
这些参考也不需要来自同一个作者。只要某一个局部的表现形式值得学习,就可以单独交给Codex,让它分析这个布局由哪些元素组成,以及以后应该在什么场景下使用。
但是这里一定要跟Codex说清楚,你要参考的是什么,是布局还是动画效果,或者是配色?
避免Codex瞎改,破坏了你整体的风格一致性。
OK,找完参考以后,下一步就是让Codex根据参考,调用对应的工具执行就成。

最基础的工具:FFmpeg
这套流程里最基础、最通用的工具是FFmpeg。
它可以读取视频的分辨率、帧率和时长,也可以检测镜头变化、提取完整音轨、抽取关键帧。
到了组合阶段,它可以裁切素材、统一尺寸、按照时间顺序拼接、加入配音和字幕,最后渲染出一条可以直接播放的MP4。
它的优势是稳定、精确,而且可以重复执行。
需要复杂动效:Remotion和HyperFrames
如果视频不只是素材拼接,还需要大量文字动画、图表、界面演示和视觉包装,只用FFmpeg写起来就会比较麻烦。
比方说现在抖音上比较常见的一类视频,真人出现在画面中间或者一侧,旁边不断出现关键词、箭头、图标、数据图表和产品卖点。
这类画面更适合使用Remotion或者HyperFrames。
它们可以把文字、图片、图表、网页元素和动画写成代码,再按照时间轴渲染成视频。
Codex负责生成和修改动画代码,Remotion或者HyperFrames负责把这些代码渲染成动态画面。
像我前面展示的动画科普视频,就是用FFmpeg和Remotion做的。
需要进入剪映继续修改:pyJianYingDraft
如果最后还要进入剪映做人工微调,可以使用pyJianYingDraft。
这个工具,可以把Codex编排好的视频脚本,转换成剪映支持的草稿工程文件。
这样打开剪映以后,你就可以进行后续的微调和优化。
# 写在最后
OK,内容到这里其实就差不多了。
今天的内容整体会比较偏理论化一点,没有太多的实操干货。
但是,相关的实操流程和步骤,我在前面的长文里面其实已经讲得非常详细了。
朋友们有时间可以去回看一下,然后再跟着实操一遍,大概率还是可以跑通的。
以上,希望对朋友们有些帮助。
还是老规矩,如果有什么卡点的,随时可以找我聊聊,期待看到朋友们做出来的有意思的自动化视频作品。
祝好🍀
## 相关链接
- [xilo](https://x.com/xilo2991)
- [@xilo2991](https://x.com/xilo2991)
- [179K](https://x.com/xilo2991/status/2081307246739517629/analytics)
- [Upgrade to Premium](https://x.com/i/premium_sign_up)
- [5:14 PM · Jul 26, 2026](https://x.com/xilo2991/status/2081307246739517629)
- [179K Views](https://x.com/xilo2991/status/2081307246739517629/analytics)
- [View quotes](https://x.com/xilo2991/status/2081307246739517629/quotes)
---
*导出时间: 2026/7/27 09:32:30*