# I 人的救星,不用真人出镜,制作口播视频
**作者**: LE
**日期**: 2026-06-01T15:22:11.000Z
**来源**: [https://x.com/lewangx/status/2061468358118388103](https://x.com/lewangx/status/2061468358118388103)
---

准备一张自己的照片。然后找一些用于参考生成的视频,从视频上去截两张画面用于生图的参考。我在用 Groq 这个平台,我看到它页面的广告拍的挺好的,所以我就直接在这个视频里面截了两张,一张是近景的大头照片,还有一张远景的全身照片。

来自 groq.com 的截图
因为我有 Liblib 的会员,所以我看到它这能够生成数字人,就试了一下,感觉效果还不错。所以以下的教程是基于 Liblib来做的。
把自己的照片和截取的照片分别发给 AI,告诉 AI 把图一中的人物换成图二中的,要保持图一的风格。然后近景的和远景的照片分别生成一下。

使用参考图片生成的用于制作口播视频的图
然后用 Claude 或是 ChatGPT 之类的的工具,然后自己想选一个主题,让它写一个一分钟左右的口播文案。尽量让口播控制在 1 分钟以内,我用视频生成工具最长只能生成是 1 分钟以内的视频。

这一步非常关键。其实在我的视频里面,我的声音并不是 AI 克隆的,而是我真的读出来了。接下来我拿出了手机,然后有感情的去把前面 AI 生成的口播文本读出来,并且用手机录下来。尽量控制好读的速度和情感,让整个声音在一分钟以内。

有了声音之后,就可以把之前生成的图片和声音一起传给数字人这个工具。我是分别生成了两次,一次近景的,一次远景的。把自己的声音从手机里面导出来,上传给这个工具,然后点击生成。

这样生成的视频就会使用我的声音来说话,而不是 AI 生成的声音。所以感觉起来这个视频很真,很大的一个原因是这个声音就是我真人说的,而画面其实是 AI 生成的。因为人的感官有视觉的、有听觉的,听觉是非常敏感的。

生成两个视频之后,就可以导入到剪映当中,做一下混剪。添加一个封面就 OK 了。
如果口播的内容比较长,超过 1 分钟,也可以手动去截取一下,然后分别去生成,最后用剪辑工具把它合在一起。我也试过,效果也蛮好的。
以上就是教程的全部内容。
## 相关链接
- [@lewangx](https://x.com/lewangx)
- [6.4K](https://x.com/lewangx/status/2061468358118388103/analytics)
- [groq.com](https://groq.com/)
- [Upgrade to Premium](https://x.com/i/premium_sign_up)
- [11:22 PM · Jun 1, 2026](https://x.com/lewangx/status/2061468358118388103)
- [6,456 Views](https://x.com/lewangx/status/2061468358118388103/analytics)
- [View quotes](https://x.com/lewangx/status/2061468358118388103/quotes)
---
*导出时间: 2026/6/2 12:09:05*