# Seedance 2.0 全步骤详解 + 进阶技巧
**作者**: Miko
**日期**: 2026-04-11T20:16:53.000Z
**来源**: [https://x.com/Mho_23/status/2043060741616603442](https://x.com/Mho_23/status/2043060741616603442)
---

现在你可能已经到处看到 Seedance 2.0 了。每个 AI 内容创作者都在谈论它,而且理由充分。
这是字节跳动全新的 AI 视频模型,它的工作原理与市面上其他产品截然不同。大多数 AI 视频工具的工作方式都一样——输入提示,生成视频,然后祈祷效果好。而 Higgsfield 上的 Seedance 2.0 则允许你同时输入图像、视频、音频和文本。每一种输入都会成为特定要素的参考,例如风格、动作、镜头运用、节奏或人物外观。
现在我们不再只是提供灵感,而是拥有完全的创作控制权。
我尝试过在多个平台上访问 Seedance,但大多数平台要么不稳定,要么根本无法正常工作。目前来看,Higgsfield 是使用 Seedance 最高效的地方。它无需等待或排队,而且全球用户都可以访问。更重要的是,他们已经实现了完整的全域参考系统,这正是 Seedance 2.0 真正实用之处。
本指南主要介绍 Higgsfield 上的 Seedance 2.0 以及如何正确使用它。但在深入探讨之前,你需要一些好的初始图像和逼真的音频。我在之前的指南中已经多次提到过这一点,所以这里简单概述一下。
创建逼真的初始图像
你的初始图像就是基础。如果它看起来像人工智能生成的垃圾,那么你的视频看起来也会像人工智能生成的垃圾。
关键在于使用 Nano Banana Pro 中的 JSON 提示进行颜色分级,这样你的图像就不会呈现出那种标准的灰色 AI 风格。

how to create realistic AI images
我另一个非常有效的方法是在 TikTok 上寻找我所在领域的参考内容。比如,如果我要为某个咖啡品牌制作内容,我会搜索 TikTok 上的这个品牌,找到一些真实用户测评该产品的视频。截取一个看起来不错的画面,导入到 Claude 或 Gemini 等编辑器中,让它们生成一个 JSON 提示来重现该画面。然后我会调整这个提示,创建我自己的独特角色,比如不同的服装、不同的背景等等,以满足我的需求。这样,我制作的初始画面就已经很像该领域热门内容的类型了。
请确保您的原始图像质量足够高,然后再切换到视频格式。输入垃圾图像,输出的也是垃圾图像。
打造逼真的 AI 语音
音效决定了作品的真实感。画面可以完美无瑕,但如果声音听起来像机器人一样,人们会立刻划过屏幕。

请先制作旁白,然后再制作视频。您需要将此音频文件上传到 Higgsfield 作为参考。
但我还有另一种方法,效果更逼真。与其单独生成音频,不如找一段语音质量符合你要求的视频,提取音频,然后将其作为语音 ID 参考上传到 Higgsfield。之后,你告诉 Seedance 使用这段音频作为语音参考,但让他们说你自己的对话。
所以提示信息大概是这样的:“使用这段音频作为她的声音识别参考。不要让她说出音频里的话,只需将其用作声音识别即可。”
这让你能够复制任何逼真的声音,并让它说出你想说的任何话。该模型会在保持自然音调的同时,复制该声音用于你的自定义对话。这是目前获取逼真声音的最佳方法之一,因为你无需从零开始生成声音,而是参考了已经听起来很真实的声音。
如果这还不清楚,别担心,你马上就会明白我的意思了。
HIGGSFIELD 上的 SEEDANCE 2.0 工作流程
现在你有了初始图像和音频。接下来就轮到希格斯菲尔德了。
规格:最多可输入 9 张图像,最多可输入 3 个视频(总时长不超过 15 秒),最多可输入 3 个音频文件(MP3 格式,最长 15 秒),每代输出时长 4-15 秒,原生 2K 分辨率,可生成原生音效和音乐,每代最多可输入 12 个文件。
与其他每次生成 5-8 秒的模型相比,Seedance 每次生成 15 秒的视频时长相当可观。关键在于,Seedance 并非将一堆随机片段拼接在一起,然后祈祷它们匹配。你先生成最初的 15 秒视频,然后以此为参考进行扩展。模型始终保持相同的角色、声音和环境。你可以无限次地将这些扩展视频串联起来。
大多数其他视频剪辑软件需要你生成大约 50 个不同的片段才能拼接成一个 40 秒的视频。这非常耗时,而且片段之间永远无法完美衔接。而使用 Seedance,我只需要生成 3 个片段,就能得到一个流畅自然的 45 秒视频。一旦你掌握了工作流程,它的效率简直令人难以置信。
系统 @
这就是 Seedance 2.0 在 Higgsfield 上运作的核心,也是为什么它感觉像是在进行真正的指导而不是提示。
当您将资源上传到 Higgsfield 时,它们会自动被标记为 @Image1,@Image2,@Video1,@音频 1 以此类推。然后,你可以在提示符中直接引用它们,告诉模型每个文件的具体用途。
对于人工智能用户生成内容(AI UGC),您的基本工作流程如下所示:
上传您的 Nano Banana 起始图片 @Image1 上传您的配音或语音参考资料 @音频 1 如果你的角色拿着一件商品,请上传该商品的图片。@Image2
然后你的提示符会引用每一个:“@Image1 这是视频的起始画面。@Image2 这就是咖啡袋的样子。对话和音频的参考图片请参考此图。@音频 1“
但它的强大之处就在于此。你可以非常具体地设定视频每个部分的具体操作。Seedance 的最佳使用方式就是让你把所有细节都明确地设定好。不要赋予它过多的创作自由。如果你清楚地知道自己想要什么,以及最终呈现的效果,那么没有比 Seedance 更适合严格按照你的指示执行的软件了。
时间戳方法
这是效果最好的提示系统。
与其写一个笼统的提示然后听天由命,不如把每个时间戳发生的事情都具体化。每隔4-5秒,你都要指定对话和你想要的具体画面。
示例结构:“0-4秒:介绍。对话:‘我刚做了一杯花生酱杯蛋白咖啡,含有25克蛋白质。’画面:视频开始时,拍摄对象拿着一个装满浅棕色咖啡的透明圆形玻璃罐。她的左手拿着玻璃罐,右手则在搅拌咖啡。”
5-12 秒:解释益处。对话:“早上在咖啡里摄入 20 到 30 克蛋白质真的很有帮助。”画面:受试者放下杯子,拿起蛋白粉袋。@Image2 说话时,他把手机举向镜头。
你需要对视频的每个部分都这样做。模型会严格按照你的指令执行,甚至连最后一句话都不放过。这样才能获得一致且可用的输出,而不是生成无法使用的随机结果。
该模型会自动为您进行编辑。
人们对 Seedance 的一个误解是,它是由字节跳动(TikTok 的开发商)训练的。字节跳动深谙视频剪辑、剪辑技巧、转场和节奏把控。该模型知道如何让内容更贴合短视频平台的风格。
我的指令里没有指定剪辑点,但模型仍然能自然地添加。它能切换角度,处理转场,还能添加感觉像真实用户生成内容一样的动态效果。你可以在输出结果中看到它自动切换到不同的帧。这都是模型的功劳。
如果您需要特定的剪辑,可以直接说明。想要在某个时刻跳切?请明确指出。想要在产品展示时放大画面?也请明确指出。模特会完全按照您的要求进行操作。
这就是为什么后期剪辑如此简单。我只需要把3到5个片段剪辑成一个45秒的视频,模特已经完成了95%的工作。我只需要把这些片段排列好,可能还会加一些字幕。
延长视频时长
只要你赢下最初的15秒,其他一切都会变得容易。
下载你的第一个视频片段。将其上传回 Higgsfield。@Video1 然后提示:“延长此视频。保持原视频的配音不变。” 添加下一部分所需的任何新产品图片。 指定接下来 15 秒内要发生的情况。
该模型与原视频片段保持了一致性。相同的角色、相同的配音、相同的场景。你不是在期望片段匹配,而是在实际延长同一个视频。
扩展提示示例:“扩展”@Video1. 如果她说要喝蛋白奶,就用这个瓶子(@Image2 保持原视频中的声音不变。16-30 秒:她解释好处。对话:“早上摄入蛋白质真的很有帮助。它能让你有饱腹感,这样你就不会吃零食了。”画面:她拿起蛋白奶瓶,对着镜头展示,然后倒进咖啡里。
把这些片段串联起来,你就可以根据需要制作任意长度的内容。我通常会为一个 45-60 秒的视频制作 3 个扩展片段。一旦你掌握了提示系统,整个过程大概只需要 20 分钟。
绕过字符限制
seedance 每个提示的字符数限制为 2000 个,如果您想要详细的时间戳和动作描述,这可能会造成限制。
以下是解决方法。打开 Canva,创建一张图片,并将你的完整详细提示以文字形式呈现。所有你需要的动作都要精确到秒。然后将这张图片上传到 Higgsfield 作为参考。
然后,在你的实际提示中,你只需说:“转录这幅图像并使用这里描述的动作。”
Seedance 非常智能,能够读取参考图像中的文本并使用这些指令。这使您可以突破字符限制,为复杂的视频提供极其详细的提示。
你也可以将此方法用于任何需要较长提示的情况。将详细说明写在 Canva 图片中,上传作为参考,然后告诉模特阅读并按照说明操作。
后期制作
有了视频素材之后,剪辑工作就非常简单了。
从 Higgsfield 导出,导入到您选择的视频编辑器中,整理片段,并根据需要添加字幕。模型已经处理了剪辑和转场,所以您主要只是进行排序。
为了提升视频分辨率,我先用 Higgsfield 的 Topaz 视频放大器以 2 倍放大倍率和 60fps 的帧率处理视频。然后将其导入 CapCut 并以 30fps 的帧率导出。这样既能使画面更加流畅,又能保持社交平台所需的自然感。大多数内容通常以 30fps 或 24fps 为基准,因此最终输出并不需要 60fps。
专业提示
使用高质量的初始图像。如果你的 Nano Banana 图像存在瑕疵,你的视频也会继承这些瑕疵。
先生成音频,或者使用语音识别参考方法。机器人语音会毁了一切。
你的指令一定要非常具体。详细说明每一个动作、每一秒、每一个视觉细节。Seedance 比任何其他模型都能更好地执行指令,但前提是你必须给它下达指令。
使用时间戳方法。将视频分成 4-5 秒的片段,并准确描述每个片段中发生的事情。
与其重新生成,不如进行扩展。一旦你有了满意的第一个片段,就用它作为参考进行扩展。这比从头开始效率高得多。
对于较长的提示,可以使用 Canva 方法。将详细说明放在图片中,然后将其作为参考上传,即可绕过字符限制。
完整管道
关键在于拥有一个涵盖视频所有环节的详细提示系统。一旦完善了这套系统,你就能快速制作视频。我指的是,一旦你掌握了工作流程,每个视频的制作时间可以控制在 5 到 10 分钟。
Seedance 2.0 现已在 Higgsfield 上架,面向全球用户提供完整功能。其全能参考系统和扩展功能使其成为制作工作的理想之选。
这是我们目前在付费广告和自然内容中使用 AI 用户生成内容的流程。该模型可以处理很多以前需要手动完成的工作。你只需要学习如何正确地指导它即可。higgsfield.ai 关于这一点
## 相关链接
- [Miko](https://x.com/Mho_23)
- [@Mho_23](https://x.com/Mho_23)
- [42K](https://x.com/Mho_23/status/2043060741616603442/analytics)
- [@Image1](https://x.com/@Image1)
- [@Image2](https://x.com/@Image2)
- [@Video1](https://x.com/@Video1)
- [@音频 1](https://x.com/@Audio1)
- [@Image1](https://x.com/@Image1)
- [@音频 1](https://x.com/@Audio1)
- [@Image2](https://x.com/@Image2)
- [@Image1](https://x.com/@Image1)
- [@Image2](https://x.com/@Image2)
- [@音频 1](https://x.com/@Audio1)
- [@Image2](https://x.com/@Image2)
- [@Video1](https://x.com/@Video1)
- [@Video1](https://x.com/@Video1)
- [@Image2](https://x.com/@Image2)
- [higgsfield.ai](http://higgsfield.ai/)
- [升级至高级版](https://x.com/i/premium_sign_up)
- [4:16 AM · Apr 12, 2026](https://x.com/Mho_23/status/2043060741616603442)
- [42.8K Views](https://x.com/Mho_23/status/2043060741616603442/analytics)
- [View quotes](https://x.com/Mho_23/status/2043060741616603442/quotes)
---
*导出时间: 2026/4/12 22:03:32*