
Seedance 2.0 角色一致性:参考、声音与镜头
让 Seedance 2.0 视频保持同一角色的官方方法:参考语法、12 槽位输入预算、声音与口型同步,以及多镜头提示词。
角色一致性正是 Seedance 2.0 采用当前形态的原因:模型在一次生成中最多可接收 9 张图片、3 个视频片段和 3 条音轨作为参考[1],字节跳动自己的提示词指南还记录了将主体绑定到指定参考图片的语法[2]。我在社区讨论中看到的大多数挫折(“同一个角色回来时变了样”“它忽略了我的第二张参考图”),都源于一些已经写进文档、却几乎没人阅读的规则。
这篇指南汇总了这些规则,来源包括字节跳动官方提示词文档、API 参考以及 Dreamina 自己的教程,同时也如实说明边界:哪些能力没有官方机制(跨请求角色锁定、seed),以及哪些能力属于哪个平台(口型同步问题)。
要点速览
- Seedance 2.0 的输入预算是 9 张图片 + 3 个视频 + 3 段音频,其中视频和音频的总时长上限分别为 15 秒;音频不能在没有其他内容的情况下单独发送[1]。
- 官方绑定语法确实存在:用编号图片定义主体(“subject@image 1”),并把最重要的参考素材放在前面,因为顺序会影响权重[2]。
- 字节跳动建议使用 4–5 个参考素材,而不是填满上限,每个角色使用一张头像和一张全身照,并建议不要为同一张脸提供多角度素材集[2]。
- 没有 seed 参数,也没有持久角色 ID。 跨视频一致性来自重复使用完全相同的参考素材集,以及用
return_last_frame延续画面[1][3]。 - 声音引导是真实能力,但口型同步的表述取决于平台:API 文档说明音频参考会引导表演[1];明确的“lip-sync”承诺出现在 Dreamina 文档中,而不是 API 文档中[4]。
- 多镜头有官方格式:为镜头编号(“Shot 1… Shot 2… Shot 3…”),同时根据字节跳动自己的警告,不要把每个镜头的精确时间视为可靠结果[2]。
Seedance 2.0 的 12 槽位参考预算,准确说明
Seedance 2.0 通过内容数组接收参考素材,数组中的每一项都会声明一个角色。文档规定的上限是:最多 9 张参考图片(包括 JPEG、PNG、WebP 等格式,宽高比在 0.4 到 2.5 之间,单边 300 到 6,000 像素,每张小于 30MB);最多 3 个参考视频,总时长不超过 15 秒;最多 3 条音频参考,总时长同样为 15 秒[1]。音频是修饰条件,不是主体:如果请求只发送音频而没有其他内容,API 会拒绝[1]。
有一条结构规则会难倒几乎所有人:首帧模式和多模态参考模式是互斥的请求结构[1]。你可以给模型一张明确的开场帧供其制作动画,也可以给它一组参考素材来组合生成,但不能在一个请求中混用这两种思路。混用是最快得到“它忽略了我的图片”这一结果的方法。
最容易引发困惑性拒绝的规则是:不能把真人面孔直接上传为参考素材。这项限制及其获得许可的基于同意的途径是另一个主题,详见我们的不符合条件指南。
锁定角色的官方语法
字节跳动的提示词指南对绑定方法给出了少见的具体说明。标准格式使用编号图片定义每个主体,文档将其写作“subject@image 1”[2];发布博客自己的示例提示词使用了相同的 @ 风格引用[5],Dreamina 的教程则在编辑器中以 @AssetName 的形式复现[6]。这种语法用于消除歧义:同时使用多个参考素材时,提示词会明确指定哪张图片负责面孔,哪张负责服装,哪张负责地点。
围绕这套语法,指南列出了四条有效规则[2]:
- 使用 4–5 个参考素材,不要填满 12 个。 文档不建议占满所有槽位;每增加一个素材,注意力就会被进一步稀释。
- 每个角色使用一张头像加一张全身图。 这一组合比堆叠不同角度更能稳定身份。
- 不要使用同一个人的多视角素材集。 字节跳动明确建议不要这样做;它们不会防止身份漂移,反而会诱发漂移。
- 按重要程度排序。 在提示词中出现得越早,影响越大。角色放在地点之前,地点放在情绪板之前。
这就是大多数“一致性技巧”视频重新包装的全部秘诀:明确界定主体,输入数量更少但质量更高的参考素材,并有意识地安排顺序。
在多个视频中保持同一个角色
文档划定了一条边界,任何教程都不应模糊:Seedance 2.0 没有持久角色 ID、没有 seed 输入,也没有跨请求记忆。字节跳动的参数参考和 reAPI 的 API 界面都完全没有开放 seed[1][3],因此“Seedance 是否使用 seed 数字”的答案很明确:不使用。确定性控制由参考素材驱动,而不是 seed。
实际制作中,应按以下顺序操作:
固定参考素材集。 每次请求都使用相同的角色图片、相同顺序和相同绑定短语。Seedance 2.0 的一致性来自完全相同的输入,因此应将这套素材与提示词一同保存,并把任何变动都视为新的角色版本。
使用 return_last_frame 串联。 API 可以返回一次生成的最后一帧[1];将其作为下一片段的首帧继续传入,就能获得场景之间的连续性,而且接缝处不会重新随机生成身份。
让生成的面孔合法地重新作为输入。 平台在过去 30 天内为你的账号生成的内容,即使包含面孔,也会被视为可信输入[7]。正是这条规则,让面孔限制下的迭代式角色制作成为可能。
从规模化评估来看,字节跳动的技术报告将 Seedance 2.0 排在同类模型主体一致性评测的第一名[5];以上机制说明了如何在一个系列、而不只是单个片段中真正发挥这项能力。
声音、音乐与口型同步问题
Seedance 2.0 的音频参考会引导三方面:输出的声音、表演的时机和声音特征。API 在 reference_audio 角色中最多接受 3 个片段,总时长为 15 秒[1]。要让角色“表演这首歌”,实际流程正如字面意思:附加音轨(在 API 平台上使用公开 URL),用图片绑定角色,然后在提示词中描述表演。
对于口型同步,不同来源的表述并不一致,因此必须准确区分。字节跳动的 API 文档说明了音视频联合生成和音频引导输出,但没有出现“lip-sync”这个词。明确作出承诺的是 Dreamina 的产品文档,其中称声音样本会引导声音特征,并“aligns lip-sync, pacing, expressions”[4]。实际上两者由同一模型系列提供能力,但如果你的流程在合同层面要求口型精确同步,应当用自己的素材测试,而不是引用某个文档页面,因为 API 一侧的措辞有意承诺得更少。
跨片段声音一致性遵循与视觉一致性相同的逻辑:每次都在相同槽位重复使用同一个声音样本。没有可用于固定的 voice ID,因此样本本身就是 ID。
经得住生成的多镜头提示词
一个片段中包含多个镜头的官方格式,是带编号的分镜文字:“Shot 1: … Shot 2: … Shot 3: …”[2]。指南直接给出两条警告:每个镜头的精确秒数不会被可靠执行,因此应描述顺序和重点,而不是时间码[2];镜头数量会成倍增加复杂度,所以在多镜头提示词中,“减少参考素材”这条规则更为重要。
任何超过单次生成容量的内容(Seedance 2.0 上限为 15 秒[1]),都应采用“分镜 → 使用固定参考素材集为各片段编写提示词 → 通过 return_last_frame 连接”的流程。这也是 Seedance 2.5 已公布的单次 30 秒生成和分段级提示词控制试图压缩的工作流;我们的 Seedance 2.5 发布前指南会跟踪已确认的信息。
如果希望通过 API 运行整套流程,reAPI 的 Seedance 2.0已经开放完整的参考素材界面,包括图片、视频、音频、首帧和末帧返回,并按秒计费;参考模式请求的价格低于纯文本生成视频[3]。
常见问题
Seedance 2.0 最多能接收多少张参考图片?
一次请求最多 9 张图片,另加 3 个视频(总计 15 秒)和 3 段音频(总计 15 秒)[1]。字节跳动自己的指南建议使用 4–5 个精心挑选的素材,而不是填满上限[2]。
如何在多个 Seedance 2.0 视频中保持同一个人?
固定一套参考素材(头像 + 全身图),通过 subject@image 语法绑定,在每次请求中完全一致地复用,并用 return_last_frame 串联场景[1][2]。没有角色锁定参数;参考素材集本身就是锁。
Seedance 2.0 是否使用 seed 数字输入?
不使用。字节跳动记录的请求结构和 reAPI 界面中都不存在 seed 参数[1][3]。可重复性来自完全相同的参考素材和提示词,而且是软性重复,不是逐位相同。
Seedance 2.0 能根据 Suno 歌曲进行口型同步吗?
将音轨附加为音频参考,并在提示词中描述演唱表演;API 文档说明支持音频引导生成[1],而明确的 lip-sync 对齐主张来自 Dreamina 文档[4]。对于发布级同步,请使用自己的素材验证。
Seedance 2.0 最多能接收多少段音频?
3 段,总时长不超过 15 秒,而且绝不能单独使用;请求中的音频必须与其他内容一同提交[1]。
如何在一个 Seedance 2.0 片段中提示多个镜头?
按照官方指南使用编号分镜格式“Shot 1 / Shot 2 / Shot 3”;该指南同时警告,每个镜头的精确时长只能近似执行[2]。
为什么我的角色面孔被拒绝了?
真人面孔不能直接上传为参考素材;这是模型级规则,并有文档记录的基于同意的例外情况[7]。完整说明见我们的不符合条件指南。
一句话角色一致性操作手册
明确绑定主体,输入 4–5 个经过选择的参考素材并把角色放在最前,为整个系列固定这套素材,通过最后一帧串联片段,在声音重要时重复使用同一个声音样本。以上内容都来自字节跳动自己的文档,而不是传言,并且每一项都能通过 reAPI的一个端点完成。这就是没有玄学的 Seedance 2.0 角色一致性:数量更少、质量更好的参考素材,每次都以相同方式使用。
参考资料
- Volcano Engine / BytePlus(字节跳动)。Seedance 2.0 API 参考——内容角色、参考素材上限、首帧互斥性与 return_last_frame。 2026 年 7 月检索自 docs.byteplus.com/en/docs/ModelArk/1520757
- Volcano Engine / BytePlus(字节跳动)。Seedance 2.0 官方提示词指南——主体绑定语法、参考素材数量和顺序、多镜头格式。 2026 年 7 月检索自 docs.byteplus.com/en/docs/ModelArk/2222480
- reAPI。Seedance 2.0——API 文档与模型页面。 2026 年 7 月检索自 reapi.ai/docs/seedance-2-0
- Dreamina(CapCut)。Seedance 2.0 工具页面——声音样本与口型同步对齐。 2026 年 7 月检索自 dreamina.capcut.com/tools/seedance-2-0
- ByteDance Seed。Seedance 2.0 发布博客与技术报告(arXiv:2604.14148)。 2026 年 7 月检索自 seed.bytedance.com/en/blog/seedance-2-0-official-launch
- Dreamina(CapCut)。Seedance 2.0 提示词教程——@AssetName 参考与 Multiframes。 2026 年 7 月检索自 dreamina.capcut.com/resource/seedance-2-0-prompt
- Volcano Engine / BytePlus(字节跳动)。生成内容与经同意验证素材的可信输入豁免。 2026 年 7 月检索自 docs.byteplus.com/en/docs/ModelArk/2291680
延伸阅读
- reAPI。Seedance 2.0“不符合条件”:原因与可行方案。 reapi.ai/blog/seedance-not-eligible-explained
- reAPI。什么是 Seedance 2.0 以及如何使用(2026 指南)。 reapi.ai/blog/what-is-seedance-2-0-and-how-to-use-it
- reAPI。Seedance 2.5:公开发布前已知信息。 reapi.ai/blog/seedance-2-5-what-we-know-2026
作者

分类
更多文章

Seedance 2.0 vs Kling 3.0:基准、价格与结论
从盲测 Elo、功能规格到每秒价格,全面比较 Seedance 2.0 与 Kling 3.0:Seedance 的画质优势,以及 Kling 在 4K 和音频上的领先。


Claude Opus 4.8 是什么?跑分、价格与 API 调用方式
Claude Opus 4.8 是 Anthropic 面向复杂推理与 agentic coding 的模型。本文讲清它相比 Opus 4.7 改了什么、官方 benchmark 成绩、每百万 token 的价格,以及如何用 OpenAI 兼容 API 调用。


什么是 Seedance 2.0?如何使用(2026 指南)
详解 Seedance 2.0、真正的官方网站、当前所有可用平台及 API 调用方法。内容已于 2026 年 7 月核实,不靠猜测。
