GLM-5.2 is live — Z.AI's flagship with a 1M-token lossless contextfrom $0.900 每 1M tokens
Dreamina Seedance 2.5 提示词指南:参考素材与时间控制
2026/08/02

Dreamina Seedance 2.5 提示词指南:参考素材与时间控制

按照官方参考素材限制编写更好的 Seedance 2.5 提示词,掌握 30 秒分段、时间戳控制、编辑、延长与关键帧模板。

最有效的 Seedance 2.5 提示词是一份制作简报,而不是一长句电影感描述。 先说明目标,再为每个参考素材指定明确职责;把较长的动作拆成多个阶段,写清每个阶段结束时画面中可以观察到的状态,最后列出必须保持不变的人物身份、道具、空间关系和音频。这套结构来自字节跳动官方 Dreamina 提示词指南,能减少模型需要自行猜测的关系。[1]

Dreamina 官方指南还记载其支持组合最多 50 个参考素材,包括最多 30 张图片、10 段视频和 10 段音频。不过,一开始就用满所有名额通常不够稳定。[1] 本文把这些规则整理成可复用的提示词模式,同时不会把 Dreamina 创作者界面中的控制项误写成公开 Seedance 2.5 API 的请求协议。

要点速览

  • 主体 + 动作 + 场景 开始。只有当风格、镜头和音频会改变结果时,才加入这些信息。
  • 给每个上传素材一个范围明确的角色:身份、服装、产品几何、环境、动作、声音、氛围或音乐。
  • 编写 30 秒视频时,使用连续阶段;每个阶段只安排一个主要状态变化,并写出可观察的结束状态。
  • 用时间范围控制节奏,用精确时间戳指定一次转场,用相对时间描述由另一事件触发的动作。
  • 编辑视频时,把源视频指定为主素材,限定最小编辑范围,并列出所有需要保留的内容。
  • 延长视频时,先匹配衔接处的边界帧,再描述新动作。
  • reAPI 的 Seedance 2.5 尚未开放调用,当前可使用 Seedance 2.0

Seedance 2.5 提示词工作流

Seedance 2.5 提示词工作流:从参考素材角色、阶段和结束状态,到需要保持的人物身份、道具与空间关系

这个顺序是有意设计的:参考素材角色 → 阶段 → 结束状态 → 保留清单。如果模型不知道哪张图片定义人物面孔,后面再多镜头语言也无法挽救一致性。如果一个阶段没有结束状态,下一个阶段就没有可靠的起点。

官方指南记载的参考素材上限与实用起步范围

字节跳动的指南区分了文档记载的输入上限和为了提高稳定性而建议的使用范围。[1]

素材指南记载的输入上限实用起步范围
图片最多 30 张,每张不超过 4K先使用 1–8 个不同主体
视频最多 10 段,合计不超过 30 秒先使用 1–5 个主体,每段动作参考 5–10 秒
音频最多 10 段,合计不超过 30 秒只保留场景实际使用的对白、音色、环境声或音乐
视频编辑一段源视频加参考图片源视频尽量短于 20 秒,并使用 1–5 张参考图片

上限并不是目标。十张关系松散的人物图,可能比三张标注清楚的视图带来更多歧义。只有当你能补完整这句话时才添加素材:“使用这个素材来定义 ___,忽略其中的 ___。”

同一主体使用多个独立视图

当多张图片展示同一个人或同一件产品时,要明确说明。不要让模型自行判断四个视角代表同一个物体还是四个物体。

[产品身份]
@Image 1 定义同一款便携音箱的正面。
@Image 2 定义它左侧的控制区。
@Image 3 定义它背面的接口。
三张图片描述的是同一台音箱。视频中始终只保留一台音箱。

最后一句是很有用的数量约束,可以避免一组参考图被模型误解成一份角色名单。

核心提示词公式

官方给出的框架很灵活:主体、动作或事件、环境、视觉风格、镜头处理和音频。[1] 实际使用时,按重要性从高到低排列效果更好:

[目标]
制作一段产品演示视频,展示一台折叠式便携音箱在酒店书桌上展开。

[主体与事件]
一台石墨色音箱从折叠状态展开并开机,始终保持在画面中央。

[场景]
清晨的酒店房间,胡桃木书桌,柔和窗光,背景简洁。

[镜头]
展开过程使用固定中景;音箱开机后才缓慢推进。

[音频]
安静的房间环境声,一声轻柔的开机提示音,不要音乐。

不影响结果的区块可以删除。界面中已有的生成控制项不必在正文里重复,除非这段文字本身承载了创作意图。

为每个参考素材分配任务

最可靠的参考素材提示词包含两部分:继承什么,以及忽略什么。

[人物]
@Image 1 定义烘焙师的面孔、黑色短发和蓝色围裙。
忽略图片中的背景和镜头角度。

[产品]
@Image 2 定义茶罐的形状、釉面和浅绿色标签。
忽略拿着茶罐的手。

[环境]
@Image 3 定义面包店柜台、货架布局和暖色侧光。
不要复制这张图片中的任何人物或产品。

[动作]
@Video 1 定义打开茶罐和量取茶叶的节奏。
不要复制视频中的表演者、服装或房间。

[音频]
@Audio 1 定义烘焙师平静的英语声音。

不要写“图片 1–4 分别定义各个人物”。“分别”隐藏了模型真正需要的映射关系。应当逐一写清每个主体与素材的对应关系。

只创建一次主体档案

对于较长的提示词,先定义一次重要主体,后面反复使用同一个标签:

<烘焙师> = 来自 @Image 1 的面孔和头发 + 来自 @Image 4 的蓝色围裙。
<茶罐> = 来自 @Image 2 的形状和标签。
<面包店柜台> = 来自 @Image 3 的布局和光线。

之后,每个场景只需说明使用哪些档案。这能让提示词更易读,也能减少属性意外互换。

音频、对白与字幕语法

自然语言可以正常使用;当提示词混合多种声音类别时,Dreamina 指南还提供了一组简洁的分隔符。[1]

内容语法示例
音乐( )(稀疏的鼓刷声开始)
音效< ><店门铃响一次>
对白{ }{您的订单已经准备好了。}
字幕【 】【今日早间批次】

使用非中文语音时,先在台词前声明语言。只有确实重要时,才添加地区变体和表达方式:

对白语言:自然的墨西哥西班牙语。
<烘焙师> 语气温和、语速舒缓地说:{Tu pedido está listo.}

这比要求“真实自然的语音”更清楚,因为后者把语言、说话者、口音和语气都留给模型猜测。

30 秒 Seedance 2.5 提示词模板

对于包含多个事件的视频,每个阶段应只完成一个主要变化。结束状态必须是审核者可以看见的画面结果,而不是抽象情绪。[1]

[目标]
制作一段 30 秒教学视频,展示一名咖啡师制作一杯冷萃咖啡。

[0–10 秒]
初始状态:玻璃杯、冰铲和咖啡壶放在柜台上。
主要事件:<咖啡师> 把冰块装到玻璃杯的一半。
结束状态:冰铲回到托盘;装有半杯冰块的玻璃杯仍位于画面中央。

[10–20 秒]
延续同一个人、服装、玻璃杯和柜台布局。
主要事件:<咖啡师> 将冷萃倒至上方刻度,然后停止。
结束状态:咖啡壶竖直放在左侧;装满的玻璃杯仍位于画面中央。

[20–30 秒]
主要事件:<咖啡师> 盖上杯盖,并把饮品移到取餐垫上。
结束状态:完成的饮品位于取餐垫中央;双手均已离开画面。

[保持不变]
保持人物身份、围裙、玻璃杯设计、液体颜色、道具归属、画面运动方向、
柜台几何、镜头轴线、光线和房间环境声一致。

这个模板刻意省去了三类内容:每秒塞入多个动作、每个阶段更换镜头运动,以及“场景显得完整”这类模糊结尾。模型需要一个能从当前阶段传递到下一阶段的状态。

使用时间的三种方式

官方指南把时间视为节奏预算,而不是精确到帧的剪辑指令。[1]

  1. 时间范围: 0–6s6–14s14–22s。用于分配故事节拍。
  2. 精确时间点: “第 12 秒,实景灯光从蓝色切换为琥珀色。”用于一次明确转场。
  3. 相对时间: “杯盖合上两秒后,取餐铃响起。”用于描述由一个事件触发的另一个事件。

时间范围应连续且不重叠。动作可能在边界前后出现轻微漂移,因此不要用时间范围要求不可能完成的事件密度。镜头相关问题可继续阅读 Seedance 2.5 镜头控制指南

如何编写视频编辑提示词

编辑请求失败,往往不是因为修改目标不清楚,而是因为没有说明哪些内容受到保护。使用以下四部分约定:

[编辑目标]
编辑 @Video 1。在 5–8 秒内,只把桌灯从白色改为橙色。

[主素材]
@Video 1 是人物、动作、构图、镜头、遮挡、音频
和事件顺序的唯一编辑主素材。

[编辑范围]
只修改灯体以及它投射在桌面上的光线。

[保持不变]
保持人物身份、服装、表情、位置、手部动作、房间几何、镜头运动、
对白和环境声不变。

替换主体时,再加入两条规则:目标对象数量保持固定;替换对象必须继承原对象的外观变化、遮挡关系、动作和退出方式。替换背景时,把主体轮廓明确排除在编辑范围之外。

如何编写视频延长提示词

延长视频有一项不可妥协的任务:在边界处自然衔接。

向后续接

@Video 1 是需要向后延长的源视频。

延长部分的第一帧紧接源视频最后一帧。保持骑行者的
姿势和方向、自行车位置、道路几何、镜头高度、午后光线、
以及向前运动。

随后,骑行者从桥下通过,并在橙色标记旁减速。
全程只保留一名骑行者和一辆自行车;不要复制任何主体。

向前补接

向前补接时,先描述新增加的前置事件,再把源视频第一帧定义为延长部分必须到达的最终状态。同时列出在源视频开始之前不得出现的人物或效果。

边界连续并不等于像素完全相同。审核时要分别查看衔接前的最后几帧、衔接后的最初几帧,以及完整的延长序列。

首帧、尾帧与多个关键帧

在多模态参考模式中,要分别定义锚点图片:[1]

@Image 1 是首帧,定义开场构图和物体位置。
@Image 2 是尾帧,定义最终构图和物体位置。
@Image 3 只定义快递员的身份和橙色夹克。

快递员以一个连续动作,把一个包裹从厢式货车送到门口。
从 @Image 1 开始,自然到达 @Image 2。
保持人物身份、包裹数量、建筑几何、光线和镜头方向一致。

首帧和尾帧应使用相同比例。如果多张图片定义了中间阶段,应明确说明它们是按顺序排列的关键帧,写清每张图可见的状态,并要求关键帧之间连续过渡。独立图片通常比信息密集的故事板拼图更清楚。

实用提示词检查清单

生成前检查以下八项:

  1. 是否只有一个清晰的输出目标?
  2. 每个参考素材是否都有一个明确角色和一项排除说明?
  3. 重复视图是否明确说明为同一主体?
  4. 每个阶段是否只包含一个主要状态变化?
  5. 每个结束状态是否可见、可验证?
  6. 对白语言、说话者和表达方式是否明确?
  7. 保留清单是否涵盖身份、数量、归属、空间、镜头和音频?
  8. 对于编辑或延长,源视频的控制边界是否清楚、没有歧义?

如果生成失败,应先消除歧义,而不是继续添加形容词。减少参考素材、缩小编辑范围,或拆分负载过重的阶段。

在自动化工作流中复用提示词结构

无论创作者在界面中手动生成,还是产品通过 API 提交任务,参考素材清单、分阶段时间线、结束状态和保留清单都同样有用。当前做自动化可以使用 reAPI 上的 Seedance 2.0,把模型标识设为可配置项,并将成功提示词保存为评估集,供未来的 Seedance 2.5 路由复用。

常见问题

最好的 Seedance 2.5 提示词结构是什么?

依次使用目标、主体与事件、场景、参考素材角色、分阶段时间轴、镜头、音频、结束状态和保留清单。不影响结果的区块可以省略。

Dreamina Seedance 2.5 可以使用多少参考素材?

官方提示词指南列出的上限是 30 张图片、10 段视频和 10 段音频,合计 50 个素材。视频和音频输入各自都有合计 30 秒的限制。[1]

是否应该上传全部 50 个参考素材?

通常不需要。先用能够定义身份、产品、场景、动作和音频的最小素材集合。素材越多,需要映射并维持的关系就越多。

如何编写 30 秒提示词?

使用连续时间范围。每个范围安排一个主要事件、一个可观察的结束状态,以及从上一范围继承的状态。

可以把动作控制在精确的某一秒吗?

可以指定精确时间戳,但应把它视为导演指令,而不是精确到帧的剪辑点。官方指南提醒,动作可能出现在时间边界前后的小范围内。[1]

如何阻止参考人物互换身份?

把每个人物映射到具体素材,给他们分配唯一标签,说明道具分别属于谁,并明确禁止身份、服装、位置、动作和对白发生互换。

reAPI 已经可以调用 Seedance 2.5 API 吗?

还不可以。当前页面是即将推出的预览。生产 API 可先使用 reAPI 上的 Seedance 2.0,并关注 Seedance 2.5的正式开放信息。

更短的提示词往往控制力更强

Seedance 2.5 不需要更多文字,而是需要更少未说明的关系。标注输入素材,让每个阶段只承担一项任务,写清前后阶段都要保持的状态,并保护请求修改范围之外的一切内容。

这就是“请求生成一段视频”和“导演一段视频”的区别。把参考素材清单和提示词模板与项目文件放在一起,在后续修改中持续复用,而不是每次都凭记忆重建制作简报。

参考资料

  1. ByteDance Dreamina。Dreamina Seedance 2.5 提示词指南。 2026 年 7 月 31 日修改,2026 年 8 月 2 日检索自 bytedance.larkoffice.com

延伸阅读