Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
故事板优先:用分镜控制 AI 视频的运动
2026/08/27

故事板优先:用分镜控制 AI 视频的运动

初学者教程:把复杂运镜拆成有序分镜帧,明确每张参考图的角色、提示词的写法、逐帧生成测试,以及成片前的人工审核检查清单。

故事板优先的 AI 视频工作流通过向模型展示一系列可见的状态来控制运动。 与其在一个段落里描述整场舞蹈、动作或产品演示,不如决定主体在几个关键时刻应该是什么样子。然后提示词解释这些时刻之间如何运动。

这不是用于演示的传统分镜。这是一个生成控制层。一份有用的运动分镜定义了姿态、方向、接触、取景和必须延续到下一个镜头的状态。

TL;DR

  • 将动作写成起始状态、变化和结束状态。
  • 选择六到十二个关键时刻;不要绘制每一帧。
  • 保持分镜中的摄影机、角色、环境和宽高比稳定。
  • 让每个镜头回答一个运动问题。
  • 按顺序参考镜头并描述它们之间的过渡。
  • 在渲染完整序列前测试一个短段落。
  • 分别审核接触、方向、时间、身份和结束状态。

从动作分解到有序关键姿态、提示词组装、生成和运动审核的故事板优先 AI 视频工作流

何时分镜比更长的提示词更有帮助

当动作有可见的中间状态时,分镜最有用。例如舞者改变姿态、人捡起并使用物体、车辆在空间中转向、产品分阶段打开,或角色在场景的一侧移动到另一侧。

文字可以描述顺序,但视觉参考解决了反复表达的尴尬细节:

  • 抬起哪只手臂;
  • 哪只脚承重;
  • 道具在哪里接触手;
  • 身体朝向哪个方向;
  • 主体在画面中有多大;
  • 动作结束时必须保持不变的东西。

字节跳动文档记载 Seedance 可以使用文字分镜和多模态参考来完成构图、运动节奏、摄影机语言和视觉元素。[1] 分镜仍然不保证精确的插值。它比单独的密集段落给了模型更好的证据。

第一步:用边界写一句动作句

从一句命名开始和结束的句子开始。

弱:

一个舞者表演充满活力的常规动作。

有用:

舞者开始直立,双脚着地,向左踏入低姿态,在右臂上升时顺时针转身,面对摄影机着地,然后双手可见地保持最终姿态。

第二个版本有开始状态、方向、三个变化和结束状态。这些成为分镜镜头。

对于物体交互,添加接触:

演示者开始双手远离瓶子,用右手伸出,握住瓶子中心,提起它而不改变其方向,将它放在标记的圆圈上,释放它,最后双手可见。

接触状态防止物体在建立抓握前出现在手中或移动。

第二步:选择关键时刻,不是相等的时间间隔

不要默认每两秒创建一个镜头。每当动作改变状态时创建一个镜头。

镜头目的必须可见
1开始锚点身份、服装、姿态、取景
2准备重量转移或手接近物体
3接触明确抓握、脚着地或身体-物体关系
4主要运动方向和最大姿态变化
5恢复平衡、减速、物体稳定
6结束锚点稳定姿态和编辑就绪的构图

六个镜头对许多短动作来说已经足够。当交互有多个接触或反向时使用更多。当动作是简单的摄影机推进或头部转向时使用更少。

第三步:在绘制镜头前创建连续性表

分镜不应该在每个镜头中重新设计主体。先锁定这些细节:

{
  "character": "相同的脸、身体比例、发型、黑色夹克",
  "environment": "相同的排练室、灰色地板、蓝色后墙",
  "camera": "眼平线、50 毫米视角、固定中宽取景",
  "screen_direction": "角色从左到右移动",
  "light": "来自摄影机左侧的大软光源",
  "aspect_ratio": "16:9",
  "prop": "单个红色瓶子,瓶盖保持连接"
}

首先生成或绘制开始镜头。将其作为其余镜头的身份和风格锚点。后面的镜头可能改变姿态和位置,但它们不应该改变服装、镜头感觉、房间布局或光照方向。

如果使用图像模型创建镜头,一次请求一个镜头。密集的网格可以引入不一致的脸和难以阅读的动作。在单个镜头稳定后将批准的帧组装到分镜中。

第四步:将每个镜头设计为运动指令

每个镜头需要一个简短的标题。标题说明为什么存在此帧以及下一个过渡应该保留什么。

镜头 1 — 开始
全身可见。双脚分开与肩同宽。双手下放。面对摄影机。

镜头 2 — 左侧加载
左膝弯曲。重量移向左脚。右脚跟抬起。躯干仍面向摄影机。

镜头 3 — 开始转身
右脚越过身后。躯干顺时针旋转。右臂到达肩高。脸仍以三角度可见。

镜头 4 — 转身峰值
背部短时面向摄影机。双脚保持着地。夹克和头发遵循相同的顺时针运动。

镜头 5 — 着地
角色返回前方。右脚首先着地。手臂减速。

镜头 6 — 结束保持
面对摄影机,平衡姿态,双手可见,保持一秒钟的静止。

避免相邻镜头之间的不可能跳跃。如果镜头二有主体站立,镜头三显示他们在地板上,添加缺失的下降状态。模型必须发明分镜省略的任何东西。

第五步:选择模型应如何使用这些帧

有两种常见的方法。

有序参考图像

将镜头作为单独的参考图像上传并在提示词中命名。这保留了更多细节,让你能陈述每个镜头控制什么。

单个分镜表

将镜头合并成一个清晰编号的镜像。这更容易管理,但每个镜头变得更小,模型可能会将表视为视觉风格参考而不是严格序列。

对于初学者,在 API 接受它们时使用单独的镜像。保留表作为人类审核产物。

第六步:写过渡,不是静止镜头的描述

提示词已经有了镜像。用文字解释它们之间的运动。

镜头 1 到 6 是同一角色在同一房间中的有序运动状态。保留身份、服装、摄影机位置、镜头、光照方向和整个房间几何。

从镜头 1 到镜头 2 连续移动,带有左侧重量转移。从镜头 2 到镜头 3,开始由右脚和右臂引导的顺时针转身。继续通过镜头 4 而不跳跃或反向。通过镜头 5 减速并着地于镜头 6 中显示的精确正面朝向状态。

保持两只脚与地板有信得过的接触。没有额外肢体、重复的手、切割、摄影机运动、添加的人或背景变化。保持镜头 6 状态一秒钟。

此提示词分配三个责任:

  • 镜像定义可见状态;
  • 过渡文本定义方向和连续性;
  • 约束定义必须不改变的东西。

第七步:运行短运动测试

在请求完整序列前,测试最难的过渡。如果镜头三和五之间的转身是风险,提交这些状态时间较短。

curl https://reapi.ai/api/v1/videos/generations \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "doubao-seedance-2.5-face",
    "prompt": "Images 1-6 are ordered movement states. Move through them in order without reversing. Preserve identity, clothing, fixed camera, room geometry, and floor contact. Hold the final state for one second. No cuts or extra people.",
    "image_urls": [
      "https://example.com/panel-01.png",
      "https://example.com/panel-02.png",
      "https://example.com/panel-03.png",
      "https://example.com/panel-04.png",
      "https://example.com/panel-05.png",
      "https://example.com/panel-06.png"
    ],
    "resolution": "720p",
    "size": "16:9",
    "duration": 10,
    "generate_audio": false
  }'

image_urls 字段将文件视为参考。它与 image_with_roles 不同,后者用于显式的第一帧或最后一帧请求。当前 API 文档说明哪些字段可以组合。

第八步:用运动评分卡审核

不要将结果简化为"好运动"。审核实际的控制点。

{
  "order": "pass",
  "screen_direction": "pass",
  "foot_contact": "repair at 4.1s",
  "hand_count": "pass",
  "identity": "pass",
  "camera_lock": "pass",
  "final_state": "repair: right arm does not settle"
}

第一个修复应该很狭窄。添加缺失的过渡镜头、简化一个姿态或澄清一个接触。不要对每一行添加更多形容词。

常见分镜失败

模型跳过一个镜头

相邻状态可能太相似或序列对可用时间包含太多镜头。删除冗余状态或给跳过的过渡更多时间。

角色在镜头之间改变

镜头集不一致。从相同的锚点重建受影响的镜像,然后在生成提示词中重复固定的连续性表。

身体在姿态之间卡住

添加准备或恢复状态。大变化需要一个中间帧来解释平衡、接触和方向。

摄影机移动尽管分镜固定

陈述"摄影机锁定"并在镜头中保持取景相同。具有不同裁剪的分镜可被解释为摄影机运动。

运动遵循镜像但感觉仓促

减少状态数量或延长时间。当每秒包含新姿态时,模型无法创建可读的暂停。

常见问题

我应该使用多少个分镜镜头?

使用最少数量的镜头来解释状态变化。对于短编舞序列,六到十二通常有效,但简单动作可能只需要三个。

分镜镜头需要看起来精美吗?

不需要。姿态、方向、接触和取景比表面细节更重要。保持镜像清晰和一致。

我可以手绘分镜吗?

可以。手绘分镜在身体方向和物体位置容易阅读时有效。如果最终角色必须看起来特别,使用单独的身份镜像。

我应该在分镜中包含时间码吗?

使用时间范围作为指导,不是保证。关键时刻和过渡顺序比生成期间的精确帧时间更重要。

这与第一帧和最后一帧生成相同吗?

不。第一/最后帧生成锚定边界。运动分镜添加中间状态,所以这些边界之间的路径不那么开放。

结论

故事板优先的 AI 视频工作流用可见的决策替换提示词长度。在真实的状态变化处中断动作,保持参考集一致,解释过渡,并分别审核重要的接触和结束状态。结果仍然是生成的,但模型不再从散文中猜测整个编舞。

参考文献

  1. ByteDance Seed. Seedance 2.0 Official Launch. February 12, 2026. seed.bytedance.com
  2. ByteDance Seed. One-take Creation, Flexible Referencing: Introducing Seedance 2.5. July 31, 2026. seed.bytedance.com
  3. reAPI. Seedance 2.5 API — Parameters, Modes & Billing. Retrieved August 27, 2026. reapi.ai