Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
用打拍表指导自然的 AI 视频表演完全指南
2026/08/27

用打拍表指导自然的 AI 视频表演完全指南

掌握 AI 视频对白场景规划的完整方法:从表演打拍和角色状态定义,到摄机运镜、提示词模板、审核检查和 API 实例调用。

**可信的 AI 视频表演从打拍表开始,而不是漫长的情绪清单。**打拍表把场景变成模型可以展现的小变化:一个角色听到台词、停顿、看向别处、做出决定、然后说话。它还定义了每个打拍结束时的可见状态,这样下一刻就有一个具体的开始点。

这个初级教程从创意到审核构建一个简短的对话场景。你可以用任何接受详细提示词的视频模型来应用这个方法。API 示例使用 reAPI 上的 Seedance 2.5,因为它支持生成音频并在一次请求中生成长达 30 秒的片段。[1]

速查

  • 写一句话描述场景中情感上发生了什么变化。
  • 给每个角色一个稳定的开场状态、私人目标和压力点。
  • 把场景分成打拍,每个打拍大约包含一个动作或反应。
  • 以可观察的状态结束每一个打拍:眼神、姿态、距离、道具或表情。
  • 把台词、表演、走位、摄机和音效放在独立的提示词块中。
  • 在接受片段前审核发言人分配、停顿、眼神、手部、屏幕方向和最终状态。

AI 视频表演工作流:从角色状态到时序打拍、生成和表演审核

什么是表演打拍

表演打拍是场景中最小的有意义的变化。它不仅仅是一个时间范围。必须发生改变角色知道、想要或做什么的东西。

考虑这一行:

Maya: "You already packed?"

"Maya 看起来很伤心"是弱指导,因为它描述了一种普遍的情绪。打拍更有用:

Maya 在说话前注意到了手提箱。她的肩膀停止移动。她看着手提箱,然后看着 Leo,轻声问道,"You already packed?"
她以保持眼神接触、等待他回答的状态结束这个打拍。

第二个版本给模型一个触发器、一个序列、一个台词处理和一个结束状态。这些是可见的指导而不是抽象的标签。

第一步:把场景简化为一个情感变化

写对白之前,完成这个句子:

场景开始于 __________ 并以 __________ 结束,因为 __________。

例如:

场景开始于 Maya 期望一个正常的告别,以她意识到 Leo 计划在不告诉她的情况下离开结束,因为她在他能隐藏之前看到了他打好的手提箱。

这是场景的脊柱。如果提议的摄机移动、手势或额外的台词不能帮助观众理解那个变化,就删除它。初学者经常要求一次生成承载几个情感转折、地点揭示、产品放置和复杂的摄机编排。模型的注意力就会分散到太多工作中。

从一个转折开始。只在简单版本有效后才增加复杂性。

第二步:写一个紧凑的角色状态卡

模型不需要一页传记。它需要影响这个场景的细节。

{
  "maya": {
    "starting_state": "relaxed, expecting a routine goodbye",
    "goal": "get an honest explanation",
    "pressure_point": "being excluded from important decisions",
    "default_behavior": "stays quiet before confronting someone",
    "fixed_visuals": "dark bob, green coat, silver watch"
  },
  "leo": {
    "starting_state": "guarded and eager to leave",
    "goal": "end the conversation without admitting guilt",
    "pressure_point": "direct eye contact",
    "default_behavior": "handles nearby objects when uncomfortable",
    "fixed_visuals": "short brown hair, charcoal jacket, black suitcase"
  }
}

default_behavior 字段特别有用。"Nervous" 可能变成随机眨眼和夸张的面部运动。"在不适时转动手提箱把手"给表演一个物理出口。

如果相似度很重要,在生成前准备清晰的参考图像。本教程重点是表演规划;角色一致性工作流 更详细地介绍了参考准备。

第三步:把对白变成时序打拍

对于短场景,使用四到六个打拍。确切的秒数是指南,不是逐帧精确的编辑决定。重要的是顺序和一个清晰的结束状态。

时间触发器可见表演对白结束状态
0–4 秒Maya 看到手提箱走路停止;眼睛移动到手提箱Maya 静止,手提箱在他们之间
4–8 秒Leo 注意到她握着把手;避免眼神接触Maya: "You already packed?"Leo 看向门
8–13 秒沉默变得不适Maya 靠近一步;Leo 呼气Leo: "It was easier this way."两人保持位置
13–19 秒Maya 理解了短暂低头,然后稳定眼神接触Maya: "For who?"Maya 冷静;Leo 被逼入角落
19–24 秒Leo 无法回答手放开手提箱;姿态柔和沉默,无和解

注意不是每一个打拍都包含言语。沉默给模型时间展现反应。它也使发言人分配比连续重叠的对白更清晰。

第四步:在摄机运动前规划走位

走位描述人和物体在哪里。摄机方向描述观众如何看到那个走位。先固定第一个,然后添加第二个。

对于示例场景:

  • Maya 开场在左画框,距离手提箱两米。
  • Leo 开场在右画框,右手放在把手上。
  • 手提箱保持在他们之间。
  • 双方都不穿过中心线。
  • Maya 在第三个打拍期间向前走一步。
  • Leo 在最后一个打拍之前不走开。

这些约束保护屏幕方向并使后来的切割更容易。然后添加一个简单的摄机推进:

0-8 秒:锁定的中景双人镜头。
8-19 秒:非常缓慢的推向更紧的双人镜头。
19-24 秒:保持。无额外摄机运动。

不要让摄机执行每一个情感。突然的轨道、起重机移动和变焦可能会与演员竞争。对于对话测试,一个克制的运动就足够了。

第五步:在六个块中组装提示词

分离提示词块使错误更容易诊断。如果摄机错了,你可以编辑摄机块而不用重写角色身份或对白。

REFERENCES
Image 1 is Maya's identity and wardrobe reference. Image 2 is Leo's identity
and wardrobe reference. Image 3 defines the station entrance, lighting, and
initial blocking.

CHARACTERS
Maya stays quiet before confronting someone. Leo handles the suitcase when he
is uncomfortable. Preserve their age, facial features, hair, clothing, and
body proportions throughout.

SCENE AND BLOCKING
Evening outside a train station. Maya remains frame left. Leo remains frame
right. A black suitcase stays between them. They do not cross positions.

PERFORMANCE TIMELINE
0-4s: Maya enters, notices the suitcase, stops walking, and looks from the
suitcase to Leo. End with Maya still and Leo unaware.
4-8s: Leo notices her and tightens his hand on the handle without looking at
her. Maya asks quietly, "You already packed?" End with Leo looking at the door.
8-13s: Maya takes one step closer. Leo exhales and says, "It was easier this
way." End with both holding position.
13-19s: Maya briefly looks down, regains eye contact, and asks, "For who?"
End with Maya calm and Leo unable to answer.
19-24s: Leo releases the handle and softens slightly. Neither speaks. End in
unresolved silence.

CAMERA
0-8s locked medium two-shot. 8-19s very slow push to a tighter two-shot.
19-24s hold. Keep both faces visible and preserve the left-right axis.

SOUND AND CONSTRAINTS
Natural American English. Keep the exact lines and speaker assignment. Quiet
station ambience. No narration, subtitles, extra dialogue, background music,
or exaggerated crying.

ByteDance 记录了 Seedance 可以从多模态输入引用构图、运动、摄机语言和音效。它也指出模型在多主体一致性和文本准确性上仍有改进空间,这就是参考角色和审核步骤很重要的原因。[2]

第六步:在最终场景前生成一个排练

使用一个短的、低风险的排练来测试发言人顺序、走位和情感时序。还不要评判服装纹理或最终颜色。

在 reAPI 上,最小的 Seedance 2.5 请求看起来像这样:

curl https://reapi.ai/api/v1/videos/generations \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "doubao-seedance-2.5-face",
    "prompt": "PASTE_THE_SIX_BLOCK_PROMPT_HERE",
    "image_urls": [
      "https://example.com/maya.jpg",
      "https://example.com/leo.jpg",
      "https://example.com/station.jpg"
    ],
    "resolution": "720p",
    "size": "16:9",
    "duration": 24,
    "generate_audio": true
  }'

请求是异步的。轮询返回的任务 ID,直到状态是 completedfailed。当前的字段限制和计费规则属于 Seedance 2.5 API 文档,而不是硬编码的客户端假设。

第七步:按正确的顺序审核表演

用不同的目的观看结果三次。

第一遍:仅音效

不看就听。检查准确的台词、发言人分配、台词顺序、不需要的旁白、速度和打拍表要求的地方是否存在停顿。

第二遍:图像无音效

将片段静音。检查眼神、身体位置、手部行为、面部连续性、屏幕方向以及每一个打拍是否以规划的状态结束。

第三遍:完整场景

现在判断对白、反应、摄机和音效是否支持相同的转折。如果一个层失败,先修复那一层。不要因为一个停顿太短就重写整个场景。

使用一个简单的接受表:

{
  "speaker_order": "pass",
  "exact_dialogue": "pass",
  "left_right_axis": "pass",
  "beat_3_end_state": "repair",
  "identity": "pass",
  "camera": "pass",
  "repair_note": "Leo looks at Maya too early; hold gaze on the door through 13s"
}

这与 AI 视频评论家循环 的原则相同:接受或修复基于明确的证据而不是问片段是否"感觉好"。

常见初学者错误

错误为什么失败更好的做法
写"伤心、电影化、情感"情绪词不定义行为添加触发器、物理反应和结束状态
给两个角色持续运动场景变得繁忙且不清楚让一个表演而另一个接收
用对白填充每一秒反应没有时间登记为沉默保留打拍
每个打拍改变摄机风格摄机与表演竞争使用一个推进和一个保持
一个缺陷后重新生成所有内容好的部分丢失修复最小失败的块
要求场景内准确的品牌文本生成的文本可能不可靠在后期制作中添加关键文案

FAQ

初学者应该使用多少个表演打拍?

从四到六个开始。每一个打拍应该包含一个主要的触发器或反应。如果一行需要几个句子来解释什么变了,就分割它。

时间码保证精确计时吗?

不。把它们看作节奏指导。检查渲染结果并在准确的交付计时很重要时在编辑器中修剪。

每一个情感都应该在脸上可见吗?

不。姿态、眼神、距离、手部运动和沉默通常比夸张的表情更干净地传达。

我可以在没有角色参考图像的情况下使用此工作流吗?

可以,但视觉身份将受到较少限制。当特定的人或经常出现的虚构角色必须保持可辨认时,参考变得更重要。

当对话场景失败时我应该先修复什么?

在精细情感之前修复发言人顺序和走位。漂亮渲染的反应无法挽救一个错误的角色说话或穿过错误一方的场景。

结论

AI 视频表演打拍表将情感的想法转换为可观察的工作:触发器、反应、对白、走位、结束状态和审核标准。构建一个简单的转折,给沉默腾出空间,保持摄机受到限制。一旦那个版本有效,你可以添加更复杂的表演而不失去场景的控制。

References

  1. ByteDance Seed. One-take Creation, Flexible Referencing: Introducing Seedance 2.5. July 31, 2026. seed.bytedance.com
  2. ByteDance Seed. Seedance 2.0 Official Launch. February 12, 2026. seed.bytedance.com
  3. reAPI. Seedance 2.5 API — Parameters, Modes & Billing. Retrieved August 27, 2026. reapi.ai