Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Wan 3.0 提示词指南:如何编写连贯的30秒视频脚本
2026/08/26

Wan 3.0 提示词指南:如何编写连贯的30秒视频脚本

掌握 Wan 3.0 提示词编写技巧:从时间节拍、摄像机运动、参考资源到音频描述的完整指南,学习如何生成高质量的30秒视频。

**好的 Wan 3.0 提示词读起来像一份简洁的拍摄方案,而不是一堆视觉形容词。**先定义一次世界和主体,将动作分成有时间标记的节拍,每次给摄像机一个明确的任务,写出你真正想要的声音。当视频接近 Wan 3.0 的30秒限制时,这种结构变得尤为重要。[1]

这份 Wan 3.0 提示词指南侧重于可控的指令,而不是"魔法词"。没有模板能保证身份一致性、精确的时间、可读的文本或物理连续性。但是,它可以消除矛盾,使失败的镜头更容易诊断。

TL;DR

  • 格式、时长和单句目的开始。
  • 在时间线之前,锁定主体、设置、光线和连续性规则
  • 为每个有时间标记的节拍赋予一个主要动作和一个摄像机指令。
  • 按位置命名参考资源:Prime API 上的 Image1Video1Audio1;标准 Wan 3.0 使用其文档中的位置参考语法。
  • 启用音频时,明确描述对白、环境音、效果和静音。
  • 逐次修改一个失败,而不是让整个提示词变得更长。

Wan 3.0 提示词结构从意图和世界到分时间节拍、摄像机、声音和最终画面

Wan 3.0 提示词公式

使用五个块。它们在最终提示词中不需要标签,但在起草时将它们分开可以看出遗漏。

1. 意图:格式、时长、宽高比和视频的目的
2. 世界:设置、时间、天气、视觉处理和声音环境
3. 锚点:经常出现的人、物体、服装和非协商的细节
4. 时间线:按顺序排列的时间范围,包括动作和摄像机方向
5. 护栏:必须保持不变的内容和不能出现的内容

前三个块描述稳定的世界。时间线描述变化的内容。将两者混合到每个句子中会产生重复,并经常产生小的矛盾:外套变成夹克,黎明变成日落,或者一个锁定的摄像机在同一个节拍的中途开始环绕。

将节拍数与时长相匹配

五秒的片段可以承载一个动作。30秒的片段需要进展,但不一定需要十几个切割。给每个节拍足够的时间让主体和摄像机完成你要求的操作。

时长有用的起始结构提示词重点
2–6 秒一个节拍一个动作、一个摄像机运动
7–15 秒两个到四个节拍设置、动作、完成
16–30 秒四个到七个节拍带过渡的清晰进展

这些是编辑上的起点,不是模型的限制。一个安静的穿过空房间的30秒推镜可能只需要一条持续的指令。快速的产品短片可能需要六个短节拍。内容决定了数量。

时间范围也传达了顺序;它们不是帧准确的编辑点。写 0–5s5–11s11–18s 来显示顺序,然后期望一些运动开始早或结束晚。如果切割必须发生在精确的帧上,在视频编辑器中完成时间。

一个完整的30秒 Wan 3.0 提示词

以下示例故意具体化,而不会变成摄像机术语的清单。它通过完整的片段承载一个人、一个地方和一个物理任务。

格式:30秒电影纪录片场景,16:9,一个连续的早晨。

设置和基调:一间小型沿海修理工作室在黎明时分。凉爽的蓝光通过盐渍窗户进入;两盏温暖的工作灯仍然亮着。自然、克制的摄影风格,破旧的木材、氧化的工具、潮湿的混凝土,没有光滑的商业风格。外面有安静的海浪声,柔和的房间音调,偶尔的金属接触;没有音乐和对白。

连续性锚点:同一位60多岁的女性自始至终,短银发、深藏蓝工作服带一块缝制的橙色补丁、棕色工作靴。同一只红色机械潮汐钟始终保持在中心工作台。保持她的衣着、面容、工作室布局、钟形和窗光方向不变。

0–5秒:从门口的宽静止视图。她穿过工作室,拿着红色潮汐钟,将其放在中心工作台上。让房间在摄像机移动之前建立。

5–11秒:缓慢推进到中等镜头,因为她打开钟的后盖板。她的手小心翼翼地移动;小螺钉被放在浅金属盘中。

11–18秒:肩上方的特写视图。她用细刷子清理一个生锈的齿轮,旋转一次,然后在它卡住时暂停。一个柔和的刮擦声和一个单一的金属点击与运动同步。

18–24秒:轻轻的横向移动到她的侧面。她调整齿轮,关闭机制,将钟竖起来。保持工作台和窗口位置在整个移动中保持一致。

24–30秒:中等特写。钟针开始移动。她倾听,呼气,给出一个小小的私密微笑,同时摄像机停止。在钟和她的手放在它旁边结束;保持最终构图两秒钟。

避免:额外的人、衣着改变、移动的窗户、新工具出现、戏剧性的镜头光晕、字幕、徽标、旁白或背景音乐。

这个提示词有一个弧线:携带、打开、诊断、修复、确认。每个节拍都赚取了它的位置。如果结果匆忙,在添加更多时间语言之前删除一个动作。

将摄像机方向写成行为,而不是装饰

摄像机术语在改变观众看到的内容时很有帮助。"电影般的、史诗般的、动态的"说得很少。"从宽门口视图缓慢推进到腰部镜头"定义了位置、方向、速度和目的地。

有用的摄像机指令通常包含其中两个或三个元素:

  • **构图:**宽、中等、特写、俯视;
  • **运动:**锁定、平移、跟踪、推进、拉回、环绕;
  • **速度:**缓慢、步行速度、突然、保持静止;
  • **关系:**跟随在后、保持眼睛水平、保持产品居中;
  • **最终状态:**停在脸上、显示房间、保持最后的构图。

避免在一个节拍中堆积不兼容的指令。锁定的三脚架镜头不能同时进行手持环绕。微观特写不能在同一时刻保留全身视图。如果两个视图都很重要,给它们分开的时间范围。

参考提示词应该分配工作给资源

Wan 3.0 接受参考图像、视频和音频,而其文档和网页模式可以使用结构化源材料。[2]提示词应该解释每个资源控制什么,而不是仅仅附加所有可用的内容。

使用 Image1 作为表演者的脸部和头发。仅使用 Image2 作为绿色雨衣和其银色紧固件。使用 Video1 作为步行节奏,而不是位置或摄像机角度。使用 Audio1 作为12–15秒单行的语音参考。保留来自第一帧图像的工作室。

参考计数不是质量目标。两个具有不同工作的图像通常比十个具有不同照明和服装的近似副本更容易推理。如果你不能完成"用这个来..."句子,就删除一个参考。

帧模式和参考模式也是不同的指令。第一帧定义了片段开始的位置。参考图像指导身份或外观,而不承诺该确切的开启构图。在编写运动之前选择模式。

音频需要在简报中有其自己的一行

Wan 3.0 可以默认生成音轨,但视觉描述不指定场景是否应该包含对白、音乐、效果或静音。清楚地写出这些选择。

弱:

具有沉浸式音效的电影街景。

更强:

自然的傍晚街景环境:远处的公交车、骑手经过摄像机时的一声自行车铃声、雨棚上的小雨。没有音乐、没有旁白、没有对白。

对于对白,保持行足够短以适应分配的时间,并识别说话者。分开要求情感传达和单词。检查结果的发音、唇形同步、削波、不想要的语音和在镜头之间变化的声床。

如何在拍摄失败后修复提示词

不要通过添加形容词来响应每个失败。确定输出偏离的第一个地方,然后改变最小的相关块。

失败首先尝试的修订
身份漂移删除冲突的参考;缩短镜头;重新陈述一个身份锚点
动作匆忙减少动作数量或延长该节拍
摄像机忽视方向保留一个运动并定义其起始/结束构图
对象出现或消失列出一次必要的对象并添加连续性护栏
音频是通用的分别命名环境、效果、对白、音乐和静音
结尾感觉未完成为清晰的最终状态保留最后两到三秒
文本拼写错误避免生成关键排版;在后期添加验证的文本

在可能的情况下,每次重试改变一个变量。如果你同时重写主体、时间线、摄像机和声音,更好的输出不会教你哪个纠正起作用。

成本在这个循环中很重要。标准 Wan 3.0 目前每秒的起始价格比 Video Prime 低,480P 比 720P 或 1080P 便宜。在提交到30秒最终版本之前起草短的或低分辨率的版本。有关当前示例,请参阅 Wan 3.0 API 定价指南

一个简短的提示词检查清单

在提交前,阅读一次提示词以查找矛盾,而不是细节。

  • 时长是否足够进行每项动作?
  • 每个节拍是否有一个主要主体动作?
  • 摄像机是否能物理执行指令?
  • 是否一致地描述了经常出现的主体、服装和位置?
  • 每个参考是否都有一个命名的工作?
  • 对白、效果、环境、音乐和静音是否被指定?
  • 最终构图是否清晰?
  • 你是否要求模型保存任何应该在后期添加的文本或徽标?

如果答案很清楚,提示词就准备好了。更多的词不会自动获得更多的控制。

FAQ

Wan 3.0 提示词可以有多长?

reAPI 请求字段接受最多20,000个字符。这是一个技术上限,而不是目标。简洁、非矛盾的简报通常比重复同一想法的长提示词更容易调试。

30秒提示词应该包括时间戳吗?

通常,当片段包含多个有序动作时。时间戳显示顺序和节奏,但不应将其视为帧精确的编辑点。

Wan 3.0 支持负面提示词吗?

当前的 reAPI Wan 3.0 视频模式不暴露单独的 negative_prompt 字段。将重要的排除项放在正提示词末尾的简短 避免: 行中。

相同的提示词可以在 Wan 3.0 Video Prime 上运行吗?

可以,创意简报转移。API 有效负载无法保持不变:Prime 和标准 Wan 3.0 使用不同的媒体和宽高比字段名。

我应该使用多少个参考资源?

使用简报需要的,直到文档限制。每个参考应该有不同的角色。额外的近似副本可能会引入冲突的照明、衣着或构图提示。

结论

最有用的 Wan 3.0 提示词是一个小型制作计划:一个稳定的世界、一个有序的事件流、故意的摄像机行为和明确的声音。给更长的片段展开空间、保持参考角色特定,以及修改第一个可见的失败,而不是填充整个提示词。当周转是约束时,相同的简报可以通过 Wan 3.0 Video Prime API 运行。

References

  1. Alibaba Cloud. Wan 3.0: 30-Second AI Video Generation from Any Input. Retrieved August 26, 2026 from alibabacloud.com/blog/wan3-0-30-second-ai-video-generation-from-any-input_603452
  2. reAPI. Wan 3.0 API documentation: input modes, media limits, duration, audio, and request fields. Retrieved August 26, 2026 from reapi.ai/docs/wan-3-0
  3. Alibaba Cloud Model Studio. Wan 3.0 Video Generation: native 30-second output and omni-reference workflows. Retrieved August 26, 2026 from modelstudio.console.alibabacloud.com/model-releases/wan3.0-video

Further reading