Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
MiniMax H3 提示词指南:运动、摄像机、声音和参考
2026/08/13

MiniMax H3 提示词指南:运动、摄像机、声音和参考

为文字转视频、首尾帧动画、混合参考视频、原生音频、摄像机方向编写更好的 MiniMax H3 提示词,以及 reAPI API 工作流。

好的 MiniMax H3 提示词不是在描述一张海报。它是在指挥一个镜头。 指定主体、可见的变化、摄像机、时间和声音。如果附加参考,为每一个指定单一的职责。H3 同时生成图像和原生立体声,因此沉默、环境音、对白、音乐和效果都属于同一份简报中。[1]

该模型接受最多 7000 个字符的提示词,但长度不是目标。六行精确的文案通常胜过一页形容词。本 MiniMax H3 提示词指南展示了如何为 reAPI 上的文字转视频、首尾帧动画和混合参考视频编写这些行。

TL;DR

  • 编写随时间变化的内容,而非静态的画面清单。
  • 分离主体动作摄像机动作声音,使它们不在同一句话中相互竞争。
  • 对于首尾帧视频,描述过渡;图像已经描述了端点。
  • 对于参考转视频,标记每个图像、视频和音频输入的角色。
  • 从六秒开始。仅当动作真正需要时才增加时长。
  • 时间块如 [0–2 seconds] 是一种写作技巧,不是保证的解析器命令。用它来使意图的进程明确。

MiniMax H3 提示词结构

H3 支持三种请求形式:仅提示词文字转视频、首尾帧图像转视频和包含图像、视频和音频的参考转视频。API 从附加的媒体中选择模式;提示词应该随之改变。MiniMax H3 API 参考记录了确切的验证规则。[2]

对于仅提示词的镜头,使用这个顺序:

主体 — 镜头跟随的对象或人物
动作 — 一个可见的进程,有明确的结束
场景 — 仅影响镜头的细节
摄像机 — 画幅、运动、焦点和节奏
光线 — 方向、一天中的时间和材料反应
声音 — 对白、环境音、拟音、音乐或刻意的沉默

这不是魔法语法。这是一种方式,以阻止三个不同的动作和四个不同的摄像机移动被埋没在一个装饰性的段落内。

一个克制的故事板,展示主体运动、摄像机进程和原生音频在一个连续 MiniMax H3 镜头上的发展

从变化开始,而非情绪板

"电影般的咖啡厅,美丽的光线,高端、阴沉"命名了一种美学,但给视频无处可去。添加一个物理事件和一个端点:

六秒特写镜头,拍摄一台拉丝钢浓缩咖啡机在日出时分。咖啡师锁上冲煮手柄,按下开关,第一股黑色咖啡流在最后一秒到达杯子。缓慢的左到右推动,浅焦点,温暖的窗户反光。一声开关点击,升起的蒸汽,安静的室内音。无对白或音乐。

镜头现在有了开始、中间和可审阅的结束。摄像机有一个移动。声音床足够小可以混音。"高端"消失了,因为材料、光线、节奏和克制已经完成了这项工作。

保持一个主导动作

短片会惩罚超载的编排。如果一个六秒的提示词要求一个人进入、坐下、打开一个包裹、说话、喝酒、看外面和离开,模型必须压缩或省略什么。挑选这个片段是关于什么的动作。将其余部分移到另一个镜头。

给摄像机一个动词

摇摄、倾斜、推进、升降机、环绕、手持跟踪和焦点架不是同义词。选择一个主要摄像机移动。第二条指令可以描述焦点或小的结束,但"推进的同时环绕、升降和甩镜头"的镜头通常是冲突的请求。

描述材料反应而非质量

"惊艳"、"史诗"和"高质量"等词给审阅者没有什么可以检查的。描述光线做什么:狭窄的反光在拉丝金属上滑动,柔和的窗户光包裹一张脸,或雨水打破湿沥青上的霓虹反光。

MiniMax H3 文字转视频提示词模板

文字转视频没有源框架,因此提示词必须同时建立图像和运动。请求在 reAPI 上也需要显式的纵横比。

[时长和画幅]
A [shot size] of [subject] in [setting].

[动作]
主体 [单一动作],以 [可见的最后一拍] 结束。

[摄像机和光线]
[一个摄像机移动],[焦点行为]。[具体的光线和材料反应]。

[音频]
[如果有对白]。[环境音]。[拟音]。[音乐或无音乐]。

[护栏]
一个连续的镜头。无切割。无添加的文本或徽标。

填充的例子:

八秒中等宽幅镜头,一个骑自行车的人在小雨中等待高架桥下。她拉紧一只手套,向道路看去,然后推开并从右边退出画幅。缓慢的手持前向跟踪;焦点停留在她的脸上直到自行车移动。凉爽的日光,湿的混凝土,来自经过汽车的小琥珀反光。混凝土上的雨,一个飞轮点击,一个远处的公交车,无音乐,无对白。一个连续的镜头,无切割,无屏幕文本。

相应的请求很小:

curl https://reapi.ai/api/v1/videos/generations \
  -H "Authorization: Bearer $REAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "minimax-h3",
    "prompt": "Eight-second medium-wide shot of a cyclist waiting beneath an overpass in light rain. She tightens one glove, looks toward the road, then pushes off and exits frame right. Slow handheld track forward; focus stays on her face until the bicycle moves. Cool daylight, wet concrete, small amber reflections from passing cars. Rain on concrete, a freewheel click, one distant bus, no music, no dialogue. One continuous shot, no cuts, no on-screen text.",
    "aspect_ratio": "16:9",
    "duration": 8
  }'

提交返回任务 ID。轮询共享任务端点直到结果完成。完成的 MP4 包括生成的音频轨道。

编写首尾帧提示词为过渡

在图像转视频模式中,第一帧、最后一帧或两者已经建立了外观和方向。重复每个视觉细节会浪费提示词空间,并可能将生成拉离所提供的图像。

告诉 H3 它们之间必须发生什么:

连续地从第一帧移动到最后一帧。
纸质包装沿着现有的褶皱展开;没有新的面板出现。
摄像机保持锁定。产品不旋转。
柔和的纸质沙沙声,一个小的桌子点击,安静的工作室室内音,无音乐。
在最后一帧的确切构图上结束。

在 reAPI 上,图像转视频从画幅派生方向。在此模式下不要发送 aspect_ratio 字段。在提交前将源图像裁剪到预期的交付比。[2]

如果开始和结束帧在主体缩放、摄像机高度或光线上不同意,提示词无法完全修复矛盾。先修复端点。模型应该把其努力花在运动上,而不是调和两个不同的拍摄。

为每个参考指定一个职责

参考转视频是 H3 最独特的工作流程。请求最多可以包括九张图像、三个视频和三个音频剪辑。更多输入不会自动创建更好的连续性。一个无标记的参考堆栈要求模型猜测从每个文件复制什么。

使用显式参考映射:

参考图像 1:保留这个人的脸、头发、外套和比例。
参考图像 2:仅使用火车车厢内部和座位材料。
参考视频 1:使用其行走节奏和肩膀运动,不是其摄像机。
参考音频 1:为引用的行使用这个声音身份和节奏。

创建一个七秒的镜头。角色沿着过道向摄像机走去,接触一个座位的顶部,并说:"我们快到了。"缓慢稳定化后退在眼睛水平。晚间光穿过窗户。保持声音清晰地超过低导轨噪音;无音乐和无额外的说话者。

这分离了身份、环境、运动和声音。它还告诉人类审阅者在结果失败时查看的位置。

参考视频不是免费的上下文。在 reAPI 路由上,其时长被添加到可计费的生成时长。前五个参考图像被包括,而图像六到九增加了每张图像的费用。对于当前费率,请使用 MiniMax H3 模型页,而不是用未使用的参考填充请求。[3]

将声音作为镜头的一部分直接指挥

MiniMax H3 使用图像生成原生立体声。有用的声音简报回答五个问题:

问题例子答案
谁说话?蓝色外套的女人,没有其他人
什么是确切的?"我们快到了。"
什么建立地点?低导轨噪音和两个软马车咔哒声
什么应该被置于前景?声音清晰而居中在环境音之上
什么必须缺席?无音乐、人群喧嚣、公告或字幕

"电影般的音频"不回答其中任何一个。

当有对白时,保持这一行足够短以适应片段。在预期的节奏下大声朗读。一个花五秒钟的十二个词的行为环绕它留下了行动、反应和自然沉默周围的空间很少。

沉默应该被声明。没有"无音乐"或"无对白",模型可能会填充一个空的声音床,因为提示词让它打开。同样适用于字幕和屏幕上的文本。

时间块帮助当顺序重要时

对于有多个节拍的镜头,粗时间可以澄清序列:

[0–2 seconds] 锁定特写。火柴触碰灯芯;仅室内音。
[2–5 seconds] 火焰发起并增长。非常缓慢地推进;柔和的点火。
[5–7 seconds] 一只手遮挡火焰,然后离开画幅。一次安静的呼吸。
无切割,无对白,无音乐。

把这些括号当作编辑大纲对待。MiniMax 不承诺对散文时间进行帧精确的服从,生成的视频不应该用于需要确定性帧时间的工作。这些块仍然减少了关于顺序和重点的歧义。

五个提示词失败及其较小的修复

失败为什么会发生较小的修复
镜头感到静态提示词描述外观,不是变化添加一个物理动作和一个最后的拍
摄像机突然跳跃几个摄像机移动竞争保持一个移动;使其余部分成为画幅约束
身份漂移参考没有指定的角色命名一个身份源并保护其不变量
音频混乱"电影般的声音"让一切都打开列出前景音、环境音和明确的缺席
最后一帧被错过端点矛盾或动作超载对齐源帧并简化过渡

负面指令在保护要求时效果最好。"无切割"对连续产品显示很有用。二十个通用禁止通常隐藏了一个真正重要的约束。

在花费生成之前的紧凑提示词审阅

读一遍提示词并下划线答案:

  1. 片段期间什么改变?
  2. 最后一秒必须是什么?
  3. 摄像机在做什么?
  4. 哪些视觉细节被保护?
  5. 谁说话,他们说什么确切的词?
  6. 应该听到什么环境和效果?
  7. 哪些声音、切割、文本或徽标必须不出现?
  8. 如果附加了参考,每一个服务什么单一的角色?

如果两个答案相互矛盾,在增加时长或添加另一个参考之前修复简报。

FAQ

MiniMax H3 提示词应该有多长?

reAPI 字段接受 1–7,000 个字符,但大多数单个镜头不需要上限。使用足够的细节来指定动作、摄像机、光线、声音和保护约束。删除不改变审阅决定的形容词。

MiniMax H3 可以生成对白和声音效果吗?

是的。H3 生成原生立体声并在同一提示词中接受对白、音乐、环境音和效果作为视觉方向。

MiniMax H3 是否理解摄像机命令?

MiniMax 的视频文档为其视频模型提供摄像机运动指令,H3 提示词可以描述画幅、运动和焦点。将它们视为方向而不是确定性的运动控制数据。[1]

我应该使用首尾帧还是参考图像?

当镜头必须开始或结束于特定构图时使用首尾帧。当单独的资产定义身份、环境、运动或声音时使用参考模式。这两个输入族不能在一个 reAPI 请求中混合。

MiniMax H3 可以使用多少参考?

当前 reAPI 路由接受最多九张图像、三个视频剪辑和三个音频剪辑。音频不能是唯一的参考。总参考视频和参考音频时长限制也适用。

时间括号是官方 MiniMax 语法吗?

不。它们是一种可读的方式来交流顺序和粗略的强调。不要将它们作为帧精确控制或保证的解析器命令呈现。

提示词是一份制作说明

最好的 MiniMax H3 提示词类似于导演给一个小摄制组的短说明。它说发生了什么,摄像机去哪里,麦克风听到什么,哪些细节无法漂移。它不要求模型在样式词的云中发现镜头。

从一个动作和六秒开始。分别审阅运动和声音。仅在那之后添加参考、时间块或更长的时长。MiniMax H3 playgroundAPI 指南使用相同的请求模式,所以提示词可以从手动测试移入代码而不改变其工作。

披露: reAPI 发布本指南并运营这里描述的路由 MiniMax H3 端点。API 限制和计费行为指的是 reAPI 的当前合约;MiniMax 能力描述来自 MiniMax 的官方文档。样本提示词是写作模式,不是基准结果。

References

  1. MiniMax API. Video Generation Guide — MiniMax H3 inputs, output, audio, and camera direction. Retrieved August 13, 2026. platform.minimax.io/docs/guides/video-generation
  2. reAPI. MiniMax H3 API reference — request modes, limits, and billing. Retrieved August 13, 2026. reapi.ai/docs/minimax-h3
  3. reAPI. MiniMax H3 model page and live pricing. Retrieved August 13, 2026. reapi.ai/models/minimax-h3

Further reading