
Hailuo H3 详解:规格、API 定价和限制
Hailuo H3 与 MiniMax H3 的规格对比、原生立体音频、API 参数、计费规则、集成代码及限制详解(2026)。
Hailuo H3 是人们搜索 MiniMax H3 时使用的名称,这是 MiniMax 在 2026 年 7 月 31 日推出的视频模型。其 API 文档也将这个版本称为 Hailuo 03。 这些名称指的是同一个模型:一个多模态系统,接受文本、图像、视频和音频输入,生成 4–15 秒的视频,支持原生立体声,分辨率最高达 2K。[1][2]
命名很简单,关键是理解这个模型的三种工作流:纯文本文本生成视频、首帧/末帧图像生成视频,以及支持混合图像、视频和音频输入的参考生成视频。本指南将这些模式映射到确切的 API 规则,区分 MiniMax 直接定价和 reAPI 定价,并展示在 reAPI 上当前有效的请求形式。
Hailuo H3 规格概览
| 项目 | MiniMax H3 / Hailuo 03 |
|---|---|
| 发布日期 | 2026 年 7 月 31 日 |
| 输入 | 文本、图像、视频和音频 |
| 输出 | 带原生立体声的 MP4 视频 |
| 分辨率 | 最高 2K |
| 时长 | 4–15 秒,按整数秒递增 |
| 生成模式 | 文本生成视频、图像生成视频、参考生成视频 |
| 参考容量 | 最多 9 张图像、3 个视频和 3 个音频文件 |
| 宽高比 | 21:9、16:9、4:3、1:1、3:4 和 9:16 |
| MiniMax 直接价格 | 2K 时 $0.13/秒;768p 时 $0.09/秒 |
| reAPI 模型 ID | minimax-h3 |
MiniMax 将 H3 描述为通用的全能生成模型,而不仅仅是视频渲染器。启动公文表示它可以理解四种输入模态中的上下文,并生成视频、音频、图像和文本,尽管公开的视频 API 是启动时详细记录的产品表面。[1]
MiniMax 也将 H3 称为开放模型。其启动文章称模型权重将在"接下来的几天内"发布,受适用法律和法规的约束。在权重和许可证实际发布之前,请将自托管视为已宣布的下一步,而不是可用的部署路径。
为什么 Hailuo H3 和 Hailuo 03 是同一个模型
官方发布使用两个命名层。MiniMax H3 是 MiniMax 启动文章中的模型名称,也是其 V2 生成 API 中的 model 值。Hailuo 03 出现在相同版本的产品和 API 描述中。"Hailuo H3" 将产品系列名称与模型版本结合在一起,这就是为什么它已成为一个自然的搜索词,即使它不是确切的 API 标识符。
根据上下文使用合适的名称:
- 搜索和编辑复制可以一起提及 Hailuo H3、MiniMax H3 和 Hailuo 03,然后确定为 MiniMax H3。
- MiniMax 的直接 V2 端点需要
MiniMax-H3。 - reAPI 需要小写模型 ID
minimax-h3。
最后这个字符级别的差异很重要。模型 ID 是契约值,而不是品牌名称,所以将显示名称复制到代码中会产生无效请求。
一个模型路由三种不同的视频工作流

MiniMax H3 从附加到请求的媒体中选择其生成模式。三条路由共享相同的底层模型,但其验证规则不可互换。[3]
文本生成视频:提示词加明确的宽高比
文本生成视频是最简单的路由。发送没有媒体引用的提示词,并选择六个宽高比中的一个。提示词可以在同一段文字中描述视觉效果、摄像机运动、对话、音乐、环境和音效。
在 reAPI 上,文本生成视频需要 aspect_ratio,不能是 adaptive。使用 16:9 用于横向,9:16 用于竖向社交视频,或当交付表面需要时使用四个中间格式中的一个。
图像生成视频:首帧、末帧或两者
图像生成视频接受首帧、末帧或两者。提供两帧为模型提供了视觉起点和终点,使其对于计划的过渡、产品展示或必须落在特定构图上的镜头很有用。
图像控制输出方向,所以 reAPI 拒绝在此模式中使用 aspect_ratio。在提交之前,将源帧裁剪到预期的交付格式。首帧/末帧输入也不能与同一请求中的单独参考数组混合。
参考生成视频:分别分配身份、运动和声音
参考生成视频是最灵活的路由。一个请求可以包含最多九张图像、三个视频片段和三个音频文件。这使得可以使用一张图像用于角色或产品身份、一个视频用于运动和摄像机语言,以及音频用于声音或音效方向。
这些标题数字背后有硬性限制:
- 每个参考视频必须为 2–15 秒,所有视频参考总计不超过 15 秒;
- 每个参考音频文件必须为 2–15 秒,所有音频参考总计不超过 15 秒;
- 音频不能是唯一的参考—它必须伴随至少一个图像或视频;
- 参考模式可以使用明确的宽高比或默认为
adaptive。
不要将参考作为无差别的堆发送。在提示词中说明每个资产的作用:身份来自人像、运动来自片段、声音来自音频、照明来自产品画面。API 接受许多输入,但明确的职责划分为模型提供较少的矛盾信号。
原生立体声音频改变提示词的写法
MiniMax H3 与视频一起生成立体声音频,而不是在视觉通过后添加单独的音频轨道。[1] 因此,提示词需要像引导摄像机一样刻意地引导声音。
一个有效的 H3 提示词有四层:
- 主题和动作: 可见的内容以及镜头中发生的变化。
- 摄像机和时序: 构图、运动、焦点、切割和节奏。
- 口语内容: 确切的对话和预期的说话者。
- 音乐床: 音乐、环境、音效、音量关系和静音。
例如:
一个 6 秒的特写镜头,日出时的拉丝金属浓缩咖啡机。从左到右的缓慢推动,温暖的窗户反射,浅景深。柔和的开关咔哒声、上升的蒸汽、安静的咖啡馆环境和一个克制的钢琴和弦。没有对话。
原生音频消除了初始同步步骤;它不保证最终混音。对话清晰度、唇形同步、音乐连续性和不需要的效果仍然需要在每个被接受的片段上进行审查。对于生产预算,相关指标是每个可用结果的成本,而不是每生成秒数的成本。
MiniMax H3 定价:直接 API 对比 reAPI
MiniMax 的直接按需支付表列出 2K 输出时 $0.13 每秒 和 768p 时 $0.09 每秒。[4] 因此,10 秒 2K 输出的起价为 $1.30,不包括可计费的输入媒体。
直接 MiniMax 账单增加了三条规则:
- 音频输入是免费的;
- 前五个输入图像是免费的,然后每个额外的图像是 $0.04;
- 输入视频按所选输出分辨率的速率按持续时间计费。
reAPI 有自己的产品契约。MiniMax H3 模型页面 列出 $0.183 每秒 2K 输出,以及 $0.113 每秒 在 768P。参考视频秒数被添加到生成的视频秒数,前五个参考图像是免费的,第 6 到 9 个图像的成本为 $0.055 每个。[5][6]
reAPI 公式是:
cost = per-second rate × (output seconds + reference-video seconds)
+ extra-image rate × max(0, reference images - 5)可计费数量比算术更重要:一个 10 秒的输出使用 6 秒的运动参考计费 16 秒,而不是 10 秒。七个参考图像在顶部增加两个额外图像费用,因为五个是免费的。音频参考不增加任何费用。
这是两个不同产品的两个不同价格表。不要将 $0.13 MiniMax 直接费率呈现为 reAPI 费率,或将 reAPI 费率呈现为 MiniMax 的官方报价。两者在启动后都可能改变,所以生产代码应该读取当前模型页面,而不是将文章的数字硬编码到 UI 中。
如何在 reAPI 上调用 MiniMax H3 API
reAPI 通过其标准异步视频端点暴露所有三种 H3 模式。一个最小的文本生成视频请求是:
curl https://reapi.ai/api/v1/videos/generations \
-H "Authorization: Bearer $REAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "minimax-h3",
"prompt": "A rain-soaked night market, slow handheld push forward, vendors calling softly, distant thunder and natural street ambience",
"aspect_ratio": "16:9",
"duration": 6
}'提交返回一个任务 ID。轮询共享的任务端点直到结果完成:
curl https://reapi.ai/api/v1/tasks/TASK_ID \
-H "Authorization: Bearer $REAPI_API_KEY"完成的响应包含 output.video_urls。轮询不消耗积分,失败的生成会自动退款。[5]
改变请求形式以选择另一种模式:
{
"model": "minimax-h3",
"prompt": "The character turns naturally and smiles as the camera pushes in",
"first_frame_url": "https://example.com/first-frame.jpg",
"last_frame_url": "https://example.com/last-frame.jpg",
"duration": 6
}对于参考生成视频,使用 reference_image_urls、reference_video_urls 和 reference_audio_urls 替换帧字段。所有媒体输入必须是公开 HTTP(S) URL;base64 和 data: URL 被拒绝。
完整的 MiniMax H3 API 参考 记录了媒体格式、文件大小限制、任务响应、错误和计费行为。
Hailuo H3 的定位—以及哪些内容仍需测试
H3 最好评估为镜头生成器,而不是一键式长格式视频工作室。15 秒可以涵盖产品节拍、对话交换、社交片段或商业的一个部分。60 秒的片段仍然需要多个生成、连续性规划、编辑和最终的音效处理。
混合参考路由是品牌、角色和前期可视化团队应该测试它的原因。首帧/末帧路由是运动设计师应该关心的原因。原生立体音频是短格式团队可能删除一个粗剪步骤的原因。这些功能都不能证明 H3 会在每次简报中保持面部、徽标、标签或声音。
MiniMax 称该模型已准备好投入生产,并为品牌电影、叙述内容、社交视频、广告、UI/UX 和游戏发布了精美示例。这些是供应商演示,而不是独立基准。认真的评估应该包括手触摸产品、小印刷文本、一帧中的两个说话者、快速运动、长对话和跨单独生成的镜头的一致性。
该模型在本文之前一天推出,因此还没有足够的可信公开测试来进行质量排名。这个限制比发明的判定更有用:运行一个固定的提示词集,记录每十次尝试中接受的输出,并将批准的镜头的总成本与已在工作流中的模型进行比较。
常见问题解答
Hailuo H3、MiniMax H3 和 Hailuo 03 是同一个模型吗?
是的。MiniMax H3 是官方启动和 API 模型名称;Hailuo 03 是相同发布的产品/API 描述。Hailuo H3 是常见的混合搜索词。在 reAPI 上,使用模型 ID minimax-h3。
MiniMax H3 视频能有多长?
每个生成可以为 4–15 秒,按整数秒递增。较长的视频必须分成镜头并在编辑器中组装。
Hailuo H3 生成音频吗?
是的。它与图像一起生成原生立体声音频,可以在相同的提示词中引导对话、音乐、环境和效果。
MiniMax H3 可以单独使用音频参考吗?
不能。参考音频必须与至少一个参考图像或视频配对。音频参考总计不能超过 15 秒。
MiniMax H3 的成本是多少?
MiniMax 的直接 API 列出 2K 时 $0.13/秒,768p 时 $0.09/秒。reAPI 列出 $0.183/秒 在 2K 和 $0.113/秒 在 768P,输入视频秒数按相同速率计费,第一个五个之后的额外图像费用。
MiniMax H3 是开源的吗?
MiniMax 将 H3 宣布为开放模型,但 7 月 31 日的启动帖说权重将在接下来的几天内发布。在规划自托管部署之前,检查当前的权重和许可证。
MiniMax H3 的实践理解
Hailuo H3 是一个命名问题,包裹着一个有用的模型设计:一个 MiniMax H3 端点涵盖纯提示词生成、首帧/末帧动画和具有原生立体声的混合参考视频。其 15 秒的上限将其保留在镜头级别,而参考限制使这些镜头比纯提示词工作流更可控。
从 6 秒的默认值开始,为每个参考分配一个清晰的角色,并按接受的片段而不是启动演示判断 H3。开发人员可以在 MiniMax H3 playground 中测试相同的请求形式,或直接转到 API 文档。
披露: reAPI 发布本文并操作上述描述的路由 MiniMax H3 端点。MiniMax 规格和直接价格来自 MiniMax 的公开启动材料和文档;reAPI 契约详情来自我们发布的模型页面和 API 参考。
参考资料
- MiniMax. MiniMax H3: An Open Model Breaking the Boundaries Between Tasks and Modalities. Published July 31, 2026. minimax.io/blog/minimax-h3
- MiniMax API. Video Generation Guide — MiniMax H3 capabilities, duration, resolution, and media inputs. Retrieved August 1, 2026. platform.minimax.io/docs/guides/video-generation
- MiniMax API. Create a Video Generation Task V2 — request modes and validation rules. Retrieved August 1, 2026. platform.minimax.io/docs/api-reference/video-generation-v2-create
- MiniMax API. Pay as You Go Pricing — MiniMax H3 output and input-media rates. Retrieved August 1, 2026. platform.minimax.io/docs/guides/pricing-paygo
- reAPI. MiniMax H3 API reference — modes, parameters, billing, output, and errors. Retrieved August 1, 2026. reapi.ai/docs/minimax-h3
- reAPI. MiniMax H3 model page and live pricing. Retrieved August 1, 2026. reapi.ai/models/minimax-h3
延伸阅读
- reAPI. MiniMax H3 vs Seedance 2.5. reapi.ai/blog/minimax-h3-vs-seedance-2-5
- reAPI. AI Video Generation API Pricing: Cost per Second Compared. reapi.ai/blog/ai-video-generation-api-pricing
- reAPI. Gemini Omni API: Preview Specs, Pricing, and Limits. reapi.ai/blog/gemini-omni-api-preview-specs-pricing-2026
- reAPI. Best Open-Source AI Video Models for Local GPUs. reapi.ai/blog/best-open-source-ai-video-models-local-gpu-2026
作者

分类
更多文章

MiniMax H3 Max 真的实时吗?如何测量应用延迟
了解 MiniMax H3 Max 实时速度指标的含义、为什么不同数据差异的原因,以及如何完整测试队列、推理、轮询和下载。


Veo 3.1 vs Seedance 2.0:2026 年如何选择视频模型
2026 年该选 Veo 3.1 还是 Seedance 2.0?从能力、多镜头、音频、分辨率和价格等方面,用有来源的数据比较两条截然不同的 AI 视频路线。


Seedance 2.0 vs Kling 3.0:基准、价格与结论
从盲测 Elo、功能规格到每秒价格,全面比较 Seedance 2.0 与 Kling 3.0:Seedance 的画质优势,以及 Kling 在 4K 和音频上的领先。
