
Wan 3.0 vs Wan 2.7:时长、输入、编辑和价格
对比 Wan 3.0 和 Wan 2.7 在生成时长、分辨率、文档输入、参考素材、视频编辑、计费规则与应用场景中的差异,帮助选择适合的模型。
16–30 秒生成、480P 初稿、更大参考集或文档和网页输入时选择 Wan 3.0。需要显式视频编辑或其单独的参考视频到视频控制时选择 Wan 2.7。 Wan 3.0 不只是画质升级:它将更多输入类型合并到一个参考模型中,而 Wan 2.7 暴露了专用编辑模式。[1][2]
Wan 3.0 vs Wan 2.7 速览
| 需求 | Wan 3.0 | Wan 2.7 Video |
|---|---|---|
| 文字/图片输出时长 | 2–30 秒 | 2–15 秒 |
| 分辨率 | 480P、720P、1080P | 720P、1080P |
| 首尾帧 | 支持 | 支持 |
| 参考图片 | 最多 10 张 | 最多 5 个主体参考 |
| 参考视频 | 最多 5 个,总时长 15 秒 | 最多 5 个;有视频时输出上限较低 |
| 参考音频 | 最多 5 个 | 每个主体的语音参考 |
| 文档输入 | 支持,最多 50 页/100 MB | 不支持 |
| 公网网页输入 | 支持 | 不支持 |
| 专用源视频编辑 | 无单独编辑模式 | 支持 |
| 生成音频 | 默认开启 | 模式相关的音频控制 |
正确选择遵循请求形态而非版本号。
15 秒界限是最清晰的差异
Wan 2.7 文字转视频和图片转视频的上限是 15 秒。Wan 3.0 将该天花板翻倍至 30 秒。[1][2]
这对连续场景至关重要。一段 24 秒的表演是一个 Wan 3.0 任务,但用 Wan 2.7 至少需要两个任务外加编辑。额外的拼接可能改变脸孔、房间布局、语音、衣着或镜头速度。
对于切成五秒镜头的广告则影响较小。短镜头列表已经有意图明确的编辑,而一个失败的五秒插入比替换 30 秒素材的最后五秒要便宜。更长时长仅在需要连续性时有用。
Wan 3.0 接受 2.7 不支持的素材
Wan 3.0 可以将 DOCX、XLSX、PPTX、PDF、text/Markdown 文件、Apple iWork 文档或公网免登录网页用作参考输入。文档最大 100 MB、50 页。[1]
这使其适合以下工作:
- 从产品简报转换为概念片;
- 用公网产品页面作为视频背景;
- 提供演示稿或报告而无需手动将每一页转为图片;
- 在一个请求中组合文档与视觉和音频参考。
Wan 2.7 期望媒体和文字字段。应用必须先提取或总结文档再提交视频请求。
文档支持不应与确定性幻灯片渲染混淆。Wan 3.0 将素材作为参考解读。它可能选择不同场景、重新排列想法或省略细节。如果每个数字和屏幕文字必须精确匹配,先提取脚本和故事板。
Wan 2.7 仍有更清晰的编辑路径
Wan 2.7 暴露专用视频编辑模式:通过 video_url 发送源素材、描述改动,并选择声轨是自动处理还是保留原始。它可以用 duration: 0 处理完整源素材,遵循该模式的规则。[2]
Wan 3.0 接受参考视频,但参考不承诺在改动一个对象时保留每一帧源素材。它与提示和其他资产一起解读该片段。对于"重新渲染这段源视频"而非"用这段片段作为指导",Wan 2.7 是更明确的 API 契约。
参考限制改变预处理需求
Wan 3.0 接受最多十张参考图片、五段参考视频片段和五段参考音频片段。Wan 2.7 支持最多五个主体图片和五段参考片段,参考语音绑定到主体。[1][2]
更高的图片限制有助于主体加衣着、产品、房间、灯光和道具参考。更多参考不是自动更好。矛盾的角度或身份可能使目标模糊。从定义镜头的最小集合开始,仅在参考提供其他参考缺失的信息时才添加。
没有模式时成本不可比
当前公网 reAPI 费率为:
| 模型 | 分辨率 | 每秒费率 | 简单 10 秒输出 |
|---|---|---|---|
| Wan 3.0 | 480P | $0.038 | $0.38 |
| Wan 3.0 | 720P | $0.076 | $0.76 |
| Wan 3.0 | 1080P | $0.151 | $1.51 |
| Wan 2.7 | 720P | 约 $0.074 | 约 $0.74 |
| Wan 2.7 | 1080P | 约 $0.121 | 约 $1.21 |
纯文字/图片生成时,Wan 2.7 在共享分辨率下略便宜。Wan 3.0 添加 480P 迭代层级和 30 秒天花板。
参考和编辑工作改变对比。Wan 2.7 可在输入计费模式中纳入探测的源时长进入可计费秒数,而 Wan 3.0 当前公网定价将费率乘以输出时长。检查输入模式而非用同一时长乘以两个模型都假设结果等价。[1][2]
简单决策规则
满足以下任意条件时使用 Wan 3.0:
- 镜头必须超过 15 秒;
- 输入是文档或公网网页;
- 便宜的 480P 迭代过程有帮助;
- 工作需要更多参考图片;
- 一次多模态参考请求比构建预处理更简单。
满足以下条件时使用 Wan 2.7:
- 工作专门是源视频编辑;
- 15 秒足够;
- 其按主体的参考语音结构适应场景;
- 较低的 1080P 文字/图片生成费率对 3.0 的新输入更重要。
不要仅通过改模型 id 迁移
将 2.7 工作流移至 3.0 的应用应将其视为新请求 schema。Wan 2.7 分离主体参考、参考语音和源视频编辑字段。Wan 3.0 将参考媒体合并在不同的族下并添加 file_url、link_url 和显式 generation_type 选项。
为每个模型构建验证器并一次迁移一个模式。从纯提示生成开始,然后首尾帧,再混合参考。将 2.7 编辑请求保留在旧模型上直到 3.0 参考测试证明它满足相同验收标准。成功的 HTTP 响应不意味着语义操作保持相同。
同时在迁移期间显式设置分辨率和时长。Wan 3.0 添加 480P 并默认为 1080P;其 -1 时长行为在 reAPI 上保留至 30 秒天花板。静默默认改变是发现新模型成本概况的糟糕方式。
两者都通过其公网模型和文档页面可用:Wan 3.0、Wan 2.7 Video、Wan 3.0 文档和 Wan 2.7 文档。
参考资料
- reAPI Wan 3.0 API 文档,访问时间 2026 年 8 月 23 日。
- reAPI Wan 2.7 Video API 文档,访问时间 2026 年 8 月 23 日。
- 阿里巴巴云,"Wan 3.0: 30 秒 AI 视频生成,任意输入",2026 年。
更多文章

2026 年五款最佳 AI 视频生成 API 对比
按时长、参考输入、音频、分辨率、计费方式对比 Seedance 2.5、MiniMax H3、Kling 3.0、Veo 3.1、Vidu Q3。


游戏中的 AI 图片生成:用缓存优化成本
用语义键、单阶请求、异步轮询、预算上限、持久存储和成本验收公式,构建高效的缓存优先游戏图片生成管线。通过精确的成本计算确保可控的资产生成开销。


Seedance 2.5 最佳替代方案对比
对比 Seedance 2.5 的最佳替代方案,包括 MiniMax H3、Seedance 2.0、Veo 3.1、Sora 2、Runway 和 Kling 3。
