Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Seedance 2.5 功能详解:30秒单段与50参考素材
2026/07/27

Seedance 2.5 功能详解:30秒单段与50参考素材

ByteDance 发布的 Seedance 2.5 功能:30秒单段生成、50 个多模态参考素材、区域编辑,以及为什么原生 4K 属于 Seedance 2.0。

2026 年 6 月 23 日,在北京火山引擎 FORCE 大会上,字节跳动展示了 Seedance 2.5 的预览版——Doubao 视频模型的下一个版本。Seedance 2.5 的三大核心功能是直接生成单个 30 秒连贯视频、支持一个请求中带高达 50 个多模态参考素材,以及区域级编辑[1]

那个 6 月的发布会只是预览。情况已经改变:截至 2026 年 8 月 17 日,Seedance 2.5 在 reAPI 上已可调用,使用模型 ID doubao-seedance-2.5-face,支持 480p、720p 和 1080p 输出,并已公开发布生产价格[3][4]Seedance 2.5 发布状态指南追踪了从宣布到 API 接入的全过程。

以下功能描述仍然将字节跳动的发布声明与独立测量结果分开。API 的可用性使这些声明成为可测试的,但这不意味着将供应商演示转变为独立基准。

TL;DR

  • 三大公开支柱:30 秒单段(相比 15 秒)、高达 50 个多模态参考素材(相比 12 个)以及区域级编辑加 3D 预演[1]
  • 原生 4K 不在其中。原生 4K 管道属于同期发布的 Seedance 2.0 系列。多家媒体把两者混淆了[1]
  • API 接入已在 reAPI 上线:使用模型 ID doubao-seedance-2.5-face;输出分辨率为 480p、720p 或(自 2026 年 8 月起)1080p[3][4]
  • 前代产品已领先。Seedance 2.0 在 Artificial Analysis 的文本到视频竞技场排名第一,在有音频的模型中 Elo 达到 1,219[2]
  • reAPI 价格已公开:不含源视频时,480p 为 $0.118589/s,720p 为 $0.266824/s;含源视频时,分别为 $0.071153/s 和 $0.160094/s[3]

字节跳动实际宣布的内容

Seedance 2.5 核心能力支柱:30 秒单段持续时长、50 个多模态参考素材、区域级编辑控制

功能Seedance 2.0Seedance 2.5
单段持续时长15 秒30 秒,直接生成
参考素材数量9 张图像 + 3 个视频 + 3 条音频30 张图像 + 10 个视频 + 10 条音频
编辑控制有限区域级编辑 + 3D 预演

根据主题演讲,30 秒视频作为单个原生生成输出,而不是多个短视频的拼接[1]。reAPI 的实时合约文档记录了 50 参考素材的上限为 30 张图像、10 个视频和 10 条音频[4]

为什么 30 秒比听起来难

把最大视频时长从 15 秒翻倍到 30 秒听起来是渐进式改进。但在视频生成中,这是最难的问题之一。

大多数模型在几秒后质量就会下降。人物容貌会微妙变化,光线转换,运动逻辑失真。常见的变通办法是生成多个短视频再拼接,但这会在每个接缝处引入明显的跳帧和连贯性错误[1]

如果能直接生成一个 30 秒的连贯镜头(并在精选演示之外也能维持质量),就能消除真实制作的一大成本。对于字节跳动舞台上提到的格式——电影和电视预演、广告和短篇动画剧集——连续半分钟通常意味着能用和需要手工修复之间的区别。

但要诚实地说:30 秒单段是一个上限。全程质量的稳定性需要独立测试才能确认。

50 个参考素材是一致性的保证

Seedance 2.5 参考容量:一个请求中可包含 30 张图像、10 个视频和 10 条音频

跳转到 50 个参考输入是对专业工作最相关的升级。一个请求最多可携带 30 张图像、10 个视频和 10 条音频,尽管指派一个更小的、清晰划分的集合通常更容易控制[4]

实际上这是一个一致性的投注。将你的人物转向图、产品照片、品牌色彩和风格参考输入模型,它就有了更多的接地信息来在一个序列中保持同一张脸、同一个包装和同样的风格。

对广告商来说,人物和产品在所有镜头间的保真度就是全部工作。一个在 logo 上漂移的模型无论运动多么电影级都无法使用。

区域编辑和 3D 预演

第三根支柱是控制。字节跳动演示了区域级编辑:在不改变原始运动、摄像机移动或光线的情况下,替换现有镜头内的主体、背景或产品[1]

这对迭代很重要。与其重新生成整个视频并希望其余部分保持不变,不如交换一个元素并保持已批准的一切。对于本地化一个产品到不同市场或交换一个模型,那个有针对性的编辑通常就是全部工作。

主题演讲还展示了 3D 白模型预演,让创意人员在提交完整生成前在粗糙 3D 场景中规划镜头和摄像机移动[1]。这将分镜和摄像机位置规划融入生成步骤,而不是留给试错。

值得澄清的 4K 混淆

原生 4K(包括 4K 10 比特)在 FORCE 上提到过,但它属于 Seedance 2.0 系列,而非 2.5 的宣传重点,后者强调的是持续时长、参考素材和编辑控制[1]

多家媒体把 4K 列入 2.5 规格表。我们保持分离是因为那是官方材料显示的内容,也因为一个规格被错误地归属于错误的模型正是那种在购买决策中存活下来的错误。我们早前关于 Seedance 2.5 已知信息的文章 就标记了同样的媒体所声称的 4K 规格。

已上线版本的现状

本文没有引用独立的 Seedance 2.5 基准。为了参考,下面的 7 月快照记录了 Seedance 2.0 在一个中立盲试人类偏好排行榜上的位置。

Artificial Analysis 文本到视频竞技场排名,Seedance 2.0 以 1,219 Elo 领先,超过 HappyHorse-1.0、Kling 3.0 1080p Pro 和 Google Veo 3.1

模型文本到视频竞技场 Elo
Seedance 2.0 (720p)1,219
HappyHorse-1.01,124
Kling 3.0 1080p Pro1,105
Google Veo 3.11,094

Seedance 2.0 目前在有音频的模型中排名第一,并且在"图像到视频"排行榜上也领先[2]。竞技场排名反映了在采样提示上的聚合人类偏好,不是每个要点都能保证赢,尤其不是一个 2.5 数字。

它确实告诉你的是,2.5 构建的基线已经在该领域的前面,这为升级必须证明的内容设置了较高的门槛。

价格背景

在 reAPI 上,Seedance 2.5 在不附加源视频时,480p 为 $0.118589 每秒,720p 为 $0.266824 每秒。因此,一个 5 秒的 720p 提示或图像参考生成预留 1,335 积分,即信用四舍五入后的 $1.335[3]

含源视频的工作使用更低的费率——480p 为 $0.071153/s,720p 为 $0.160094/s——但它们运行在不同的时钟上。计费秒数是输出秒数加上向上舍入的源视频总时长,或 ceil(5 / 3 × 输出秒数) 中较大者[4]。比较完整的请求形状,而不是仅用打折费率乘以输出时长。

升级针对的用户

这些不是业余爱好者功能。它们针对那些一致性和迭代就是工作的人。

广告商和品牌团队是最明确的适配。50 参考素材的上限存在,使一个活动能在每个镜头上保持产品、logo 和代言人在线,区域编辑将本地化广告变成有针对性的编辑,而不是重新拍摄。

预演团队获得 3D 白模型阻挡和更长的镜头,这把分镜规划融入生成步骤。

短篇动画工作室正好需要连续 30 秒视频启用的多镜头叙述连贯性。

批量生成的效果营销人员如果成本态势保持,就会受益,因为生成许多品牌保真变体的经济学转变巨大。

考虑具体案例。一个消费电子品牌需要同样的 20 秒英雄镜头在四个市场。用易漂移的短视频模型那就是四个近乎从零开始的生成加手工连贯性修复。用一个参考堆栈保持产品固定和区域编辑交换仅人才和包装文案的,第二到第四版本就变成第一版本的编辑。同样的运动,同样的光线,不同的市场。

那个工作流正是为什么看似无聊的升级——参考和编辑——可能比头条 30 秒更重要。

现在既然上线了要测什么

因为发布演示是精选的,生产接入现在使可重复测试成为可能,三个具体检查很重要:

  1. 30 秒视频从头到尾保持连贯,还是在第 18 秒出现漂移,就像更短的模型被推超舒适区一样?
  2. 50 个参考素材真的能保持一个人物和品牌在各镜头间,还是边际参考在达到上限前就停止贡献?
  3. 区域编辑让画面其余部分不被触碰,包括光线和摄像机运动?

直到这些检查有了可重复的结果,把能力上限看作供应商规范而不是质量保证。

FAQ

Seedance 2.5 现在可用吗?

是的。在 reAPI 上,可调用的生产模型 ID 是 doubao-seedance-2.5-face;它支持 480p、720p 和 1080p 输出[3][4]

Seedance 2.5 真的生成 30 秒视频吗?

字节跳动指定单个连贯的 30 秒视频,是 Seedance 2.0 的 15 秒上限的两倍[1]。实时 reAPI 路由使该持续时长可用于测试,但全程输出质量仍取决于提示和参考[4]

Seedance 2.5 支持原生 4K 吗?

不在当前 reAPI 路由上。Seedance 2.5 支持 480p 和 720p;使用 Seedance 2.0 获得 1080p 或 4K[4]

它与 Veo、Kling 和 Sora 相比如何?

本文没有引用当前的独立 Seedance 2.5 基准。它的比较表记录了引用的 7 月 Seedance 2.0 排行榜快照,不是 2.5 分数[2]

Seedance 2.5 可以有多少参考素材?

在 reAPI 上最多 50 个:30 张图像、10 个视频和 10 条音频[4]

ByteDance 在 FORCE 上还宣布了什么?

用于图像的 Seedream 5.0、用于音频的 Seed-Audio 1.0,以及用于文本的 Doubao 2.1 Pro,还有包括大约每天处理 180 万亿 token 的平台数字[1]

我现在可以通过 reAPI 使用 Seedance 2.5 吗?

是的。向视频生成端点提交 doubao-seedance-2.5-face。实时模型页面发布了两个分辨率层级,API 文档涵盖了请求和计费规则[3][4]

清晰阅读实时发布

Seedance 2.5 是来自其当前模型已位居独立视频竞技场榜首的团队的一套自信的声明。它以之为首的升级是对专业制作的正确选择,在那里一致性和迭代比一个电影级镜头更重要。

精选舞台演示和一个模型在你的提示上跨 30 秒保持质量的差距正是实时 API 现在能揭示的。把发布的限制看作约束,在代表性素材上运行上面的测试列表,当 1080p 或 4K 输出比 2.5 工作流更重要时选择 Seedance 2.0。

参考资料

  1. Volcano Engine. Seedance and the Doubao model family, announced at the FORCE conference. Retrieved July 2026 from volcengine.com
  2. Artificial Analysis. Text-to-Video Arena leaderboard. Retrieved July 2026 from artificialanalysis.ai/text-to-video/arena
  3. reAPI. Seedance 2.5 — live model page and production pricing. Retrieved August 17, 2026 from reapi.ai/models/seedance-2-5
  4. reAPI. doubao-seedance-2.5-face — model ID, supported resolutions, request schema, and source-video billing. Retrieved August 17, 2026 from reapi.ai/docs/seedance-2-5

延伸阅读