Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Gemini Omni vs Seedance 2.0:2026 视频模型对比
2026/05/20

Gemini Omni vs Seedance 2.0:2026 视频模型对比

2026 年 5 月 Gemini Omni vs Seedance 2.0:对比 Google I/O 新模型与 Arena 排名 #1 的 Seedance,包括能力、多镜头、音频和价格。

Google 于 2026 年 5 月 19 日在 I/O 大会上发布了 Gemini Omni Flash。自 2 月以来,ByteDance 的 Seedance 2.0 一直占据 Artificial Analysis Video Arena 榜首。如果你现在要在 Gemini Omni 与 Seedance 2.0 之间选择,本质上是在 Google 首款以推理和编辑为核心的视频模型,与基准测试所认定的当前最佳纯生成模型之间做决定。

两者的分野比这个领域大多数“X vs Y”对比都更清晰。Seedance 2.0 一次前向生成即可输出 1080p、多镜头且音视频联动的片段。Gemini Omni Flash 则先生成 10 秒视频,再让你通过对话不断编辑。下文按能力逐项拆解,信息来自两家供应商的官方页面,价格取自 reAPI 实时模型页面。

长话短说

  • 发布时间。 Seedance 2.0 于 2026 年 2 月 12 日发布[5]。Gemini Omni Flash 于 2026 年 5 月 19 日在 Google I/O 发布[1]
  • 基准差距。 Seedance 2.0 在 Artificial Analysis Video Arena 的文生视频和图生视频项目中分别取得 Elo 1,269 与 1,351,两个类别均为 #1[6]。Gemini Omni 发布时尚未进入榜单。
  • 分辨率上限。 Gemini Omni Flash 支持 720p、1080p 和 4K[7]。Seedance 2.0 最高为 1080p[8]
  • 时长。 Gemini Omni Flash 可输出 4、6、8 或 10 秒[7]。Seedance 2.0 支持 4 至 15 秒,并可在同一片段内完成多镜头切换[5]
  • 参考输入。 Gemini Omni Flash 接受 0、1 或 3 张图片[9]。Seedance 2.0 每次请求最多接受 9 张图片 + 3 段视频 + 3 段音频[10]
  • 编辑方式。 Gemini Omni 围绕多轮对话编辑设计[1]。Seedance 2.0 则依赖丰富参考输入一次完成生成。
  • 选择结论。 如果对同一片段反复迭代比峰值生成质量更重要,选 Gemini Omni;如果希望一次输出精修成片,选 Seedance 2.0。

两个模型分别从哪里来

Seedance 2.0 由 ByteDance Seed 于 2026 年 2 月 12 日发布[5]。它因生成多位知名人物的逼真视频而迅速走红,Disney 在一天后向 ByteDance 发出了停止侵权函[11]。模型默认加入 C2PA 水印。ByteDance 将其定义为“统一的多模态音视频联合生成架构”,可接收文字、图片、视频和音频输入,并在 8+ 种语言中生成带原生音频和口型同步的视频。

Gemini Omni Flash 是 Google DeepMind 新模型家族的首款产品,于 2026 年 5 月 19 日 Google I/O 大会上公布。Sundar Pichai 在台上将它放进 Google 的世界模型路线中:“AI 正在从预测文本走向模拟现实。Gemini Omni 是这个方向的下一步。”[4] Google 官方产品页称,Gemini Omni 将在 Gemini 应用中取代 Veo[3]。输出带有 SynthID 水印,可通过 Gemini 应用、Chrome 和 Google Search 验证[1]

两个模型都可通过 reAPI 的媒体 REST 端点 POST /api/v1/videos/generations 调用。只需修改请求体中的 model 字段即可切换,无需调整其他基础设施。

Gemini Omni vs Seedance 2.0 的每项规格意味着什么

能力Gemini Omni FlashSeedance 2.0
文生视频支持支持
图生视频(单参考)支持(1 个参考)支持
图生视频(多参考)最多 3 张(融合模式)最多 9 张图片
首尾帧插值不支持支持(image_with_roles
参考视频不支持最多 3 段,总时长 ≤15s[10]
参考音频发布时仅支持声音参考[1]最多 3 段,总时长 ≤15s[10]
原生音频合成支持支持(联合生成、音素级口型同步)[5]
一次输出多镜头不支持支持,一次生成包含多次切换[5]
多轮对话编辑支持[1]不支持
4K 输出支持[7]不支持(上限 1080p)[8]
时长选项4 / 6 / 8 / 10s[7]任意 4–15s[10]
画幅比例16:9、9:16[9]16:9、9:16、1:1、4:3、3:4、21:9、自适应[10]
水印SynthID(Google)[1]C2PA(默认开启)[5]
数字人功能支持(发布时仅限消费端)[1]不支持

真正决定选择的是其中两项。Seedance 2.0 可在一次请求中接收 9+3+3 组参考素材;Gemini Omni Flash 则接受 0/1/3 张图片和一个声音参考。如果你的流程需要告诉模型“这是产品,这是品牌风格视频,这是配乐,请组合成片”,Seedance 2.0 就是为这种工作流设计的[10]。Gemini Omni 目前并不适合。

另一项是编辑方式。Gemini Omni 的多轮对话编辑在 Seedance 中没有对应功能。“让小提琴消失。现在把机位改到小提琴手肩后。再把小提琴手移入图片中的环境”是 Google 博客中的真实提示序列[1]。每条指令都基于上一轮继续修改,同时保持人物和场景一致。Seedance 2.0 的逻辑不同:写好一条提示词,配上一组参考素材,然后得到一段视频。

目前尚无人能抹平的基准差距

Seedance 2.0 在 Artificial Analysis Video Arena 排名 #1,文生视频 Elo 为 1,269,图生视频为 1,351[6]。两项成绩都高于同一榜单中的 Veo 3.1、Kling 3.0 和 Sora 2。

本文发布前四天,Gemini Omni Flash 才刚刚上线,Google 也没有在首发时将它提交 Arena。早期实测意见并不一致。TechCrunch 认为消费端演示确实令人印象深刻,但也指出 I/O 现场有多项功能无法正常工作[4]。发布次日的独立评测认为,Omni 的整体纯生成质量“落后于”Seedance 2.0,但其文字渲染、物理直觉与对话编辑打开了新的空间。在 Omni Flash 获得足够 Arena 投票前,唯一诚实的结论是:Seedance 2.0 是经过验证的纯质量领先者;Gemini Omni Flash 则是目前最有新意的编辑界面。

同一条提示词分别在 Gemini Omni Flash 与 Seedance 2.0 上运行。先亲眼比较纯生成质量,再决定是否相信 Elo 数字。

如果采购决策由基准 Elo 决定,今天应选 Seedance 2.0。如果你的产品更看重反复精修,而不是单帧峰值质量,那么 Elo 差距就不再是正确的比较轴。

通过对话编辑,还是预先组合所有素材

Gemini Omni 的核心卖点是对话。Google 产品页说得很直接:“Gemini Omni 让视频创作像聊天一样简单。”[3] 博客还给出完整案例:一段小提琴手视频经过四条连续提示词逐步修改。人物保持一致,物理关系成立,场景也记得前文[1]。这就是“Nano Banana for video”的主张,也是其他 2026 年视频模型尚未直接竞争的部分。

Gemini Omni Flash 借助 Gemini 的世界知识,为一次提示词生成建立现实基础。推理步骤正是 Omni 输出与单纯扩散模型运行结果的区别。

Seedance 2.0 采用相反思路:一开始就把所有内容组合好。一次提交文字 + 9 张图片 + 3 段参考视频 + 3 段参考音频,模型便将它们融合为一个完整输出[10]。ByteDance 的设计假设用户已经清楚制作要求、备齐素材,只想一次获得成片,不需要来回修改。参考输入流程本身就是编辑界面。如果结果不理想,就修改参考素材后重新提交,而不是继续对话。

对于品牌短片和产品广告,Seedance 2.0 的预先组合模式与现有创意简报流程更贴合。对于社交内容实验、粉丝剪辑,或任何创作者要看完第一版才知道自己想要什么的项目,Gemini Omni 的对话循环更合适。

两种完全不同的“multi”

两个模型都将“multi”作为差异化卖点,但含义并不相同。

Seedance 2.0 的“multi”指的是一次生成中的多镜头:一段 15 秒输出内包含多次剪切和转场,效果类似已经剪好的分镜[5]。你在提示词中描述场景推进,模型直接输出自带剪切的完整片段。原本在 Veo 或 Gemini Omni 上需要 3-to-4 次调用的流程,被压缩为一次。

Gemini Omni 的“multi”则是针对单一镜头的多轮精修:每条对话指令都在不丢失上下文的前提下重塑现有片段[1]。你不会得到更多镜头,而会得到同一镜头的更精细版本。成本会随轮次累加,但一致性正是重点。连续 5 轮精修同一场景,与生成 5 个不同场景,本质上是两种产品。

现实中确实存在同时需要两者的流程:用 Seedance 2.0 的多镜头生成分镜,再用 Gemini Omni 的多轮对话精修单个节拍。两个模型都位于同一端点后,这套流程只需改动 30 行,而不是迁移供应商。

720p / 1080p / 4K 含音频的价格计算

Seedance 2.0 按秒计费,Gemini Omni Flash 按次生成计费,因此片段长度会改变比较结果。下表列出在 reAPI 上获得相同输出规格时,两者最便宜可行路径的成本。

输出规格Gemini Omni Flash(按次)Seedance 2.0 最低公开路由(无源视频)
5s 720p 含音频不适用(Omni 时长为 4 / 6 / 8 / 10)$0.410(Mini)[8]
6s 720p 含音频$0.204[7]$0.492(Mini)[8]
8s 1080p 含音频$0.216[7]$3.060(8s × $0.3825/s Face 无源视频费率)[8]
10s 1080p 含音频$0.240[7]$3.825(Face)[8]
10s 4K 含音频$0.480[7]$7.800(Face)[8]

这里有两点需要说明。第一,在同一分辨率档位内,Gemini Omni Flash 的单次生成价格只会随时长小幅变化:720p/1080p 下,4s 为 $0.18,10s 为 $0.24[7]。Seedance 2.0 的按秒价格会随时长线性累加,因此片段越长,在同分辨率下 Omni 的价格优势越大。第二,只有真正的源视频会触发 Seedance 较低费率;图片、首尾帧和音频都使用基础费率。有源视频时还会计算输出时长与向上取整后的源视频总时长[8],所以上表采用无源视频价格。

对于 2026 年 5 月一段 6 秒、1080p、含音频的视频,reAPI 上 Gemini Omni Flash 更便宜。对于超过 10 秒的多镜头分镜,或需要同时组合参考视频与参考音频的输出,这两个模型中只有 Seedance 2.0 能完成。

实际应该在什么情况下选择哪个模型

以下情况选择 Gemini Omni Flash:

  • 你需要迭代同一片段,希望通过多轮编辑完成修改,而不是每次从头生成
  • 4K 输出很重要
  • 10 秒上限足以满足需求(Brichtova 告诉 TechCrunch,这一上限是产品决策,并非模型限制[4]
  • 按次生成的固定价格更方便预测成本
  • 你需要开放数字人生成能力(目前仅限消费端,API 即将开放[1]

以下情况选择 Seedance 2.0:

  • 每次调用只需交付一段精修成片,不需要迭代
  • 一段 15 秒输出中的多镜头分镜可替代 3-to-4 次调用流程
  • 生成需要参考视频、参考音频或两者
  • 非英语语言的口型同步对白是硬性要求
  • 需要 21:9 超宽屏或其他非标准画幅
  • 客户在意 Arena Elo 排名

没有哪一个在所有场景中都更好。只有明确输出规格和团队的迭代方式,Gemini Omni vs Seedance 2.0 才会得出答案。

常见问题

Gemini Omni 是 Veo 3.1 的升级版吗?

Google 产品页称,Gemini Omni 将在 Gemini 应用中取代 Veo[3]。Veo 3.1 仍可通过 Vertex AI、Gemini API 和聚合平台使用。在消费端(Gemini 应用、Flow、YouTube Shorts),Omni Flash 将成为新的默认模型。

Seedance 2.0 可以免费使用吗?

API 层面不免费。所有提供 Seedance 2.0 API 的平台都将其放在付费档位。ByteDance 的消费端产品(Dreamina、CapCut)在免费层中包含少量 Seedance 2.0 配额,但这些配额不能通过 API 使用。

Gemini Omni Flash 是否像 Seedance 2.0 一样支持多镜头?

不支持。Gemini Omni Flash 输出最长 10 秒的单一连续镜头[7]。在一段视频内生成多镜头序列是 Seedance 2.0 的能力[5]。如需用 Gemini Omni 制作分镜,必须分别生成每个镜头,或通过多轮对话分阶段精修同一镜头。

可以通过同一个端点使用两个模型吗?

可以。两个模型都使用 reAPI 的 POST /api/v1/videos/generations 和相同请求封装。切换时只需把 modelgemini-omni 改为 doubao-seedance-2.0,并调整无法对应的字段(Omni 的 image_urls 接受 0/1/3 项,Seedance 最多接受 9 项;Omni 没有 video_urlsaudio_urls)。

哪个模型的物理效果更好?

两家供应商都将物理真实感列为特性。Google 博客称 Omni “对重力、动能和流体动力学等作用力有更好的直观理解”[1]。ByteDance 的 Seedance 2.0 论文讨论了复杂运动与物理交互。Artificial Analysis Arena 的图生视频 Elo 往往由物理效果影响投票,目前 Seedance 2.0 以 1,351 领先所有已测试模型[6]。在 Omni Flash 获得足够 Arena 投票前,“Seedance 的物理效果领先”是有数据支持的结论。

Hollywood 知识产权风险如何?

Seedance 2.0 的风险确实存在。由于训练数据争议,ByteDance 于 2026 年 2 月 13 日收到 Disney 的停止侵权函[11]。不要提示你无权使用的知名影视角色、电影或风格。Gemini Omni Flash 输出带有 SynthID 水印,Seedance 2.0 输出带有 C2PA 水印,两者都让衍生作品可以在下游被检测。

Gemini Omni API 何时开放?

Google 表示,开发者和企业 API 将在 5 月 19 日发布后的“未来几周”开放[4]。reAPI 在发布时就通过标准视频端点提供 Gemini Omni,因此无需等待 Google 直接 API 即可调用。请求格式见 Gemini Omni 文档,实时价格见模型页面

在同一流程中路由两个模型

对于 2026 年 5 月交付 AI 视频的大多数团队,Gemini Omni vs Seedance 2.0 不是一次性决定,而是每次请求的路由选择。Seedance 2.0 负责一次生成的精修成片、多参考素材组合,以及需要在一个片段内制作多镜头分镜的任务。Gemini Omni Flash 负责 4K、1080p 含音频片段,以及所有需要通过对话持续迭代的任务。两个模型都走 reAPI 独立的媒体 REST/任务网关,使用媒体网关自己的 key 和余额;OpenAI 兼容的聊天网关使用另一套 key 和余额。因此,路由仍只是配置调整,而不是迁移供应商。

如果被迫只选一个模型完成所有任务,我会选择 Seedance 2.0 来制作当前交付给付费客户的商业成片,因为它已经在 Arena 中验证领先。如果流程中第二版比第一版更重要,我会选择 Gemini Omni Flash,再让下一轮基准测试解决质量争议。Gemini Omni vs Seedance 2.0 是我在 2026 年视频领域见过最明确的例子:坚持只选一个模型,反而是错误答案。

参考资料

  1. Google。Introducing Gemini Omni。 Koray Kavukcuoglu,2026 年 5 月 19 日。2026 年 5 月检索自 blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni
  2. Google DeepMind。Gemini Omni——模型页面。 2026 年 5 月检索自 deepmind.google/models/gemini-omni
  3. Google。Gemini Omni——视频生成概览。 2026 年 5 月检索自 gemini.google/overview/video-generation
  4. Rebecca Bellan。Google 的 Gemini Omni 将图片、音频和文字转为视频——这只是开始。 TechCrunch,2026 年 5 月 19 日。techcrunch.com/2026/05/19/googles-gemini-omni-turns-images-audio-and-text-into-video-and-thats-just-the-start
  5. ByteDance Seed。Seedance 2.0 正式发布。 2026 年 2 月 12 日。seed.bytedance.com/en/blog/official-launch-of-seedance-2-0
  6. Artificial Analysis。Video Arena 排行榜。 2026 年 5 月检索自 artificialanalysis.ai/video/arena
  7. reAPI。Gemini Omni——模型页面(实时价格)。 2026 年 5 月检索自 reapi.ai/models/gemini-omni
  8. reAPI。Seedance 2.0——模型页面(实时价格)。 2026 年 5 月检索自 reapi.ai/models/seedance-2-0
  9. reAPI。Gemini Omni——API 参考。 2026 年 5 月检索自 reapi.ai/docs/gemini-omni
  10. reAPI。Seedance 2.0——API 参考。 2026 年 5 月检索自 reapi.ai/docs/seedance-2-0
  11. Wikipedia contributors。Seedance 2.0。 2026 年 5 月检索自 en.wikipedia.org/wiki/Seedance_2.0

延伸阅读