Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Gemini Omni vs Veo 3.1:2026 年 5 月要不要迁移
2026/05/21

Gemini Omni vs Veo 3.1:2026 年 5 月要不要迁移

2026 年 5 月的 Gemini Omni 与 Veo 3.1 对比:Google 只在 Gemini App 里用 Omni 换掉了 Veo,API 里没换。五条 channel 映射、请求体 diff,以及各自的适用场景。

Google 的 Gemini Omni 页面上只写了一句话:「Gemini Omni will replace Veo in the Gemini app.」[3] 如果只读营销文案,你会以为 Veo 3.1 已经下线了。并没有。Veo 3.1 仍然跑在 Vertex AI 上、跑在 Gemini API 上,也跑在每一家上架它的聚合平台上。Google 自己在 2026 年 4 月 28 日对 Veo 3.1 的 Gemini API 文档做的更新,比 Omni 发布还要新[4]

所以 2026 年 5 月你在 Gemini Omni 和 Veo 3.1 之间做选择时,选的并不是「一个已弃用的模型」和「它的接班人」。你选的是:一个上线 7 个月、按秒计费、带五条 channel 的模型,和一个上线 2 天、按次计费、只有一条 channel 的模型。答案取决于你原本要调的是哪条 Veo 3.1 channel,以及这条链路是否需要音频、4K、首尾帧控制或多轮编辑。

TL;DR

  • 「替换」的边界。 Google 只在 Gemini App、Flow 和 YouTube Shorts 里把 Veo 换成了 Omni[3]。在 Gemini API 里,Veo 3.1 仍然是文档中列出的视频模型[4]
  • API 开放时间。 Veo 3.1 的 Gemini API 从 2025 年 10 月起就可用。Gemini Omni 的公开 API 在 2026 年 5 月 19 日的说法是「未来几周」[5]。走 reAPI,两者今天就能在同一个 endpoint 上调用。
  • 无音频最便宜的路径。 Veo 3.1 Lite 每条 8 秒 720p/1080p 片段 $0.05[6],比 Gemini Omni 8 秒 1080p 的 $0.216[7] 便宜约 4 倍。
  • 带音频最便宜的路径。 Gemini Omni Flash 8 秒 1080p $0.216[7],比 Veo 3.1 Fast Official 的 $1.20(8s × $0.15/s)[6] 便宜 5.5 倍。
  • 4K。 Veo 3.1 Fast alt 每条 8 秒 $0.30,成本上胜出。Gemini Omni 每条 8 秒 $0.432,胜在音频已包含在内。
  • 时长灵活度。 Gemini Omni 支持 4/6/8/10 秒[8]。Veo 3.1 alt 锁死 8 秒,Veo 3.1 official 支持 4/6/8 秒。
  • 首尾帧插值。 只有 Veo 3.1 Official 有。Gemini Omni 不暴露首帧/尾帧锚定。
  • 多轮对话式编辑。 只有 Gemini Omni 有[1]
  • 怎么分工。 便宜的无声片段留在 Veo 3.1 Lite。首尾帧串联留在 Veo 3.1 Official。1080p 或 4K 下任何需要音频的负载,以及任何「迭代比一次成片更重要」的流程,迁到 Gemini Omni。

Google 到底替换了什么

「Gemini Omni 将取代 Veo」这句话,成立的范围正好是三个 C 端入口:Gemini App、Google Flow 和 YouTube Shorts[3]。在这三处,Omni Flash 现在是默认视频模型,Veo 3.1 从这些产品的界面里消失了。

出了这三处,Veo 3.1 和 5 月 18 日那天是同一个产品。ai.google.dev 上的 Gemini API 视频文档仍然把 Veo 3.1 列为受支持的文生视频和图生视频模型[4]。Vertex AI 依旧提供带 person_generationresize_mode 等生产级控制项的 Veo 3.1。经由 Google 的 Veo 3.1 权重做路由的聚合平台不受影响。甚至 Google 自己那篇宣布 Gemini API 新增 Veo 3.1 能力(增加安全过滤、扩大 prompt 长度)的 2026 年 4 月 28 日公告,距离 Omni 发布还不到一个月[4]——这不像是一个正在退役的模型该有的节奏。

Google DeepMind 产品管理总监 Nicole Brichtova 对 TechCrunch 表示,Omni「不只是一次 Veo 更新」,并把它描述为「把 Gemini 的智能与我们媒体模型的渲染能力结合起来,这个方向上的下一步」[5]。这个措辞是有意为之。Omni 是另一个产品品类(推理 + 编辑),而不是 Veo 那套按秒计费的视频合成的原地升级。

对正在 Gemini Omni 和 Veo 3.1 之间做选择的开发者来说,结论是:不要因为 C 端界面换了就跟着迁。等到能力或价格账算下来指向 Omni 时再迁。

能力对照表

能力Gemini Omni FlashVeo 3.1(5 条 channel)
文生视频支持支持
图生视频(单图)支持(1 张参考图)支持(Fast / Quality alt、Official 各档)
多图参考最多 3 张(fusion 模式)[8]最多 3 张(仅 Fast alt)[9]
首帧锚定不支持支持(Official 各档)[9]
首帧 + 尾帧插值不支持支持(Official 各档)[9]
多轮对话式编辑支持[1]不支持
4K 输出支持(含音频 8 秒 $0.432)[7]支持(Official 走 4K 含音频档,alt 走按次固定价)[6]
时长选项4 / 6 / 8 / 10 秒[8]alt:锁死 8 秒;Official:4 / 6 / 8 秒[9]
画幅比例16:9、9:16[8]16:9、9:16[9]
prompt 长度上限2,000 字符[8]4,000 字符[9]
音频控制打包(始终开启)alt:无音频;Official:generate_audio 开关
person_generation 控制不暴露Official:allow_adult / disallow[9]
虚拟形象功能(C 端)[1]
水印SynthID[1]SynthID
计费模型按次alt:按次;Official:按秒

真正左右决策的是三处不对称。

Veo 3.1 的首尾帧插值。 Omni 没有对应能力。如果你的流水线要把片段锚定在一个已知起始帧和一个已知结束帧上(分镜串联、锁定构图重出主镜头),这两个模型里只有 Veo 3.1 Official 给得了这个控制。

Omni 的多轮对话式编辑。 Veo 没有对应能力。「把小提琴变透明。现在换个机位。」每条指令都在不丢失场景的前提下重塑已有片段[1]。Veo 没法在自己的输出上继续迭代,每次都得换个 prompt 重新生成。

Veo 3.1 Official 上的音频开关。 Veo Official 允许你以更低的价格生成无声视频。Omni 把音频打包进每一次生成,价格只有一档。如果你不要音频,在 Veo Fast Official 上设 generate_audio: false 能省 33%;Omni 不暴露这个开关。

Omni 替换不掉的五条 Veo 3.1 channel

在 reAPI 上,Veo 3.1 是五条 channel 而不是一个模型,每条暴露的能力面都不一样[6]。每条都对应一个「留下」或「迁走」的不同理由。

veo3.1-lite 是低价 channel。按次计费,时长锁死 8 秒,无音频,纯 prompt(不接图片输入)。8 秒 720p/1080p 片段 $0.05[6]。同样的输出规格下,Gemini Omni 8 秒 1080p 的 $0.216 大约贵 4 倍。如果你的负载是「快速出草稿、大部分丢掉」,Lite 没有对手。

veo3.1-fast 是 alt 侧的主力 channel。按次计费,最多接 3 张参考图,时长固定 8 秒。8 秒 720p/1080p $0.10,8 秒 4K $0.30。Omni 的三图 fusion 模式覆盖的能力面类似,但 1080p 输出的价格是它的 2 倍。

veo3.1-quality 是 alt 侧的高保真 channel。8 秒 720p/1080p $0.75,8 秒 4K $2.40。用在人脸渲染、文字可读性或角色一致性决定成败的场景。Omni 在这个价位段的原始画质还没有得到验证;发布次日撰稿的评测者说,Omni 的综合质量「落后于」榜单前沿[5]

veo3.1-fast-official 解锁 Vertex 级的控制项:首尾帧锚定、generate_audio 开关、person_generation 枚举、4 / 6 / 8 秒时长。按秒计费,带音频的 720p/1080p 为 $0.15/s。这些控制项在 Omni 上一个对应的都没有。

veo3.1-quality-official 是生产级档位。带音频的 720p/1080p 为 $0.40/s。控制面与 Fast Official 相同,画面保真度更高。用于主视觉镜头和投放级创意。

在 Gemini Omni 和 Veo 3.1 之间做决定时,正确的问题不是「哪个模型赢」,而是「这条负载现在用的是五条 Veo 3.1 channel 中的哪一条,Omni 的能力面盖得住那些控制项吗」。

迁移请求体

在 reAPI 上,两个模型都跑在 POST /api/v1/videos/generations。迁移改的是请求体,不是 endpoint。下面是从最常见的 Veo 3.1 配置到 Omni 的逐字段对照。

Veo 3.1 Fast(alt channel)请求:

{
  "model": "veo3.1-fast",
  "prompt": "A neon city street in the rain, slow camera pan",
  "image_urls": ["https://your-cdn.com/ref.jpg"],
  "generation_type": "frame",
  "aspect_ratio": "16:9",
  "resolution": "1080p"
}

同一个请求,迁到 Gemini Omni:

{
  "model": "gemini-omni",
  "prompt": "A neon city street in the rain, slow camera pan",
  "image_urls": ["https://your-cdn.com/ref.jpg"],
  "duration": 8,
  "aspect_ratio": "16:9",
  "resolution": "1080p"
}

有三处变化要知道。第一,Omni 上没有 generation_type,模式由 image_urls 的数量隐式决定:0 张是文生视频,1 张是图生视频,3 张是 fusion[8]。第二,Omni 把 duration 当作一等字段接收,而 Veo alt 把它锁死在 8 秒。第三,image_urls 长度为 2 时 Omni 会以 400 和错误码 20003 拒绝[8];Veo Fast 接受 1 张、2 张或 3 张。

如果你的源请求走的是 veo3.1-fast-official,迁移丢掉的东西更多。first_frame_imagelast_frame_imagegenerate_audioperson_generationresize_mode 都要删掉,Omni 一个都不暴露。这里面只要有一个是承重的,就别迁。

关键 channel 的价格账

按 2026 年 5 月 reAPI 上一条 8 秒 1080p 片段算:

channel带音频不带音频
veo3.1-lite不支持$0.05(alt,按次)[6]
veo3.1-fast不支持$0.10(alt,按次)[6]
veo3.1-quality不支持$0.75(alt,按次)[6]
veo3.1-fast-official$1.20(8s × $0.15/s)$0.80(8s × $0.10/s)[6]
veo3.1-quality-official$3.20(8s × $0.40/s)$1.60(8s × $0.20/s)[6]
gemini-omni$0.216(按次,含音频)[7]$0.216(没有开关)[7]

两点结论。第一,如果你需要音频而且没在用 Veo Official,Gemini Omni 是 reAPI 上最便宜的路径。Omni 含音频的 $0.216 比 Veo Fast Official 的 $1.20 便宜 5.5 倍,比 Veo Quality Official 的 $3.20 便宜 14.8 倍。第二,如果你不需要音频,Veo Lite 的 $0.05 依然没有对手。Omni 没有静音折扣,因为它的价格根本不看有没有音频。

8 秒 4K 带音频:Gemini Omni $0.432,Veo Quality Official $4.80(8s × $0.60/s)。4K 带音频这一档,Omni 便宜 11 倍。按次计费这套模型对 Omni 最有利的地方就在这里。

什么时候留在 Veo 3.1

  • 链路要用首尾帧锚定把多个镜头串成更长的序列
  • 链路出于安全合规需要把 person_generation 设成 disallow
  • 输出规格是无声视频,而且量一上来 Veo Lite 的 $0.05 底价就有意义
  • 流水线今天就在对外发版,Omni 才发布两天,风险不可接受
  • prompt 长度经常超过 2,000 字符(Veo 允许 4,000)
  • 团队和 Vertex AI 签了谈好条款的合同

什么时候迁到 Gemini Omni

  • 你在为带音频的 veo3.1-fast-official 每条 8 秒片段付 $1.20 以上,而迭代式编辑的链路并不需要首帧锚定
  • 你需要 4K 带音频(Omni 每条 8 秒 $0.432,比 Veo Quality Official 的 $4.80 便宜 11 倍)
  • 链路以编辑为主:每改一次就从头重生成,既烧预算又破坏角色一致性
  • 时长灵活度(4 / 6 / 8 / 10 秒)有意义,而你已经受够了 alt 那个 8 秒锁
  • 你想收敛到一个 endpoint 后面的一个模型,而且团队能接受失去 Veo 的 Official 控制项

FAQ

Veo 3.1 要被弃用了吗

没有。Google 把 Veo 3.1 从 Gemini App、Flow 和 YouTube Shorts 这几个 C 端入口移除,换成了 Gemini Omni Flash[3]。Gemini API 的视频文档仍然把 Veo 3.1 列为受支持模型,文档最近一次刷新是 2026 年 4 月 28 日[4]。Vertex AI 上的 Veo 3.1 没有任何变化。

Gemini Omni 的公开 API 什么时候开放

Google 在 2026 年 5 月 19 日的公告后表示,面向开发者和企业的 API 访问会在「未来几周」内落地[5]。截至本文发布,Omni 还没有任何公开的 Gemini API model ID 被写进文档。在 reAPI 上,Gemini Omni 今天就能以 gemini-omni 在标准视频 endpoint 上调用,早于 Google 自己的 API 放量。

能在一个 endpoint 后面同时用这两个模型吗

能。两者在 reAPI 上都跑 POST /api/v1/videos/generations。切换就是改 "model" 字段。字段映射并不完全一致(见上面的迁移一节)——Omni 去掉了 first_frame_imagelast_frame_imagegenerate_audioperson_generationresize_mode

Gemini Omni 支持首帧和尾帧锚定吗

不支持。Omni 只暴露数量为 0、1 或 3 的图像 fusion[8]。它没有「首帧」或「尾帧」这个概念。如果你的流水线依赖锁定开场或收尾构图,只有 Veo 3.1 Official 给得了。

低成本迭代用哪个模型更便宜

看你要不要音频。Veo 3.1 Lite 每条 8 秒无声片段 $0.05,是任何一次性草稿场景下最便宜的路径[6]。如果每条草稿都要带音频,Gemini Omni 8 秒 1080p 含音频 $0.216 是 reAPI 上最便宜的带音频价[7]

Gemini Omni 的 API 上线后会比 reAPI 更便宜吗

有可能。独立机构预测 Google 直连的 Omni Flash 是每秒输出视频 $0.20–$0.60,外加按 token 计费的输入价。reAPI 每条 8 秒 1080p 片段 $0.216,折算下来大约是 $0.027/s 的统一价,低于 Google 直连预测区间的下限。真实差距要等 Google 公布官方定价才知道。

Gemini Omni 和 Veo 3.1 的画质怎么比

Omni Flash 在本文发布前两天才上线,还没进 Artificial Analysis 的 Video Arena 榜单[10]。Veo 3.1 已经在榜上几个月,综合排名落后 Seedance 2.0、领先 Sora 2。发布后第一批上手评测称 C 端演示很惊艳,但指出综合质量「落后于」榜单前沿[5]。在 Arena 攒够投票之前,把 Omni 当成最新颖的编辑界面,而不是已被验证的画质第一。

下个季度:两个都路由

2026 年 5 月,Gemini Omni 和 Veo 3.1 不是给整条流水线一次性拍板的选择题。你要按请求路由。草稿、无声、首帧锚定的负载发给合适的那条 Veo 3.1 channel。带音频、4K 和多轮编辑的负载发给 Gemini Omni Flash。两者都在同一个 OpenAI 兼容 endpoint 后面,这套路由就是 30 行配置的事。

如果现在必须只标准化一个模型,对任何交付给付费客户的流水线,凭七个月的生产运行记录,我会继续押 Veo 3.1。多轮编辑和打包音频真正有价值的新负载,我会交给 Gemini Omni。「Gemini Omni 取代 Veo」这个说法,对 Google 的 C 端界面成立,放到别处就是误导。把 Gemini Omni 与 Veo 3.1 之争读成「每条 channel 今天还靠什么挣得自己的位置」,迁移方案自己就写出来了。

References

  1. Google. Introducing Gemini Omni. Koray Kavukcuoglu, May 19, 2026. Retrieved May 2026 from blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni
  2. Google DeepMind. Gemini Omni — Model page. Retrieved May 2026 from deepmind.google/models/gemini-omni
  3. Google. Gemini Omni — Video Generation overview. Retrieved May 2026 from gemini.google/overview/video-generation
  4. Google. Enhanced Veo 3.1 capabilities are now available in the Gemini API. April 28, 2026. blog.google/innovation-and-ai/technology/developers-tools/veo-3-1-gemini-api
  5. Rebecca Bellan. Google's Gemini Omni turns images, audio, and text into video — and that's just the start. TechCrunch, May 19, 2026. techcrunch.com/2026/05/19/googles-gemini-omni-turns-images-audio-and-text-into-video-and-thats-just-the-start
  6. reAPI. Veo 3.1 — Model page (live pricing across 5 channels). Retrieved May 2026 from reapi.ai/models/veo3-1
  7. reAPI. Gemini Omni — Model page (live pricing). Retrieved May 2026 from reapi.ai/models/gemini-omni
  8. reAPI. Gemini Omni — API reference. Retrieved May 2026 from reapi.ai/docs/gemini-omni
  9. reAPI. Veo 3.1 — API reference. Retrieved May 2026 from reapi.ai/docs/veo3-1
  10. Artificial Analysis. Video Arena Leaderboard. Retrieved May 2026 from artificialanalysis.ai/video/arena

Further reading