
Gemini Omni API 预览版完全指南:规格与价格
Google Gemini Omni API 预览版详解:官方模型 ID、互动接口、720p 输出、计费方式、输入限制、多轮编辑及与 reAPI 产品的区别。
Google 直连 Gemini Omni API 现已作为付费公开预览版上线,模型 ID 为 gemini-omni-flash-preview。它通过 Gemini Interactions API 运行,支持生成 3–10 秒的 720p 24FPS 视频,单位成本约为每秒 $0.10。 该 API 可从文本或图像生成视频,同时生成音频,并通过传递 previous_interaction_id 在多轮中编辑结果。[1][2]
上述规格介绍的是 Google 直连的官方 Gemini Developer API。但并不适用于所有名称中包含 Gemini Omni 的 API。特别是,reAPI 的 gemini-omni 是供应商路由视频接口,具有不同的端点、模型名称、请求体、分辨率等级和计费方法。应将两者视为独立集成。
Gemini Omni API 规格速查
| 项目 | Google 直连公开预览版 |
|---|---|
| 模型 ID | gemini-omni-flash-preview |
| 接口 | Gemini Interactions API |
| REST 端点 | POST https://generativelanguage.googleapis.com/v1beta/interactions |
| 访问条件 | 付费 Gemini API 层;无免费版 |
| 输入 | 文本、图像和视频(用于编辑) |
| 输出 | 带生成音频的视频 |
| 输出时长 | 3–10 秒 |
| 输出规格 | 720p, 24 FPS |
| 宽高比 | 16:9 或 9:16 |
| 上下文窗口 | 1,048,576 tokens |
| 视频输出价格 | $17.50 per 1M 输出 tokens,约 $0.10 每秒 |
| 有状态编辑 | 是,通过 previous_interaction_id |
| 生命周期 | 预览版;接口和限制可能变更 |
Google 于 2026 年 6 月 30 日将该模型加入公开预览版。其发布说明和模型卡是了解输出限制的最清晰来源:两者都明确指出 720p 视频在 3 到 10 秒之间,模型卡还指定 24 FPS 和 1,048,576 token 上下文窗口。[2][3]
正确的模型 ID 和端点
直连模型 ID 为:
gemini-omni-flash-preview在直接 Google 请求中不要缩短为 gemini-omni。该较短标识符属于 reAPI 的供应商路由接口,不是 Gemini Developer API。
Google 通过 Interactions API 而非 Veo 使用的较旧长时间运行视频生成模式来公开 Omni。最小的 REST 请求看起来像这样:
curl -X POST \
"https://generativelanguage.googleapis.com/v1beta/interactions?key=$GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-omni-flash-preview",
"input": "A continuous handheld shot of a tabby cat crossing a sunny kitchen. Natural room audio, no dialogue."
}'直连 REST 响应返回包含 steps 数组的交互。生成的 MP4 在 model_output 步骤中显示为视频内容。Google 的 Python 和 JavaScript SDK 添加了 output_video 便利字段,因此 SDK 代码和原始 REST 解析并不完全相同。[1]
对于竖屏输出,添加响应格式:
{
"response_format": {
"type": "video",
"aspect_ratio": "9:16"
}
}横屏 16:9 是默认值。公开指南不记载类似 reAPI 路由那样的数值 duration 请求字段。Google 指出输出在 3–10 秒范围内,并在提示词中显示自然语言时间和时间码,如 [0-3s]、[3-6s] 和 [6-10s]。[1]
Google 直连计费方式
Gemini Omni Flash 预览版仅在付费层可用。Google 当前的标准价格为:[4]
| 计费项 | Google 直连价格 |
|---|---|
| 输入 tokens,任何列出的模态 | $1.50 每百万 tokens |
| 文本输出,包括思考 tokens | $9.00 每百万 tokens |
| 视频输出,包括思考 tokens | $17.50 每百万 tokens |
Google 将 720p 视频转换为输出 tokens,速率为 5,792 tokens/秒。在 $17.50/百万 tokens 的价格下,大约是每输出秒 $0.101。因此粗略的视频输出估计为:
3 秒输出 ≈ $0.30
6 秒输出 ≈ $0.61
10 秒输出 ≈ $1.01这些是视频输出部分的估计,不是保证的发票总额。输入媒体、输入文本、文本输出和思考 token 消耗可能会增加费用。重试和额外编辑轮数也是新的可计费交互。
重要的区别是,Google 不为此预览版公布固定的"$X 每生成"价格。它按 token 消耗计费。如果第三方路由为 8 秒或 10 秒工作引用固定价格,那是第三方的产品合约。
通过 Interactions API 进行多轮视频编辑
有状态编辑是使用 Google 直连接口的最强理由。第一个请求创建视频并返回交互 ID。第二个请求用 previous_interaction_id 指向该状态:
import base64
from google import genai
client = genai.Client()
first = client.interactions.create(
model="gemini-omni-flash-preview",
input="A woman playing violin outdoors in soft morning light.",
)
edited = client.interactions.create(
model="gemini-omni-flash-preview",
previous_interaction_id=first.id,
input="Remove the violin. Keep everything else the same.",
)
with open("edited.mp4", "wb") as file:
file.write(base64.b64decode(edited.output_video.data))每一轮生成新视频。该模型往前传递视频状态和会话,因此编辑提示词可以仅命名请求的更改。Google 的指导推荐简短的编辑指令,并建议在保留场景其余部分重要时添加"Keep everything else the same"。[1]
状态有运营成本。如果设置 store: false,结果稍后无法通过 previous_interaction_id 编辑。当后续修订是产品工作流的一部分时,将交互 ID 与资产记录一起保存。如果不需要编辑,Google 建议设置 background=false、store=false 和 stream=false 以获得更快的同步请求。
输入支持和当前预览版限制
模型卡列出文本、图像和视频输入。用于编辑时视频输入上限为 10 秒,而生成输出保持在 720p 24 FPS 的 3–10 秒。[3]
该指南支持几种请求形式:
- 文字转视频;
- 从开始图像的图像转视频;
- 多个主体或风格参考图像;
- 先前生成结果的有状态编辑;
- 通过 Files API 编辑上传的视频。
这个宽泛的列表需要一个预览阶段的警告。Google 的当前限制说上传的音频参考不受支持,尽管该模型使用视频生成音频轨道。参考多个视频不受支持。视频扩展、首尾帧之间的插值和语音编辑也不可用。通用视频参考最多三秒可以通过 API 模式验证,但目前未被模型正确处理。[1]
也存在地区限制。编辑上传的视频目前在欧洲经济区、瑞士或英国不可用,尽管这些地区的用户可以编辑由该模型生成的视频。涉及未成年人和某些可识别人物的图像编辑承载额外限制。
值得规划的其他工程限制:
- 无预配吞吐量;
- 无系统指令、
temperature、top_p、停止序列或专用负面提示参数; - 英文完全支持,而其他语言尚未正式评估;
- 内容安全筛选器应用于提示词和生成媒体;
- 每个生成视频都携带不可见的 SynthID 水印;
- 大输出应使用 URI 传输而非内联 base64。
专用负面提示字段缺失,但负面指令仍可在普通提示词中编写:"No dialogue"、"No scene cuts"或"Do not add text"。
Google 直连 API vs reAPI 的 gemini-omni
名称相似度足以导致实现错误。合约并不互通:
| 合约详情 | Google 直连预览版 | reAPI 供应商路由 |
|---|---|---|
| 模型 | gemini-omni-flash-preview | gemini-omni |
| 端点 | /v1beta/interactions | /api/v1/videos/generations |
| 执行 | 交互响应;内联或 URI 媒体 | 异步任务提交和轮询 |
| 输出分辨率 | Google 记录 720p | 供应商交付层级:720p、1080p、4K |
| 时长 | 3–10 秒输出;提示词时间 | 显式 duration:4、6、8 或 10 |
| 图像 | Interactions 多模态内容 | 公开 image_urls,0、1 或 3 条目 |
| 视频输入 | 直接编辑工作流和预览限制 | 一个公开 video_urls 条目,供应商路由规则 |
| 多轮状态 | previous_interaction_id | 视频生成合约中无等效字段 |
| 计费 | 基于 token;约 $0.10 每输出秒 | 每个任务供应商路由价格 |
| 结果形式 | 交互 steps / SDK output_video | 任务 output.video_urls |
reAPI 的 Gemini Omni API 参考 记录供应商路由。它接受最多 2,000 字符的提示词、显式的时长和分辨率字段、16:9 或 9:16、公开 URL 输入和任务轮询。其 1080p 和 4K 选项是供应商交付层级;它们不是证据表明 Google 的直连公开预览版公开这些分辨率。
以下是 reAPI 上的等效最小形式:
{
"model": "gemini-omni",
"prompt": "A continuous handheld shot of a tabby cat crossing a sunny kitchen.",
"duration": 6,
"resolution": "1080p",
"aspect_ratio": "16:9"
}该路由返回任务 ID,客户端轮询直到 output.video_urls 可用。它不返回 Google 交互 ID,不应被视为直接 Interactions API 的包装器。
披露: reAPI 发布本文并运营上述描述的 reAPI 供应商路由端点。本指南中的直连 Google 规格和价格来自 Google 文档;reAPI 合约详情来自我们发布的 API 参考。之所以说明区别是因为 reAPI 在路由产品中有商业利益。
应该使用哪个 API?
当产品特别需要会话编辑、存储的交互历史或直接 Google 计费关系时,使用 Google 的直连预览版。当团队想针对最新 Google 接口构建且接受预览生命周期风险时,它也是最清晰的路由。
当固定的请求模式、显式的分辨率和时长层级、公开 URL 输入和通用异步任务模式比 Google 交互状态更有用时,使用供应商路由合约。验证该路由自身的定价和媒体约束,而不是将 Google 设置复制到其中。
这个选择与选择视频模型分开。如果实际问题是是否在生产工作流中保留 Veo,请阅读 Gemini Omni vs Veo 3.1 对比。如果决策涉及多模态参考控制和生成风格,Gemini Omni vs Seedance 2.0 对比 涵盖该搜索意图。本页仅涉及 Gemini Omni API 合约。
常见问题
Gemini Omni API 现在可用吗?
是的。Google 于 2026 年 6 月 30 日在付费 Gemini Developer API 层发布 gemini-omni-flash-preview。这是公开预览版,不是通常可用的生产模型。[2]
直接 Gemini Omni API 支持什么分辨率?
Google 的模型卡目前记录 720p 24 FPS 输出。不要从第三方 Gemini Omni 路由推断直接 1080p 或 4K 支持。[3]
Gemini Omni 视频多少钱?
Google 按百万视频输出 tokens $17.50 计费,计算 720p 视频为 5,792 tokens/秒。这大约是每输出秒 $0.10,在其他输入或输出消耗之前。[4]
Gemini Omni 可以多次编辑同一视频吗?
可以。在下一个 Interactions API 请求中将前一个交互的 ID 作为 previous_interaction_id 传入。如果用户可能返回进行另一次编辑,请保持存储启用并保存 ID。[1]
Gemini Omni 接受音频参考吗?
当前直接 API 预览版中不接受。它使用视频生成音频,但 Google 的限制列表说上传音频参考不受支持。[1]
gemini-omni 是 Google 模型 ID 吗?
不是。直接 Google 模型 ID 是 gemini-omni-flash-preview。gemini-omni 是 reAPI 独立供应商路由合约使用的标识符。
References
- Google AI for Developers. Generate and edit videos with Gemini Omni Flash. Updated July 30, 2026. ai.google.dev/gemini-api/docs/omni
- Google AI for Developers. Gemini API release notes — June 30, 2026. ai.google.dev/gemini-api/docs/changelog
- Google AI for Developers. Gemini Omni Flash model card. ai.google.dev/gemini-api/docs/models/gemini-omni-flash
- Google AI for Developers. Gemini Developer API pricing — Gemini Omni Flash Preview. Retrieved July 30, 2026. ai.google.dev/gemini-api/docs/pricing
作者

分类
更多文章

GPT API 价格下降:五个模型在 reAPI 便宜 20%
五个 GPT 模型在 reAPI 上比 OpenAI 标准价便宜 20%。对比 GPT-5.4、GPT-5.5 和 GPT-5.6 全系价格。


2026 年 Seedance 2.0 最具性价比的 API:价格对比
对齐规格比较 reAPI、Atlas、Replicate、fal 和 WaveSpeed 的 Seedance 2.0 价格、计费规则与最优场景。


Wan 3.0 Video Prime API:价格、模式与 Python 设置
使用 Wan 3.0 Video Prime API 快速生成 2–30 秒视频。查看实时价格、五种请求模式、Python 代码、系统限制和计费陷阱。
