
Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5:跑分对比
Gemini 4 Argon、GPT-6 Astra 与 Claude Opus 5.5 在谷歌表格全部 18 项基准上的跑分对比,外加输出上限、价格,以及不同任务该选哪个模型。
Gemini 4 Argon 在谷歌自己的基准测试表中领先,但并非处处领先。谷歌在 2026 年 9 月 30 日发布时公布了一张 19 行的表格,在 Argon、GPT-6 Astra 和 Claude Opus 5.5 三者之间,Argon 有 13 行得分最高,1 行并列,5 行落后:3 行输给 Astra,2 行输给 Opus 5.5[1]。落后的项目集中在终端任务、难度更高的软件基准和电脑操作上,而这恰恰是许多开发者评判它的地方。
本文把谷歌表格中的每个数字并排列出,补上各厂商公布的规格和价格,并解释谷歌评测方法中的注意事项。发布后的搜索也在问同样的问题:"gemini 4 argon benchmarks"(跑分)、"gemini 4 argon performance relative to other models"(与其他模型相比的性能)、"gemini 4 vs gpt 6 astra"、"gemini 4 vs claude"。在所有分数之上,还有一个实际差别:Astra 和 Opus 5.5 已全面开放,Argon 还没有[1]。
要点速览
- 总体:在三个模型中,Gemini 4 Argon 在谷歌表格 19 行里有 13 行得分最高,GPT-6 Astra 3 行,Claude Opus 5.5 2 行,另有 1 行并列[1]。
- Argon 领先最明显的项目:Harvey's Legal Agent Benchmark(19.6% 对 5.4% 和 3.8%)、长上下文 GraphWalks 256K–1M(84.2% 对 71.8% 和 66.8%),以及长视频 LVBench(91.7%)[1]。
- Argon 落后的项目:Opus 5.5 在 Terminal-bench 4.0(66.4% 对 57.4%)和 PostTrainBench 上领先;Astra 在 FrontierSWE v2、Terminal-Bench Science 和 OSWorld-2.0 上领先[1]。
- 输出:Argon 单次回答可返回 1M token。Astra 和 Opus 5.5 在标准 API 上的上限是 128K[1][2][4]。
- 每 1M token 价格:Argon 首发价 $2/$10,之后为 $4/$20;Opus 5.5 为 $4/$20;Astra 为 $10/$50[1][2][3]。
Gemini 4 Argon 跑分:完整表格
以下数字来自谷歌公告中的基准测试表。谷歌的表格还包含 Claude Fable 5.1,这里单独列出一栏,这样“对比 Fable”的问题也有答案。Argon、Astra 和 Opus 5.5 三者中的最高分加粗;破折号表示谷歌没有报告结果[1]。
| 领域 | 基准 | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | Claude Fable 5.1 |
|---|---|---|---|---|---|
| 知识工作 | Vals Index | 68.9% | 63.1% | 67.0% | 65.8% |
| 知识工作 | AutomationBench | 51.3% | 41.4% | 42.5% | 31.4% |
| 知识工作 | Vals Finance Agent v2 | 65.4% | 53.5% | 58.6% | 58.9% |
| 知识工作 | Harvey's Legal Agent Benchmark | 19.6% | 5.4% | 3.8% | 6.7% |
| 智能体编程 | DeepSWE v1.1 | 77.9% | 74.1% | 74.2% | 67.4% |
| 智能体编程 | FrontierSWE v2 | 55.0% | 65.5% | 62.3% | 56.3% |
| 智能体编程 | Vibe Code Bench | 91.9% | 89.6% | 90.3% | 90.3% |
| 智能体编程 | Terminal-bench 4.0 | 57.4% | 58.2% | 66.4% | 57.9% |
| 机器学习工程 | PostTrainBench | 45.3% | 44.3% | 49.3% | 40.2% |
| 科学与数学 | Terminal-Bench Science 0.1 | 57.6% | 68.1% | 63.3% | 52.6% |
| 科学与数学 | LABBench 2 | 88.8% | 85.4% | 73.1% | 68.6% |
| 科学与数学 | RiemannBench | 76.0% | 72.0% | 69.6% | 65.6% |
| 长上下文 | GraphWalks,最高 128K | 99.7% | 98.7% | 90.6% | 91.4% |
| 长上下文 | GraphWalks,256K 至 1M | 84.2% | 71.8% | 66.8% | 65.0% |
| 电脑操作 | Agent's Last Exam | 39.5% | 34.2% | 38.2% | — |
| 电脑操作 | OSWorld-2.0(离线子集) | 69.2% | 72.6% | — | — |
| 多模态 | Chartography | 71.6% | 71.0% | 66.3% | 46.2% |
| 多模态 | LVBench | 91.7% | 87.5% | 83.7% | 79.7% |
| 网络安全 | CWE-bench v1 | 68.0% | 68.0% | 67.0% | 58.0% |
单独与 Claude Opus 5.5 正面对比,在两者都有分数的 18 行中,Gemini 4 Argon 领先 14 行,落后 4 行:FrontierSWE v2、Terminal-bench 4.0、PostTrainBench 和 Terminal-Bench Science[1]。
结合谷歌的评测方法来读这张表
表中每个分数都来自谷歌的公告,谷歌的方法说明页解释了每个数字的来源。有三个细节会影响你该给这些差距多大权重[5]:
- 大多数对手的分数是自报的。谷歌称,非 Gemini 模型的结果“除非另有说明,均取自各厂商自行报告的数字”,并在有报告的情况下采用各对手可用的最高推理设置。
- 部分 Argon 分数是谷歌自己跑的。Argon 的 DeepSWE v1.1 和 Terminal-bench 4.0 结果由谷歌运行,而 Astra、Fable 和 Opus 的数据来自公开排行榜或系统卡。这是常见做法,但意味着测试框架并不总是完全相同。
- 输入并不总是相同。在 LVBench 上,谷歌对 Gemini 使用每秒 1 帧,而对 Astra 使用 800 帧、Opus 5.5 使用 600 帧、Fable 5.1 使用 300 帧,原因是“API 限制”。各模型看到的帧数预算不同,所以长视频上的差距要谨慎看待。
这些都不说明表格有错。但它意味着 1 分的领先,比如 Vals Index 或 CWE-bench,在实际中等同于持平;而 12 到 17 分的差距,比如 Harvey's Legal Agent Benchmark 或 256K 至 1M 的 GraphWalks,才是真实的信号。
规格与价格对比
基准测试只是决策的一半。下面是各厂商公布的上限和价格。
| Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | |
|---|---|---|---|
| 可用性 | 仅限 Fairwind Program 合作伙伴;开发者“尽快”开放[1] | 已全面开放[2] | 已全面开放[4] |
| 上下文窗口 | 未公布 | 1,050,000 token[2] | 1M token[4] |
| 单次回答最大输出 | 1M token[1] | 128,000 token[2] | 128K(通过 Batch API beta 可达 300K)[4] |
| 输入类型 | 文本,以及图表、文档和长视频(据谷歌)[1] | 文本、图片[2] | 文本、图片[4] |
| 每 1M token 输入 / 输出 | 首发 $2 / $10,之后 $4 / $20[1] | $10 / $50,输入超过 272K 更贵[2] | $4 / $20[3] |
| 每 1M token 缓存输入 | 首发期 $0.10[1] | $1[2] | 缓存命中 $0.20[3] |
每 token 价格和每个任务的价格是两回事;Gemini 4 Argon 价格解析用三个模型算了四种任务形态的费用。
Gemini 4 Argon vs GPT-6 Astra
对比 Astra,Argon 赢下了大多数知识工作和长上下文项目,在法律和金融智能体测试上优势很大:Harvey's 基准 19.6% 对 5.4%,Vals Finance Agent v2 65.4% 对 53.5%[1]。在首发优惠期内,它的价格只有 Astra 标价的五分之一,优惠期后为五分之二[1][2]。
在电脑操作和更难的软件基准上,Astra 是更强的选择。它在 OSWorld-2.0(72.6% 对 69.2%)、FrontierSWE v2(65.5% 对 55.0%)和 Terminal-Bench Science(68.1% 对 57.6%)上领先[1]。FrontierSWE v2 和 Terminal-Bench Science 上 10.5 分的差距,是 Argon 在自家发布表格中最大的失分,因此工作内容与这些基准相似的团队,在切换之前应先做测试。Astra 在 Terminal-bench 4.0 上也以 58.2% 对 57.4% 小幅领先 Argon。
Gemini 4 Argon vs Claude Opus 5.5
在编程上,这是最接近的一组。Argon 在 DeepSWE v1.1(77.9% 对 74.2%)和 Vibe Code Bench(91.9% 对 90.3%)上略胜 Opus 5.5,而 Opus 5.5 在 Terminal-bench 4.0 上领先 9 分(66.4% 对 57.4%),在 PostTrainBench 上领先 4 分(49.3% 对 45.3%)[1]。如果你的智能体主要在 shell 里干活,Opus 5.5 面对这款更新的模型依然不落下风。
编程之外,Argon 拉开了差距。法律基准差 15.8 分,256K 至 1M 的长上下文 GraphWalks 差 17.4 分,LABBench 2 差 15.7 分[1]。Argon 的首发优惠期结束后,两个模型的标价都是每百万 token $4 和 $20[1][3],所以选择取决于工作内容,而不是价格。
不同任务该用哪个模型
- 法律和金融研究、长文档集、长视频:Gemini 4 Argon,前提是你能用上。这些是它领先最多的地方。
- 超长的单次输出,比如完整迁移或超过 128K token 的报告:在三个模型中,只有 Gemini 4 Argon 能在一次回答中完成。
- 以终端为主的编程智能体:Claude Opus 5.5,它在 Terminal-bench 4.0 上明显领先。
- 电脑操作和最难的 SWE 任务:GPT-6 Astra,它在 OSWorld-2.0 和 FrontierSWE v2 上领先。
- 本月就要上线的任何东西:Astra 或 Opus 5.5,因为 Gemini 4 Argon 还没有公开 API[1]。
在 reAPI 上,Claude Opus 5.5 和 GPT-6 Astra 都已上线,共用一个 API Key 和一个 Chat Completions 接口。你今天就可以在两者上跑同一套评估,等 Gemini 4 Argon 到来时再加上它。Gemini 4 Argon 模型页会跟踪它的开放进度。
常见问题
Gemini 4 Argon 比 GPT-6 Astra 更强吗?
在谷歌表格的大部分项目上是的:对比 Astra,Argon 在 19 行中有 14 行得分更高,1 行并列。Astra 在 FrontierSWE v2、Terminal-Bench Science、OSWorld-2.0 上领先,并在 Terminal-bench 4.0 上小幅领先[1]。
Gemini 4 Argon 比 Claude Opus 5.5 更强吗?
在谷歌表格中可比的 18 行里,有 14 行是。Opus 5.5 在 Terminal-bench 4.0、PostTrainBench、FrontierSWE v2 和 Terminal-Bench Science 上领先[1]。
Gemini 4 Argon 与 Claude Fable 5.1 相比如何?
在谷歌同时报告两者分数的 17 行中,Argon 有 15 行高于 Fable 5.1。Fable 5.1 在 FrontierSWE v2(56.3% 对 55.0%)和 Terminal-bench 4.0(57.9% 对 57.4%)上略微领先[1]。
Gemini 4 Argon 最好的跑分是哪一项?
最高分是 GraphWalks(最高 128K),为 99.7%。最有意义的胜利是差距大的那几项:Harvey's Legal Agent Benchmark 19.6%,而 Astra 为 5.4%、Opus 5.5 为 3.8%;以及 256K 至 1M 的 GraphWalks 84.2%[1]。
这些跑分是独立测出来的吗?
不完全是。它们来自谷歌的公告;谷歌表示大多数对手的分数由各厂商自行报告,部分 Argon 测试由谷歌自己运行[5]。
Gemini 4 Argon、GPT-6 Astra 和 Claude Opus 5.5 哪个最便宜?
按首发优惠价 $2/$10 计算是 Gemini 4 Argon。之后,Argon 和 Opus 5.5 的标价都是 $4/$20,Astra 是每 1M token $10/$50[1][2][3]。
在 Gemini 4 Argon、Astra 和 Opus 5.5 之间怎么选
谷歌的表格有力地说明,Gemini 4 Argon 是三者中综合能力最强的模型:在法律、金融、长上下文和长视频上领先最多,还有一个其他模型都比不上的 1M token 输出。它也显示出这个论点最薄弱的地方:终端和电脑操作智能体,Opus 5.5 和 Astra 在这些项目上仍然胜出。
有两点让这还不能算最终结论。这些分数来自赢下大部分项目的那个模型的厂商,而 Argon 是这组对比中唯一一个你现在还调用不了的模型。现在就在 Astra 和 Opus 5.5 上搭好评估,等 Gemini 4 Argon 向开发者开放后再跑一遍。
参考资料
- Google. Gemini 4 Argon: our next era of frontier intelligence (including benchmark table). 2026 年 10 月检索自 blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon
- OpenAI. GPT-6 Astra model page. 2026 年 10 月检索自 developers.openai.com/api/docs/models/gpt-6-astra
- Anthropic. Pricing. 2026 年 10 月检索自 platform.claude.com/docs/en/about-claude/pricing
- Anthropic. Models overview. 2026 年 10 月检索自 platform.claude.com/docs/en/about-claude/models/overview
- Google DeepMind. Gemini 4 Argon model evaluation: approach, methodology and results. 2026 年 10 月检索自 deepmind.google/models/evals-methodology/gemini-4-argon
作者

分类
更多文章

FLUX 3 视频价格完全指南:草稿、高清、全高清与续生成
计算 FLUX 3 视频在草稿、高清、全高清、关键帧和视频续生成等各模式下的成本差异,详解草稿到成品的完整工作流程和 5-20 秒档位总价。


AI 图像 API 内容过滤:请求被拒的原因
图像 API 的内容过滤分为多个层级。同一个提示词在某个平台可能通过审核,在另一个平台可能被拒绝,但某些安全底线无论如何配置都不会改变。


AI 视频代理:构建批评循环实现质量保证
构建 AI 视频代理的批评循环,定义镜头验收规则、修复范围和重试预算,通过人工审核门控和选择性修复防止不合格视频进入最终编辑流程。
