GPT Image 2.5 is live — OpenAI's newest image model, targeted edits that leave the rest of the frame alone
Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5:跑分对比
2026/10/01

Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5:跑分对比

Gemini 4 Argon、GPT-6 Astra 与 Claude Opus 5.5 在谷歌表格全部 18 项基准上的跑分对比,外加输出上限、价格,以及不同任务该选哪个模型。

Gemini 4 Argon 在谷歌自己的基准测试表中领先,但并非处处领先。谷歌在 2026 年 9 月 30 日发布时公布了一张 19 行的表格,在 Argon、GPT-6 Astra 和 Claude Opus 5.5 三者之间,Argon 有 13 行得分最高,1 行并列,5 行落后:3 行输给 Astra,2 行输给 Opus 5.5[1]。落后的项目集中在终端任务、难度更高的软件基准和电脑操作上,而这恰恰是许多开发者评判它的地方。

本文把谷歌表格中的每个数字并排列出,补上各厂商公布的规格和价格,并解释谷歌评测方法中的注意事项。发布后的搜索也在问同样的问题:"gemini 4 argon benchmarks"(跑分)、"gemini 4 argon performance relative to other models"(与其他模型相比的性能)、"gemini 4 vs gpt 6 astra"、"gemini 4 vs claude"。在所有分数之上,还有一个实际差别:Astra 和 Opus 5.5 已全面开放,Argon 还没有[1]。

要点速览

  • 总体:在三个模型中,Gemini 4 Argon 在谷歌表格 19 行里有 13 行得分最高,GPT-6 Astra 3 行,Claude Opus 5.5 2 行,另有 1 行并列[1]。
  • Argon 领先最明显的项目:Harvey's Legal Agent Benchmark(19.6% 对 5.4% 和 3.8%)、长上下文 GraphWalks 256K–1M(84.2% 对 71.8% 和 66.8%),以及长视频 LVBench(91.7%)[1]。
  • Argon 落后的项目:Opus 5.5 在 Terminal-bench 4.0(66.4% 对 57.4%)和 PostTrainBench 上领先;Astra 在 FrontierSWE v2、Terminal-Bench Science 和 OSWorld-2.0 上领先[1]。
  • 输出:Argon 单次回答可返回 1M token。Astra 和 Opus 5.5 在标准 API 上的上限是 128K[1][2][4]。
  • 每 1M token 价格:Argon 首发价 $2/$10,之后为 $4/$20;Opus 5.5 为 $4/$20;Astra 为 $10/$50[1][2][3]。

Gemini 4 Argon 跑分:完整表格

以下数字来自谷歌公告中的基准测试表。谷歌的表格还包含 Claude Fable 5.1,这里单独列出一栏,这样“对比 Fable”的问题也有答案。Argon、Astra 和 Opus 5.5 三者中的最高分加粗;破折号表示谷歌没有报告结果[1]。

领域基准Gemini 4 ArgonGPT-6 AstraClaude Opus 5.5Claude Fable 5.1
知识工作Vals Index68.9%63.1%67.0%65.8%
知识工作AutomationBench51.3%41.4%42.5%31.4%
知识工作Vals Finance Agent v265.4%53.5%58.6%58.9%
知识工作Harvey's Legal Agent Benchmark19.6%5.4%3.8%6.7%
智能体编程DeepSWE v1.177.9%74.1%74.2%67.4%
智能体编程FrontierSWE v255.0%65.5%62.3%56.3%
智能体编程Vibe Code Bench91.9%89.6%90.3%90.3%
智能体编程Terminal-bench 4.057.4%58.2%66.4%57.9%
机器学习工程PostTrainBench45.3%44.3%49.3%40.2%
科学与数学Terminal-Bench Science 0.157.6%68.1%63.3%52.6%
科学与数学LABBench 288.8%85.4%73.1%68.6%
科学与数学RiemannBench76.0%72.0%69.6%65.6%
长上下文GraphWalks,最高 128K99.7%98.7%90.6%91.4%
长上下文GraphWalks,256K 至 1M84.2%71.8%66.8%65.0%
电脑操作Agent's Last Exam39.5%34.2%38.2%—
电脑操作OSWorld-2.0(离线子集)69.2%72.6%——
多模态Chartography71.6%71.0%66.3%46.2%
多模态LVBench91.7%87.5%83.7%79.7%
网络安全CWE-bench v168.0%68.0%67.0%58.0%

单独与 Claude Opus 5.5 正面对比,在两者都有分数的 18 行中,Gemini 4 Argon 领先 14 行,落后 4 行:FrontierSWE v2、Terminal-bench 4.0、PostTrainBench 和 Terminal-Bench Science[1]。

结合谷歌的评测方法来读这张表

表中每个分数都来自谷歌的公告,谷歌的方法说明页解释了每个数字的来源。有三个细节会影响你该给这些差距多大权重[5]:

  1. 大多数对手的分数是自报的。谷歌称,非 Gemini 模型的结果“除非另有说明,均取自各厂商自行报告的数字”,并在有报告的情况下采用各对手可用的最高推理设置。
  2. 部分 Argon 分数是谷歌自己跑的。Argon 的 DeepSWE v1.1 和 Terminal-bench 4.0 结果由谷歌运行,而 Astra、Fable 和 Opus 的数据来自公开排行榜或系统卡。这是常见做法,但意味着测试框架并不总是完全相同。
  3. 输入并不总是相同。在 LVBench 上,谷歌对 Gemini 使用每秒 1 帧,而对 Astra 使用 800 帧、Opus 5.5 使用 600 帧、Fable 5.1 使用 300 帧,原因是“API 限制”。各模型看到的帧数预算不同,所以长视频上的差距要谨慎看待。

这些都不说明表格有错。但它意味着 1 分的领先,比如 Vals Index 或 CWE-bench,在实际中等同于持平;而 12 到 17 分的差距,比如 Harvey's Legal Agent Benchmark 或 256K 至 1M 的 GraphWalks,才是真实的信号。

规格与价格对比

基准测试只是决策的一半。下面是各厂商公布的上限和价格。

Gemini 4 ArgonGPT-6 AstraClaude Opus 5.5
可用性仅限 Fairwind Program 合作伙伴;开发者“尽快”开放[1]已全面开放[2]已全面开放[4]
上下文窗口未公布1,050,000 token[2]1M token[4]
单次回答最大输出1M token[1]128,000 token[2]128K(通过 Batch API beta 可达 300K)[4]
输入类型文本,以及图表、文档和长视频(据谷歌)[1]文本、图片[2]文本、图片[4]
每 1M token 输入 / 输出首发 $2 / $10,之后 $4 / $20[1]$10 / $50,输入超过 272K 更贵[2]$4 / $20[3]
每 1M token 缓存输入首发期 $0.10[1]$1[2]缓存命中 $0.20[3]

每 token 价格和每个任务的价格是两回事;Gemini 4 Argon 价格解析用三个模型算了四种任务形态的费用。

Gemini 4 Argon vs GPT-6 Astra

对比 Astra,Argon 赢下了大多数知识工作和长上下文项目,在法律和金融智能体测试上优势很大:Harvey's 基准 19.6% 对 5.4%,Vals Finance Agent v2 65.4% 对 53.5%[1]。在首发优惠期内,它的价格只有 Astra 标价的五分之一,优惠期后为五分之二[1][2]。

在电脑操作和更难的软件基准上,Astra 是更强的选择。它在 OSWorld-2.0(72.6% 对 69.2%)、FrontierSWE v2(65.5% 对 55.0%)和 Terminal-Bench Science(68.1% 对 57.6%)上领先[1]。FrontierSWE v2 和 Terminal-Bench Science 上 10.5 分的差距,是 Argon 在自家发布表格中最大的失分,因此工作内容与这些基准相似的团队,在切换之前应先做测试。Astra 在 Terminal-bench 4.0 上也以 58.2% 对 57.4% 小幅领先 Argon。

Gemini 4 Argon vs Claude Opus 5.5

在编程上,这是最接近的一组。Argon 在 DeepSWE v1.1(77.9% 对 74.2%)和 Vibe Code Bench(91.9% 对 90.3%)上略胜 Opus 5.5,而 Opus 5.5 在 Terminal-bench 4.0 上领先 9 分(66.4% 对 57.4%),在 PostTrainBench 上领先 4 分(49.3% 对 45.3%)[1]。如果你的智能体主要在 shell 里干活,Opus 5.5 面对这款更新的模型依然不落下风。

编程之外,Argon 拉开了差距。法律基准差 15.8 分,256K 至 1M 的长上下文 GraphWalks 差 17.4 分,LABBench 2 差 15.7 分[1]。Argon 的首发优惠期结束后,两个模型的标价都是每百万 token $4 和 $20[1][3],所以选择取决于工作内容,而不是价格。

不同任务该用哪个模型

  • 法律和金融研究、长文档集、长视频:Gemini 4 Argon,前提是你能用上。这些是它领先最多的地方。
  • 超长的单次输出,比如完整迁移或超过 128K token 的报告:在三个模型中,只有 Gemini 4 Argon 能在一次回答中完成。
  • 以终端为主的编程智能体:Claude Opus 5.5,它在 Terminal-bench 4.0 上明显领先。
  • 电脑操作和最难的 SWE 任务:GPT-6 Astra,它在 OSWorld-2.0 和 FrontierSWE v2 上领先。
  • 本月就要上线的任何东西:Astra 或 Opus 5.5,因为 Gemini 4 Argon 还没有公开 API[1]。

在 reAPI 上,Claude Opus 5.5 和 GPT-6 Astra 都已上线,共用一个 API Key 和一个 Chat Completions 接口。你今天就可以在两者上跑同一套评估,等 Gemini 4 Argon 到来时再加上它。Gemini 4 Argon 模型页会跟踪它的开放进度。

常见问题

Gemini 4 Argon 比 GPT-6 Astra 更强吗?

在谷歌表格的大部分项目上是的:对比 Astra,Argon 在 19 行中有 14 行得分更高,1 行并列。Astra 在 FrontierSWE v2、Terminal-Bench Science、OSWorld-2.0 上领先,并在 Terminal-bench 4.0 上小幅领先[1]。

Gemini 4 Argon 比 Claude Opus 5.5 更强吗?

在谷歌表格中可比的 18 行里,有 14 行是。Opus 5.5 在 Terminal-bench 4.0、PostTrainBench、FrontierSWE v2 和 Terminal-Bench Science 上领先[1]。

Gemini 4 Argon 与 Claude Fable 5.1 相比如何?

在谷歌同时报告两者分数的 17 行中,Argon 有 15 行高于 Fable 5.1。Fable 5.1 在 FrontierSWE v2(56.3% 对 55.0%)和 Terminal-bench 4.0(57.9% 对 57.4%)上略微领先[1]。

Gemini 4 Argon 最好的跑分是哪一项?

最高分是 GraphWalks(最高 128K),为 99.7%。最有意义的胜利是差距大的那几项:Harvey's Legal Agent Benchmark 19.6%,而 Astra 为 5.4%、Opus 5.5 为 3.8%;以及 256K 至 1M 的 GraphWalks 84.2%[1]。

这些跑分是独立测出来的吗?

不完全是。它们来自谷歌的公告;谷歌表示大多数对手的分数由各厂商自行报告,部分 Argon 测试由谷歌自己运行[5]。

Gemini 4 Argon、GPT-6 Astra 和 Claude Opus 5.5 哪个最便宜?

按首发优惠价 $2/$10 计算是 Gemini 4 Argon。之后,Argon 和 Opus 5.5 的标价都是 $4/$20,Astra 是每 1M token $10/$50[1][2][3]。

在 Gemini 4 Argon、Astra 和 Opus 5.5 之间怎么选

谷歌的表格有力地说明,Gemini 4 Argon 是三者中综合能力最强的模型:在法律、金融、长上下文和长视频上领先最多,还有一个其他模型都比不上的 1M token 输出。它也显示出这个论点最薄弱的地方:终端和电脑操作智能体,Opus 5.5 和 Astra 在这些项目上仍然胜出。

有两点让这还不能算最终结论。这些分数来自赢下大部分项目的那个模型的厂商,而 Argon 是这组对比中唯一一个你现在还调用不了的模型。现在就在 Astra 和 Opus 5.5 上搭好评估,等 Gemini 4 Argon 向开发者开放后再跑一遍。

参考资料

  1. Google. Gemini 4 Argon: our next era of frontier intelligence (including benchmark table). 2026 年 10 月检索自 blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon
  2. OpenAI. GPT-6 Astra model page. 2026 年 10 月检索自 developers.openai.com/api/docs/models/gpt-6-astra
  3. Anthropic. Pricing. 2026 年 10 月检索自 platform.claude.com/docs/en/about-claude/pricing
  4. Anthropic. Models overview. 2026 年 10 月检索自 platform.claude.com/docs/en/about-claude/models/overview
  5. Google DeepMind. Gemini 4 Argon model evaluation: approach, methodology and results. 2026 年 10 月检索自 deepmind.google/models/evals-methodology/gemini-4-argon