GPT Image 2.5 is live — OpenAI's newest image model, targeted edits that leave the rest of the frame alone
Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5: Benchmarks
2026/10/01

Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5: Benchmarks

Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5 in allen 18 Benchmarks aus Googles Tabelle, dazu Output-Limits, Preise und welches Modell für welche Aufgabe.

Gemini 4 Argon führt Googles eigene Benchmark-Tabelle an, aber nicht überall. In der Tabelle mit 19 Zeilen, die Google zum Launch am 30. September 2026 veröffentlicht hat, erzielt Argon unter sich selbst, GPT-6 Astra und Claude Opus 5.5 in 13 Zeilen den Bestwert, liegt in einer gleichauf und verliert fünf: drei an Astra und zwei an Opus 5.5[1]. Die Niederlagen häufen sich bei Terminal-Arbeit, schwierigeren Software-Benchmarks und Computer Use, also genau dort, wo viele Entwickler das Modell beurteilen werden.

Dieser Vergleich stellt jede Zahl aus Googles Tabelle nebeneinander, ergänzt die Spezifikationen und Preise, die jeder Anbieter veröffentlicht, und erklärt die Vorbehalte in Googles Methodik. Das Suchinteresse nach dem Launch drehte sich um dieselben Fragen: „gemini 4 argon benchmarks“, „gemini 4 argon performance relative to other models“, „gemini 4 vs gpt 6 astra“, „gemini 4 vs claude“. Ein praktischer Unterschied steht über allen Werten: Astra und Opus 5.5 sind allgemein verfügbar, Argon nicht[1].

TL;DR

  • Gesamt: Unter den drei Modellen hat Gemini 4 Argon in 13 von 19 Zeilen von Googles Tabelle den besten Wert, GPT-6 Astra in 3, Claude Opus 5.5 in 2, dazu ein Gleichstand[1].
  • Argons deutlichste Vorsprünge: Harvey's Legal Agent Benchmark (19,6 % vs. 5,4 % und 3,8 %), Long Context bei GraphWalks 256K–1M (84,2 % vs. 71,8 % und 66,8 %) und LVBench für lange Videos (91,7 %)[1].
  • Wo Argon zurückliegt: Opus 5.5 führt bei Terminal-bench 4.0 (66,4 % vs. 57,4 %) und PostTrainBench; Astra führt bei FrontierSWE v2, Terminal-Bench Science und OSWorld-2.0[1].
  • Output: Argon kann 1M Tokens in einer Antwort zurückgeben. Astra und Opus 5.5 enden über ihre Standard-APIs bei 128K[1][2][4].
  • Preis pro 1M Tokens: Argon $2/$10 zum Einführungspreis, danach $4/$20; Opus 5.5 $4/$20; Astra $10/$50[1][2][3].

Gemini 4 Argon Benchmarks: die vollständige Tabelle

Das sind die Zahlen aus der Benchmark-Tabelle in Googles Ankündigung. Googles Tabelle enthält auch Claude Fable 5.1, hier in einer eigenen Spalte, damit auch die Frage „vs. Fable“ eine Antwort hat. Der beste Wert unter Argon, Astra und Opus 5.5 ist fett; ein Strich bedeutet, dass Google kein Ergebnis gemeldet hat[1].

BereichBenchmarkGemini 4 ArgonGPT-6 AstraClaude Opus 5.5Claude Fable 5.1
WissensarbeitVals Index68,9 %63,1 %67,0 %65,8 %
WissensarbeitAutomationBench51,3 %41,4 %42,5 %31,4 %
WissensarbeitVals Finance Agent v265,4 %53,5 %58,6 %58,9 %
WissensarbeitHarvey's Legal Agent Benchmark19,6 %5,4 %3,8 %6,7 %
Agentisches CodingDeepSWE v1.177,9 %74,1 %74,2 %67,4 %
Agentisches CodingFrontierSWE v255,0 %65,5 %62,3 %56,3 %
Agentisches CodingVibe Code Bench91,9 %89,6 %90,3 %90,3 %
Agentisches CodingTerminal-bench 4.057,4 %58,2 %66,4 %57,9 %
ML EngineeringPostTrainBench45,3 %44,3 %49,3 %40,2 %
Wissenschaft und MathematikTerminal-Bench Science 0.157,6 %68,1 %63,3 %52,6 %
Wissenschaft und MathematikLABBench 288,8 %85,4 %73,1 %68,6 %
Wissenschaft und MathematikRiemannBench76,0 %72,0 %69,6 %65,6 %
Long ContextGraphWalks, bis 128K99,7 %98,7 %90,6 %91,4 %
Long ContextGraphWalks, 256K bis 1M84,2 %71,8 %66,8 %65,0 %
Computer UseAgent's Last Exam39,5 %34,2 %38,2 %—
Computer UseOSWorld-2.0 (Offline-Teilmenge)69,2 %72,6 %——
MultimodalChartography71,6 %71,0 %66,3 %46,2 %
MultimodalLVBench91,7 %87,5 %83,7 %79,7 %
CybersecurityCWE-bench v168,0 %68,0 %67,0 %58,0 %

Im direkten Vergleich nur mit Claude Opus 5.5 liegt Gemini 4 Argon in 14 der 18 Zeilen vorn, in denen beide einen Wert haben, und in vier zurück: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench und Terminal-Bench Science[1].

Die Tabelle mit Googles Methodik lesen

Jeder Wert in dieser Tabelle stammt aus Googles Ankündigung, und Googles Methodikseite erklärt, woher jede Zahl kommt. Drei Details verändern, wie viel Gewicht die Abstände verdienen[5]:

  1. Die meisten Werte der Konkurrenz sind selbst gemeldet. Laut Google stammen die Ergebnisse für Nicht-Gemini-Modelle „aus den selbst gemeldeten Zahlen der Anbieter, sofern nicht anders angegeben“, jeweils mit der höchsten verfügbaren Reasoning-Einstellung des Konkurrenzmodells, sofern gemeldet.
  2. Einige Argon-Werte hat Google selbst berechnet. Die Ergebnisse für Argon auf DeepSWE v1.1 und Terminal-bench 4.0 hat Google selbst ermittelt, während die Werte für Astra, Fable und Opus aus öffentlichen Leaderboards oder System Cards stammen. Das ist übliche Praxis, bedeutet aber, dass das Test-Harness nicht immer identisch ist.
  3. Die Eingaben waren nicht immer gleich. Bei LVBench nutzte Google für Gemini 1 Frame pro Sekunde, für Astra aber 800 Frames, für Opus 5.5 600 und für Fable 5.1 300, „aufgrund von API-Beschränkungen“. Die Modelle hatten nicht dasselbe Frame-Budget, daher solltest du den Abstand bei langen Videos mit Vorsicht betrachten.

Nichts davon macht die Tabelle falsch. Es bedeutet aber, dass ein Vorsprung von 1 Punkt, etwa beim Vals Index oder bei CWE-bench, praktisch ein Gleichstand ist, während Abstände von 12 bis 17 Punkten, wie bei Harvey's Legal Agent Benchmark oder GraphWalks bei 256K bis 1M, echte Signale sind.

Spezifikationen und Preise im Vergleich

Benchmarks sind nur die halbe Entscheidung. Hier steht, was jeder Anbieter zu Limits und Preisen veröffentlicht.

Gemini 4 ArgonGPT-6 AstraClaude Opus 5.5
VerfügbarkeitNur Partner des Fairwind Program; Entwickler „so bald wie möglich“[1]Allgemein verfügbar[2]Allgemein verfügbar[4]
KontextfensterNicht veröffentlicht1.050.000 Tokens[2]1M Tokens[4]
Max. Output pro Antwort1M Tokens[1]128.000 Tokens[2]128K (300K über Batch API Beta)[4]
Input-TypenText sowie Charts, Dokumente und lange Videos, laut Google[1]Text, Bild[2]Text, Bild[4]
Input / Output pro 1M Tokens$2 / $10 Einführung, danach $4 / $20[1]$10 / $50, mehr ab 272K Input[2]$4 / $20[3]
Gecachter Input pro 1M Tokens$0.10 während der Einführung[1]$1[2]$0.20 Cache-Hit[3]

Preis pro Token und Preis pro Aufgabe sind zwei verschiedene Dinge; die Preisübersicht zu Gemini 4 Argon rechnet vier Aufgabentypen für alle drei Modelle durch.

Gemini 4 Argon vs. GPT-6 Astra

Gegen Astra gewinnt Argon die meisten Zeilen zu Wissensarbeit und Long Context, bei den Agent-Tests für Recht und Finanzen mit großem Abstand: 19,6 % vs. 5,4 % bei Harveys Benchmark und 65,4 % vs. 53,5 % bei Vals Finance Agent v2[1]. Während der Einführungsphase kostet es außerdem ein Fünftel von Astras Listenpreis, danach zwei Fünftel[1][2].

Astra ist die stärkere Wahl für Computer Use und schwierigere Software-Benchmarks. Es führt bei OSWorld-2.0 (72,6 % vs. 69,2 %), FrontierSWE v2 (65,5 % vs. 55,0 %) und Terminal-Bench Science (68,1 % vs. 57,6 %)[1]. Die Abstände von 10,5 Punkten bei FrontierSWE v2 und Terminal-Bench Science sind die größten Niederlagen, die Argon in seiner eigenen Launch-Tabelle einsteckt. Teams, deren Arbeit diesen Benchmarks ähnelt, sollten also testen, bevor sie wechseln. Auch bei Terminal-bench 4.0 liegt Astra knapp vor Argon, mit 58,2 % zu 57,4 %.

Gemini 4 Argon vs. Claude Opus 5.5

Beim Coding ist das die engste Paarung. Argon liegt bei DeepSWE v1.1 (77,9 % vs. 74,2 %) und Vibe Code Bench (91,9 % vs. 90,3 %) knapp vor Opus 5.5, während Opus 5.5 Terminal-bench 4.0 mit 9 Punkten (66,4 % vs. 57,4 %) und PostTrainBench mit 4 Punkten (49,3 % vs. 45,3 %) gewinnt[1]. Wenn deine Agents in einer Shell arbeiten, hält Opus 5.5 gut mit dem neueren Modell mit.

Außerhalb des Codings setzt sich Argon ab. Beim Rechts-Benchmark beträgt der Abstand 15,8 Punkte, bei Long Context mit GraphWalks 256K bis 1M 17,4 Punkte und bei LABBench 2 15,7 Punkte[1]. Nach dem Ende von Argons Einführungsphase kosten beide Modelle laut Preisliste dieselben $4 und $20 pro Million Tokens[1][3], die Wahl hängt also von der Arbeit ab, nicht vom Preis.

Welches Modell für welche Aufgabe

  • Recherche in Recht und Finanzen, lange Dokumentsammlungen, lange Videos: Gemini 4 Argon, sobald du es bekommst. Hier liegen seine größten Vorsprünge.
  • Sehr lange einzelne Outputs, etwa komplette Migrationen oder Berichte über 128K Tokens: Gemini 4 Argon ist das einzige der drei Modelle, das das in einer Antwort kann.
  • Terminal-lastige Coding-Agents: Claude Opus 5.5, das Terminal-bench 4.0 mit deutlichem Abstand anführt.
  • Computer Use und die schwierigsten SWE-Aufgaben: GPT-6 Astra, das OSWorld-2.0 und FrontierSWE v2 anführt.
  • Alles, was du diesen Monat ausliefern musst: Astra oder Opus 5.5, denn Gemini 4 Argon hat noch keine öffentliche API[1].

Auf reAPI sind Claude Opus 5.5 und GPT-6 Astra beide live, hinter einem API-Key und einem Chat-Completions-Endpoint. So kannst du dieselbe Evaluierung heute auf beiden laufen lassen und Gemini 4 Argon ergänzen, sobald es kommt. Die Modellseite zu Gemini 4 Argon verfolgt seine Verfügbarkeit.

FAQ

Ist Gemini 4 Argon besser als GPT-6 Astra?

In den meisten Zeilen von Googles Tabelle ja: Argon hat in 14 von 19 Zeilen gegenüber Astra den höheren Wert, dazu ein Gleichstand. Astra führt bei FrontierSWE v2, Terminal-Bench Science, OSWorld-2.0 und knapp bei Terminal-bench 4.0[1].

Ist Gemini 4 Argon besser als Claude Opus 5.5?

In 14 der 18 vergleichbaren Zeilen von Googles Tabelle. Opus 5.5 führt bei Terminal-bench 4.0, PostTrainBench, FrontierSWE v2 und Terminal-Bench Science[1].

Wie schneidet Gemini 4 Argon im Vergleich zu Claude Fable 5.1 ab?

Argon erzielt in 15 der 17 Zeilen, in denen Google beide Werte meldet, einen höheren Wert als Fable 5.1. Fable 5.1 liegt bei FrontierSWE v2 (56,3 % vs. 55,0 %) und Terminal-bench 4.0 (57,9 % vs. 57,4 %) knapp vorn[1].

Was ist das beste Benchmark-Ergebnis von Gemini 4 Argon?

GraphWalks bis 128K mit 99,7 %. Am aussagekräftigsten sind aber die großen Abstände: Harvey's Legal Agent Benchmark mit 19,6 % gegenüber 5,4 % für Astra und 3,8 % für Opus 5.5 sowie GraphWalks 256K bis 1M mit 84,2 %[1].

Sind diese Benchmark-Werte unabhängig?

Nicht vollständig. Sie stammen aus Googles Ankündigung; laut Google sind die meisten Werte der Konkurrenz von den jeweiligen Anbietern selbst gemeldet, und einige Argon-Tests hat Google selbst durchgeführt[5].

Was ist am günstigsten: Gemini 4 Argon, GPT-6 Astra oder Claude Opus 5.5?

Gemini 4 Argon zum Einführungspreis von $2/$10. Danach kosten Argon und Opus 5.5 laut Preisliste beide $4/$20 und Astra $10/$50 pro 1M Tokens[1][2][3].

Die Wahl zwischen Argon, Astra und Opus 5.5

Googles Tabelle spricht stark für Gemini 4 Argon als bestes Allround-Modell der drei, mit den größten Vorsprüngen bei Recht, Finanzen, Long Context und langen Videos und einem Output von 1M Tokens, den kein anderes erreicht. Sie zeigt aber auch, wo das Argument am schwächsten ist: bei Terminal- und Computer-Use-Agents, wo Opus 5.5 und Astra weiterhin gewinnen.

Zwei Vorbehalte verhindern ein endgültiges Urteil. Die Werte stammen vom Hersteller des Modells, das die meisten davon gewinnt, und Argon ist das einzige Modell im Vergleich, das du noch nicht aufrufen kannst. Bau deine Evaluierung jetzt auf Astra und Opus 5.5 auf und wiederhole sie, sobald Gemini 4 Argon für Entwickler öffnet.

Quellen

  1. Google. Gemini 4 Argon: our next era of frontier intelligence (including benchmark table). Abgerufen im Oktober 2026 von blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon
  2. OpenAI. GPT-6 Astra model page. Abgerufen im Oktober 2026 von developers.openai.com/api/docs/models/gpt-6-astra
  3. Anthropic. Pricing. Abgerufen im Oktober 2026 von platform.claude.com/docs/en/about-claude/pricing
  4. Anthropic. Models overview. Abgerufen im Oktober 2026 von platform.claude.com/docs/en/about-claude/models/overview
  5. Google DeepMind. Gemini 4 Argon model evaluation: approach, methodology and results. Abgerufen im Oktober 2026 von deepmind.google/models/evals-methodology/gemini-4-argon