
Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5: Benchmarks
Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5 in allen 18 Benchmarks aus Googles Tabelle, dazu Output-Limits, Preise und welches Modell für welche Aufgabe.
Gemini 4 Argon führt Googles eigene Benchmark-Tabelle an, aber nicht überall. In der Tabelle mit 19 Zeilen, die Google zum Launch am 30. September 2026 veröffentlicht hat, erzielt Argon unter sich selbst, GPT-6 Astra und Claude Opus 5.5 in 13 Zeilen den Bestwert, liegt in einer gleichauf und verliert fünf: drei an Astra und zwei an Opus 5.5[1]. Die Niederlagen häufen sich bei Terminal-Arbeit, schwierigeren Software-Benchmarks und Computer Use, also genau dort, wo viele Entwickler das Modell beurteilen werden.
Dieser Vergleich stellt jede Zahl aus Googles Tabelle nebeneinander, ergänzt die Spezifikationen und Preise, die jeder Anbieter veröffentlicht, und erklärt die Vorbehalte in Googles Methodik. Das Suchinteresse nach dem Launch drehte sich um dieselben Fragen: „gemini 4 argon benchmarks“, „gemini 4 argon performance relative to other models“, „gemini 4 vs gpt 6 astra“, „gemini 4 vs claude“. Ein praktischer Unterschied steht über allen Werten: Astra und Opus 5.5 sind allgemein verfügbar, Argon nicht[1].
TL;DR
- Gesamt: Unter den drei Modellen hat Gemini 4 Argon in 13 von 19 Zeilen von Googles Tabelle den besten Wert, GPT-6 Astra in 3, Claude Opus 5.5 in 2, dazu ein Gleichstand[1].
- Argons deutlichste Vorsprünge: Harvey's Legal Agent Benchmark (19,6 % vs. 5,4 % und 3,8 %), Long Context bei GraphWalks 256K–1M (84,2 % vs. 71,8 % und 66,8 %) und LVBench für lange Videos (91,7 %)[1].
- Wo Argon zurückliegt: Opus 5.5 führt bei Terminal-bench 4.0 (66,4 % vs. 57,4 %) und PostTrainBench; Astra führt bei FrontierSWE v2, Terminal-Bench Science und OSWorld-2.0[1].
- Output: Argon kann 1M Tokens in einer Antwort zurückgeben. Astra und Opus 5.5 enden über ihre Standard-APIs bei 128K[1][2][4].
- Preis pro 1M Tokens: Argon $2/$10 zum Einführungspreis, danach $4/$20; Opus 5.5 $4/$20; Astra $10/$50[1][2][3].
Gemini 4 Argon Benchmarks: die vollständige Tabelle
Das sind die Zahlen aus der Benchmark-Tabelle in Googles Ankündigung. Googles Tabelle enthält auch Claude Fable 5.1, hier in einer eigenen Spalte, damit auch die Frage „vs. Fable“ eine Antwort hat. Der beste Wert unter Argon, Astra und Opus 5.5 ist fett; ein Strich bedeutet, dass Google kein Ergebnis gemeldet hat[1].
| Bereich | Benchmark | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | Claude Fable 5.1 |
|---|---|---|---|---|---|
| Wissensarbeit | Vals Index | 68,9 % | 63,1 % | 67,0 % | 65,8 % |
| Wissensarbeit | AutomationBench | 51,3 % | 41,4 % | 42,5 % | 31,4 % |
| Wissensarbeit | Vals Finance Agent v2 | 65,4 % | 53,5 % | 58,6 % | 58,9 % |
| Wissensarbeit | Harvey's Legal Agent Benchmark | 19,6 % | 5,4 % | 3,8 % | 6,7 % |
| Agentisches Coding | DeepSWE v1.1 | 77,9 % | 74,1 % | 74,2 % | 67,4 % |
| Agentisches Coding | FrontierSWE v2 | 55,0 % | 65,5 % | 62,3 % | 56,3 % |
| Agentisches Coding | Vibe Code Bench | 91,9 % | 89,6 % | 90,3 % | 90,3 % |
| Agentisches Coding | Terminal-bench 4.0 | 57,4 % | 58,2 % | 66,4 % | 57,9 % |
| ML Engineering | PostTrainBench | 45,3 % | 44,3 % | 49,3 % | 40,2 % |
| Wissenschaft und Mathematik | Terminal-Bench Science 0.1 | 57,6 % | 68,1 % | 63,3 % | 52,6 % |
| Wissenschaft und Mathematik | LABBench 2 | 88,8 % | 85,4 % | 73,1 % | 68,6 % |
| Wissenschaft und Mathematik | RiemannBench | 76,0 % | 72,0 % | 69,6 % | 65,6 % |
| Long Context | GraphWalks, bis 128K | 99,7 % | 98,7 % | 90,6 % | 91,4 % |
| Long Context | GraphWalks, 256K bis 1M | 84,2 % | 71,8 % | 66,8 % | 65,0 % |
| Computer Use | Agent's Last Exam | 39,5 % | 34,2 % | 38,2 % | — |
| Computer Use | OSWorld-2.0 (Offline-Teilmenge) | 69,2 % | 72,6 % | — | — |
| Multimodal | Chartography | 71,6 % | 71,0 % | 66,3 % | 46,2 % |
| Multimodal | LVBench | 91,7 % | 87,5 % | 83,7 % | 79,7 % |
| Cybersecurity | CWE-bench v1 | 68,0 % | 68,0 % | 67,0 % | 58,0 % |
Im direkten Vergleich nur mit Claude Opus 5.5 liegt Gemini 4 Argon in 14 der 18 Zeilen vorn, in denen beide einen Wert haben, und in vier zurück: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench und Terminal-Bench Science[1].
Die Tabelle mit Googles Methodik lesen
Jeder Wert in dieser Tabelle stammt aus Googles Ankündigung, und Googles Methodikseite erklärt, woher jede Zahl kommt. Drei Details verändern, wie viel Gewicht die Abstände verdienen[5]:
- Die meisten Werte der Konkurrenz sind selbst gemeldet. Laut Google stammen die Ergebnisse für Nicht-Gemini-Modelle „aus den selbst gemeldeten Zahlen der Anbieter, sofern nicht anders angegeben“, jeweils mit der höchsten verfügbaren Reasoning-Einstellung des Konkurrenzmodells, sofern gemeldet.
- Einige Argon-Werte hat Google selbst berechnet. Die Ergebnisse für Argon auf DeepSWE v1.1 und Terminal-bench 4.0 hat Google selbst ermittelt, während die Werte für Astra, Fable und Opus aus öffentlichen Leaderboards oder System Cards stammen. Das ist übliche Praxis, bedeutet aber, dass das Test-Harness nicht immer identisch ist.
- Die Eingaben waren nicht immer gleich. Bei LVBench nutzte Google für Gemini 1 Frame pro Sekunde, für Astra aber 800 Frames, für Opus 5.5 600 und für Fable 5.1 300, „aufgrund von API-Beschränkungen“. Die Modelle hatten nicht dasselbe Frame-Budget, daher solltest du den Abstand bei langen Videos mit Vorsicht betrachten.
Nichts davon macht die Tabelle falsch. Es bedeutet aber, dass ein Vorsprung von 1 Punkt, etwa beim Vals Index oder bei CWE-bench, praktisch ein Gleichstand ist, während Abstände von 12 bis 17 Punkten, wie bei Harvey's Legal Agent Benchmark oder GraphWalks bei 256K bis 1M, echte Signale sind.
Spezifikationen und Preise im Vergleich
Benchmarks sind nur die halbe Entscheidung. Hier steht, was jeder Anbieter zu Limits und Preisen veröffentlicht.
| Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | |
|---|---|---|---|
| Verfügbarkeit | Nur Partner des Fairwind Program; Entwickler „so bald wie möglich“[1] | Allgemein verfügbar[2] | Allgemein verfügbar[4] |
| Kontextfenster | Nicht veröffentlicht | 1.050.000 Tokens[2] | 1M Tokens[4] |
| Max. Output pro Antwort | 1M Tokens[1] | 128.000 Tokens[2] | 128K (300K über Batch API Beta)[4] |
| Input-Typen | Text sowie Charts, Dokumente und lange Videos, laut Google[1] | Text, Bild[2] | Text, Bild[4] |
| Input / Output pro 1M Tokens | $2 / $10 Einführung, danach $4 / $20[1] | $10 / $50, mehr ab 272K Input[2] | $4 / $20[3] |
| Gecachter Input pro 1M Tokens | $0.10 während der Einführung[1] | $1[2] | $0.20 Cache-Hit[3] |
Preis pro Token und Preis pro Aufgabe sind zwei verschiedene Dinge; die Preisübersicht zu Gemini 4 Argon rechnet vier Aufgabentypen für alle drei Modelle durch.
Gemini 4 Argon vs. GPT-6 Astra
Gegen Astra gewinnt Argon die meisten Zeilen zu Wissensarbeit und Long Context, bei den Agent-Tests für Recht und Finanzen mit großem Abstand: 19,6 % vs. 5,4 % bei Harveys Benchmark und 65,4 % vs. 53,5 % bei Vals Finance Agent v2[1]. Während der Einführungsphase kostet es außerdem ein Fünftel von Astras Listenpreis, danach zwei Fünftel[1][2].
Astra ist die stärkere Wahl für Computer Use und schwierigere Software-Benchmarks. Es führt bei OSWorld-2.0 (72,6 % vs. 69,2 %), FrontierSWE v2 (65,5 % vs. 55,0 %) und Terminal-Bench Science (68,1 % vs. 57,6 %)[1]. Die Abstände von 10,5 Punkten bei FrontierSWE v2 und Terminal-Bench Science sind die größten Niederlagen, die Argon in seiner eigenen Launch-Tabelle einsteckt. Teams, deren Arbeit diesen Benchmarks ähnelt, sollten also testen, bevor sie wechseln. Auch bei Terminal-bench 4.0 liegt Astra knapp vor Argon, mit 58,2 % zu 57,4 %.
Gemini 4 Argon vs. Claude Opus 5.5
Beim Coding ist das die engste Paarung. Argon liegt bei DeepSWE v1.1 (77,9 % vs. 74,2 %) und Vibe Code Bench (91,9 % vs. 90,3 %) knapp vor Opus 5.5, während Opus 5.5 Terminal-bench 4.0 mit 9 Punkten (66,4 % vs. 57,4 %) und PostTrainBench mit 4 Punkten (49,3 % vs. 45,3 %) gewinnt[1]. Wenn deine Agents in einer Shell arbeiten, hält Opus 5.5 gut mit dem neueren Modell mit.
Außerhalb des Codings setzt sich Argon ab. Beim Rechts-Benchmark beträgt der Abstand 15,8 Punkte, bei Long Context mit GraphWalks 256K bis 1M 17,4 Punkte und bei LABBench 2 15,7 Punkte[1]. Nach dem Ende von Argons Einführungsphase kosten beide Modelle laut Preisliste dieselben $4 und $20 pro Million Tokens[1][3], die Wahl hängt also von der Arbeit ab, nicht vom Preis.
Welches Modell für welche Aufgabe
- Recherche in Recht und Finanzen, lange Dokumentsammlungen, lange Videos: Gemini 4 Argon, sobald du es bekommst. Hier liegen seine größten Vorsprünge.
- Sehr lange einzelne Outputs, etwa komplette Migrationen oder Berichte über 128K Tokens: Gemini 4 Argon ist das einzige der drei Modelle, das das in einer Antwort kann.
- Terminal-lastige Coding-Agents: Claude Opus 5.5, das Terminal-bench 4.0 mit deutlichem Abstand anführt.
- Computer Use und die schwierigsten SWE-Aufgaben: GPT-6 Astra, das OSWorld-2.0 und FrontierSWE v2 anführt.
- Alles, was du diesen Monat ausliefern musst: Astra oder Opus 5.5, denn Gemini 4 Argon hat noch keine öffentliche API[1].
Auf reAPI sind Claude Opus 5.5 und GPT-6 Astra beide live, hinter einem API-Key und einem Chat-Completions-Endpoint. So kannst du dieselbe Evaluierung heute auf beiden laufen lassen und Gemini 4 Argon ergänzen, sobald es kommt. Die Modellseite zu Gemini 4 Argon verfolgt seine Verfügbarkeit.
FAQ
Ist Gemini 4 Argon besser als GPT-6 Astra?
In den meisten Zeilen von Googles Tabelle ja: Argon hat in 14 von 19 Zeilen gegenüber Astra den höheren Wert, dazu ein Gleichstand. Astra führt bei FrontierSWE v2, Terminal-Bench Science, OSWorld-2.0 und knapp bei Terminal-bench 4.0[1].
Ist Gemini 4 Argon besser als Claude Opus 5.5?
In 14 der 18 vergleichbaren Zeilen von Googles Tabelle. Opus 5.5 führt bei Terminal-bench 4.0, PostTrainBench, FrontierSWE v2 und Terminal-Bench Science[1].
Wie schneidet Gemini 4 Argon im Vergleich zu Claude Fable 5.1 ab?
Argon erzielt in 15 der 17 Zeilen, in denen Google beide Werte meldet, einen höheren Wert als Fable 5.1. Fable 5.1 liegt bei FrontierSWE v2 (56,3 % vs. 55,0 %) und Terminal-bench 4.0 (57,9 % vs. 57,4 %) knapp vorn[1].
Was ist das beste Benchmark-Ergebnis von Gemini 4 Argon?
GraphWalks bis 128K mit 99,7 %. Am aussagekräftigsten sind aber die großen Abstände: Harvey's Legal Agent Benchmark mit 19,6 % gegenüber 5,4 % für Astra und 3,8 % für Opus 5.5 sowie GraphWalks 256K bis 1M mit 84,2 %[1].
Sind diese Benchmark-Werte unabhängig?
Nicht vollständig. Sie stammen aus Googles Ankündigung; laut Google sind die meisten Werte der Konkurrenz von den jeweiligen Anbietern selbst gemeldet, und einige Argon-Tests hat Google selbst durchgeführt[5].
Was ist am günstigsten: Gemini 4 Argon, GPT-6 Astra oder Claude Opus 5.5?
Gemini 4 Argon zum Einführungspreis von $2/$10. Danach kosten Argon und Opus 5.5 laut Preisliste beide $4/$20 und Astra $10/$50 pro 1M Tokens[1][2][3].
Die Wahl zwischen Argon, Astra und Opus 5.5
Googles Tabelle spricht stark für Gemini 4 Argon als bestes Allround-Modell der drei, mit den größten Vorsprüngen bei Recht, Finanzen, Long Context und langen Videos und einem Output von 1M Tokens, den kein anderes erreicht. Sie zeigt aber auch, wo das Argument am schwächsten ist: bei Terminal- und Computer-Use-Agents, wo Opus 5.5 und Astra weiterhin gewinnen.
Zwei Vorbehalte verhindern ein endgültiges Urteil. Die Werte stammen vom Hersteller des Modells, das die meisten davon gewinnt, und Argon ist das einzige Modell im Vergleich, das du noch nicht aufrufen kannst. Bau deine Evaluierung jetzt auf Astra und Opus 5.5 auf und wiederhole sie, sobald Gemini 4 Argon für Entwickler öffnet.
Quellen
- Google. Gemini 4 Argon: our next era of frontier intelligence (including benchmark table). Abgerufen im Oktober 2026 von blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon
- OpenAI. GPT-6 Astra model page. Abgerufen im Oktober 2026 von developers.openai.com/api/docs/models/gpt-6-astra
- Anthropic. Pricing. Abgerufen im Oktober 2026 von platform.claude.com/docs/en/about-claude/pricing
- Anthropic. Models overview. Abgerufen im Oktober 2026 von platform.claude.com/docs/en/about-claude/models/overview
- Google DeepMind. Gemini 4 Argon model evaluation: approach, methodology and results. Abgerufen im Oktober 2026 von deepmind.google/models/evals-methodology/gemini-4-argon
Autor

Kategorien
Weitere Beiträge

AI-Videokontinuität über mehrere Clips hinweg bewahren
Lerne, KI-Videos über mehrere Clips mit Zustandsregister, Grenzrahmen, Fortsetzungsprompts, API-Aufrufen, Prüfungen und Reparaturregeln zu erweitern.


Seedream 5.0 Pro gegen GPT Image 2: 4K, Masken und API
Seedream 5.0 Pro vs GPT Image 2 vergleichen: Referenzen, Masken, transparente Hintergründe, Auflösung, Batches, API-Kontrolle und aktuelle Preise auf reAPI.


Open-Source-Videoaufscaler: video2x und Real-ESRGAN einrichten
Anleitung zu Open-Source-Videoaufscalern: video2x vs Real-ESRGAN, Vulkan-GPU-Unterstützung, Anime-Modelle, Low-VRAM-Tiling und kommerzielle Lizenzen.
