
Gemini 4 Argon vs GPT-6 Astra vs Opus 5.5 : benchmarks
Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5 sur les 18 benchmarks du tableau de Google, plus limites de sortie, prix et quel modèle choisir selon la tâche.
Gemini 4 Argon domine le tableau de benchmarks de Google lui-même, mais pas partout. Dans le tableau de 19 lignes publié par Google au lancement, le 30 septembre 2026, Argon obtient le meilleur score entre lui, GPT-6 Astra et Claude Opus 5.5 sur 13 lignes, fait jeu égal sur une, et en perd cinq : trois face à Astra et deux face à Opus 5.5[1]. Les défaites se concentrent sur le travail en terminal, les benchmarks logiciels les plus durs et l'usage de l'ordinateur, c'est-à-dire exactement là où beaucoup de développeurs vont le juger.
Ce comparatif met côte à côte chaque chiffre du tableau de Google, ajoute les spécifications et les prix publiés par chaque fournisseur, et explique les réserves de la méthodologie de Google. Les recherches après le lancement posaient les mêmes questions : « gemini 4 argon benchmarks », « gemini 4 argon performance relative to other models », « gemini 4 vs gpt 6 astra », « gemini 4 vs claude ». Une différence pratique passe avant tous les scores : Astra et Opus 5.5 sont disponibles pour tous, Argon ne l'est pas[1].
En bref
- Bilan global : entre les trois modèles, Gemini 4 Argon a le meilleur score sur 13 des 19 lignes du tableau de Google, GPT-6 Astra sur 3, Claude Opus 5.5 sur 2, avec une égalité[1].
- Les avances les plus nettes d'Argon : Harvey's Legal Agent Benchmark (19,6 % contre 5,4 % et 3,8 %), GraphWalks en contexte long 256K–1M (84,2 % contre 71,8 % et 66,8 %) et LVBench en vidéo longue (91,7 %)[1].
- Là où Argon est derrière : Opus 5.5 mène sur Terminal-bench 4.0 (66,4 % contre 57,4 %) et PostTrainBench ; Astra mène sur FrontierSWE v2, Terminal-Bench Science et OSWorld-2.0[1].
- Sortie : Argon peut renvoyer 1M tokens en une réponse. Astra et Opus 5.5 s'arrêtent à 128K sur leurs API standard[1][2][4].
- Prix par million de tokens : Argon $2/$10 au lancement, puis $4/$20 ; Opus 5.5 $4/$20 ; Astra $10/$50[1][2][3].
Benchmarks de Gemini 4 Argon : le tableau complet
Voici les chiffres du tableau de benchmarks de l'annonce de Google. Le tableau de Google inclut aussi Claude Fable 5.1, présenté ici dans sa propre colonne pour que la question « vs Fable » ait aussi sa réponse. Le meilleur score entre Argon, Astra et Opus 5.5 est en gras ; un tiret signifie que Google n'a publié aucun résultat[1].
| Domaine | Benchmark | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | Claude Fable 5.1 |
|---|---|---|---|---|---|
| Travail de connaissance | Vals Index | 68,9 % | 63,1 % | 67,0 % | 65,8 % |
| Travail de connaissance | AutomationBench | 51,3 % | 41,4 % | 42,5 % | 31,4 % |
| Travail de connaissance | Vals Finance Agent v2 | 65,4 % | 53,5 % | 58,6 % | 58,9 % |
| Travail de connaissance | Harvey's Legal Agent Benchmark | 19,6 % | 5,4 % | 3,8 % | 6,7 % |
| Code agentique | DeepSWE v1.1 | 77,9 % | 74,1 % | 74,2 % | 67,4 % |
| Code agentique | FrontierSWE v2 | 55,0 % | 65,5 % | 62,3 % | 56,3 % |
| Code agentique | Vibe Code Bench | 91,9 % | 89,6 % | 90,3 % | 90,3 % |
| Code agentique | Terminal-bench 4.0 | 57,4 % | 58,2 % | 66,4 % | 57,9 % |
| Ingénierie ML | PostTrainBench | 45,3 % | 44,3 % | 49,3 % | 40,2 % |
| Sciences et maths | Terminal-Bench Science 0.1 | 57,6 % | 68,1 % | 63,3 % | 52,6 % |
| Sciences et maths | LABBench 2 | 88,8 % | 85,4 % | 73,1 % | 68,6 % |
| Sciences et maths | RiemannBench | 76,0 % | 72,0 % | 69,6 % | 65,6 % |
| Contexte long | GraphWalks, jusqu'à 128K | 99,7 % | 98,7 % | 90,6 % | 91,4 % |
| Contexte long | GraphWalks, de 256K à 1M | 84,2 % | 71,8 % | 66,8 % | 65,0 % |
| Usage de l'ordinateur | Agent's Last Exam | 39,5 % | 34,2 % | 38,2 % | — |
| Usage de l'ordinateur | OSWorld-2.0 (sous-ensemble hors ligne) | 69,2 % | 72,6 % | — | — |
| Multimodal | Chartography | 71,6 % | 71,0 % | 66,3 % | 46,2 % |
| Multimodal | LVBench | 91,7 % | 87,5 % | 83,7 % | 79,7 % |
| Cybersécurité | CWE-bench v1 | 68,0 % | 68,0 % | 67,0 % | 58,0 % |
En face-à-face avec Claude Opus 5.5 seul, Gemini 4 Argon est devant sur 14 des 18 lignes où les deux ont un score, et derrière sur quatre : FrontierSWE v2, Terminal-bench 4.0, PostTrainBench et Terminal-Bench Science[1].
Lire le tableau avec la méthodologie de Google
Chaque score de ce tableau provient de l'annonce de Google, et la page méthodologie de Google explique d'où vient chaque chiffre. Trois détails changent le poids à accorder aux écarts[5] :
- La plupart des scores concurrents sont autodéclarés. Google indique que les résultats des modèles non Gemini sont « issus des chiffres autodéclarés des fournisseurs, sauf mention contraire », avec le réglage de raisonnement maximal disponible de chaque concurrent lorsqu'il est publié.
- Certains scores d'Argon sont calculés par Google. Les résultats DeepSWE v1.1 et Terminal-bench 4.0 d'Argon ont été obtenus par Google, tandis que les chiffres d'Astra, Fable et Opus viennent de classements publics ou de system cards. C'est une pratique normale, mais le harnais de test n'est pas toujours identique.
- Les entrées n'étaient pas toujours égales. Sur LVBench, Google a utilisé 1 image par seconde pour Gemini, mais 800 images pour Astra, 600 pour Opus 5.5 et 300 pour Fable 5.1 « en raison de limitations de l'API ». Les modèles n'ont pas vu le même budget d'images, donc prends l'écart en vidéo longue avec prudence.
Rien de tout cela ne rend le tableau faux. Mais une avance d'un point, comme sur Vals Index ou CWE-bench, est en pratique une égalité, alors que des écarts de 12 à 17 points, comme sur Harvey's Legal Agent Benchmark ou GraphWalks de 256K à 1M, sont de vrais signaux.
Spécifications et prix côte à côte
Les benchmarks ne font que la moitié de la décision. Voici ce que chaque fournisseur publie sur les limites et le prix.
| Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | |
|---|---|---|---|
| Disponibilité | Partenaires du Fairwind Program uniquement ; développeurs « dès que possible »[1] | Disponible pour tous[2] | Disponible pour tous[4] |
| Fenêtre de contexte | Non publiée | 1 050 000 tokens[2] | 1M tokens[4] |
| Sortie max par réponse | 1M tokens[1] | 128 000 tokens[2] | 128K (300K via la Batch API en bêta)[4] |
| Types d'entrée | Texte plus graphiques, documents et vidéos longues, selon Google[1] | Texte, image[2] | Texte, image[4] |
| Entrée / sortie par million de tokens | $2 / $10 au lancement, puis $4 / $20[1] | $10 / $50, plus au-delà de 272K en entrée[2] | $4 / $20[3] |
| Entrée en cache par million de tokens | $0.10 pendant le lancement[1] | $1[2] | $0.20 en cache hit[3] |
Prix par token et prix par tâche sont deux choses différentes ; l'analyse des prix de Gemini 4 Argon calcule quatre formes de tâches sur les trois modèles.
Gemini 4 Argon vs GPT-6 Astra
Argon remporte la plupart des lignes travail de connaissance et contexte long face à Astra, et avec de larges marges sur les tests d'agents juridiques et financiers : 19,6 % contre 5,4 % sur le benchmark de Harvey et 65,4 % contre 53,5 % sur Vals Finance Agent v2[1]. Il coûte aussi un cinquième du prix catalogue d'Astra pendant la période de lancement, et deux cinquièmes ensuite[1][2].
Astra est le meilleur choix pour l'usage de l'ordinateur et les benchmarks logiciels les plus durs. Il mène sur OSWorld-2.0 (72,6 % contre 69,2 %), FrontierSWE v2 (65,5 % contre 55,0 %) et Terminal-Bench Science (68,1 % contre 57,6 %)[1]. Les écarts de 10,5 points sur FrontierSWE v2 et Terminal-Bench Science sont les plus grosses défaites d'Argon dans son propre tableau de lancement, donc les équipes dont le travail ressemble à ces benchmarks devraient tester avant de basculer. Astra devance aussi légèrement Argon sur Terminal-bench 4.0, 58,2 % contre 57,4 %.
Gemini 4 Argon vs Claude Opus 5.5
C'est le duel le plus serré sur le code. Argon devance de peu Opus 5.5 sur DeepSWE v1.1 (77,9 % contre 74,2 %) et Vibe Code Bench (91,9 % contre 90,3 %), tandis qu'Opus 5.5 gagne Terminal-bench 4.0 de 9 points (66,4 % contre 57,4 %) et PostTrainBench de 4 (49,3 % contre 45,3 %)[1]. Si tes agents vivent dans un shell, Opus 5.5 tient bien la comparaison avec le modèle plus récent.
Hors code, Argon prend le large. L'écart sur le benchmark juridique est de 15,8 points, celui de GraphWalks en contexte long de 256K à 1M de 17,4 points, et celui de LABBench 2 de 15,7 points[1]. Une fois la période de lancement d'Argon terminée, les deux modèles sont affichés au même prix de $4 et $20 par million de tokens[1][3], donc le choix se fait sur le travail, pas sur le prix.
Quel modèle pour quelle tâche
- Recherche juridique et financière, longs ensembles de documents, vidéo longue : Gemini 4 Argon, dès que tu peux y accéder. Ce sont ses plus larges avances.
- Très longues sorties uniques, comme des migrations complètes ou des rapports au-delà de 128K tokens : Gemini 4 Argon est le seul des trois à pouvoir le faire en une réponse.
- Agents de code centrés sur le terminal : Claude Opus 5.5, qui mène nettement sur Terminal-bench 4.0.
- Usage de l'ordinateur et tâches SWE les plus difficiles : GPT-6 Astra, qui mène sur OSWorld-2.0 et FrontierSWE v2.
- Tout ce que tu dois livrer ce mois-ci : Astra ou Opus 5.5, car Gemini 4 Argon n'a pas encore d'API publique[1].
Sur reAPI, Claude Opus 5.5 et GPT-6 Astra sont tous deux disponibles derrière une seule clé API et un seul endpoint chat completions : tu peux donc lancer la même évaluation sur les deux dès aujourd'hui et ajouter Gemini 4 Argon à son arrivée. La page modèle Gemini 4 Argon suit sa disponibilité.
FAQ
Gemini 4 Argon est-il meilleur que GPT-6 Astra ?
Sur la majeure partie du tableau de Google, oui : Argon a le meilleur score sur 14 des 19 lignes face à Astra, avec une égalité. Astra mène sur FrontierSWE v2, Terminal-Bench Science, OSWorld-2.0 et, de peu, Terminal-bench 4.0[1].
Gemini 4 Argon est-il meilleur que Claude Opus 5.5 ?
Sur 14 des 18 lignes comparables du tableau de Google. Opus 5.5 mène sur Terminal-bench 4.0, PostTrainBench, FrontierSWE v2 et Terminal-Bench Science[1].
Comment Gemini 4 Argon se compare-t-il à Claude Fable 5.1 ?
Argon obtient un meilleur score que Fable 5.1 sur 15 des 17 lignes où Google publie les deux. Fable 5.1 est légèrement devant sur FrontierSWE v2 (56,3 % contre 55,0 %) et Terminal-bench 4.0 (57,9 % contre 57,4 %)[1].
Quel est le meilleur résultat de Gemini 4 Argon aux benchmarks ?
GraphWalks jusqu'à 128K, avec 99,7 %. Les victoires les plus parlantes sont les gros écarts : Harvey's Legal Agent Benchmark avec 19,6 % contre 5,4 % pour Astra et 3,8 % pour Opus 5.5, et GraphWalks de 256K à 1M avec 84,2 %[1].
Ces scores de benchmarks sont-ils indépendants ?
Pas entièrement. Ils viennent de l'annonce de Google ; Google indique que la plupart des scores concurrents sont autodéclarés par chaque fournisseur, et qu'il a lui-même mené certains tests d'Argon[5].
Lequel est le moins cher : Gemini 4 Argon, GPT-6 Astra ou Claude Opus 5.5 ?
Gemini 4 Argon à son tarif de lancement de $2/$10. Ensuite, Argon et Opus 5.5 sont tous deux affichés à $4/$20, et Astra à $10/$50 par million de tokens[1][2][3].
Choisir entre Argon, Astra et Opus 5.5
Le tableau de Google plaide fortement pour Gemini 4 Argon comme meilleur modèle généraliste des trois, avec les plus grosses avances en juridique, en finance, en contexte long et en vidéo longue, et une sortie de 1M tokens qu'aucun autre n'égale. Il montre aussi où l'argument est le plus faible : les agents en terminal et en usage de l'ordinateur, où Opus 5.5 et Astra gagnent encore.
Deux réserves empêchent d'en faire un verdict définitif. Les scores viennent de l'éditeur du modèle qui remporte la plupart d'entre eux, et Argon est le seul modèle du comparatif que tu ne peux pas encore appeler. Construis ton évaluation sur Astra et Opus 5.5 dès maintenant, et relance-la quand Gemini 4 Argon ouvrira aux développeurs.
Références
- Google. Gemini 4 Argon: our next era of frontier intelligence (including benchmark table). Consulté en octobre 2026 sur blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon
- OpenAI. GPT-6 Astra model page. Consulté en octobre 2026 sur developers.openai.com/api/docs/models/gpt-6-astra
- Anthropic. Pricing. Consulté en octobre 2026 sur platform.claude.com/docs/en/about-claude/pricing
- Anthropic. Models overview. Consulté en octobre 2026 sur platform.claude.com/docs/en/about-claude/models/overview
- Google DeepMind. Gemini 4 Argon model evaluation: approach, methodology and results. Consulté en octobre 2026 sur deepmind.google/models/evals-methodology/gemini-4-argon
Auteur

Catégories
Plus d'articles

Transformer une photo en publicité vidéo IA multi-scènes
Workflow pour convertir une photo produit en publicité vidéo IA : résumé créatif, fiches de plans, règles de référence, invites, exemples d'API et qualité.


Exécuter un LLM 70B sur GPU 4GB : guide honnête AirLLM
Un LLM 70B peut tourner sur un GPU 4GB ? Découvrez comment AirLLM diffuse les couches depuis le disque, quel matériel il faut et pourquoi c'est lent.


Prix de l’API Suno : opérations et budget mensuel détaillé
Consultez les prix des 18 opérations asynchrones de Suno API, les crédits débités, les deux prises, les tarifs V6 et le budget mensuel par chanson retenue.
