GPT Image 2.5 is live — OpenAI's newest image model, targeted edits that leave the rest of the frame alone
Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5: benchmarks
2026/10/01

Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5: benchmarks

Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5 en los 18 benchmarks de la tabla de Google, más límites de salida, precios y qué modelo elegir para cada tarea.

Gemini 4 Argon lidera la propia tabla de benchmarks de Google, pero no en todo. En la tabla de 19 filas que Google publicó con el lanzamiento el 30 de septiembre de 2026, Argon tiene la mejor puntuación entre él, GPT-6 Astra y Claude Opus 5.5 en 13 filas, empata en una y pierde cinco: tres frente a Astra y dos frente a Opus 5.5[1]. Las derrotas se concentran en trabajo de terminal, los benchmarks de software más difíciles y el uso del ordenador, que es justo donde muchos desarrolladores lo van a juzgar.

Esta comparativa pone lado a lado todas las cifras de la tabla de Google, añade las especificaciones y los precios que publica cada proveedor y explica los matices de la metodología de Google. Las búsquedas tras el lanzamiento preguntaban lo mismo: "gemini 4 argon benchmarks", "gemini 4 argon performance relative to other models", "gemini 4 vs gpt 6 astra", "gemini 4 vs claude". Hay una diferencia práctica por encima de todas las puntuaciones: Astra y Opus 5.5 están disponibles para el público general, y Argon no[1].

TL;DR

  • En conjunto: entre los tres modelos, Gemini 4 Argon tiene la mejor puntuación en 13 de las 19 filas de la tabla de Google, GPT-6 Astra en 3 y Claude Opus 5.5 en 2, con un empate[1].
  • Las ventajas más claras de Argon: Harvey's Legal Agent Benchmark (19,6 % frente a 5,4 % y 3,8 %), GraphWalks de contexto largo 256K–1M (84,2 % frente a 71,8 % y 66,8 %) y LVBench de video largo (91,7 %)[1].
  • Dónde Argon queda por detrás: Opus 5.5 lidera Terminal-bench 4.0 (66,4 % frente a 57,4 %) y PostTrainBench; Astra lidera FrontierSWE v2, Terminal-Bench Science y OSWorld-2.0[1].
  • Salida: Argon puede devolver 1M tokens en una respuesta. Astra y Opus 5.5 se quedan en 128K en sus API estándar[1][2][4].
  • Precio por 1M tokens: Argon $2/$10 en la tarifa introductoria y después $4/$20; Opus 5.5 $4/$20; Astra $10/$50[1][2][3].

Benchmarks de Gemini 4 Argon: la tabla completa

Estas son las cifras de la tabla de benchmarks del anuncio de Google. La tabla de Google también incluye Claude Fable 5.1, que aparece aquí en su propia columna para que la pregunta "¿y frente a Fable?" también tenga respuesta. La mejor puntuación entre Argon, Astra y Opus 5.5 va en negrita; un guion significa que Google no publicó resultado[1].

ÁreaBenchmarkGemini 4 ArgonGPT-6 AstraClaude Opus 5.5Claude Fable 5.1
Trabajo del conocimientoVals Index68,9 %63,1 %67,0 %65,8 %
Trabajo del conocimientoAutomationBench51,3 %41,4 %42,5 %31,4 %
Trabajo del conocimientoVals Finance Agent v265,4 %53,5 %58,6 %58,9 %
Trabajo del conocimientoHarvey's Legal Agent Benchmark19,6 %5,4 %3,8 %6,7 %
Programación agénticaDeepSWE v1.177,9 %74,1 %74,2 %67,4 %
Programación agénticaFrontierSWE v255,0 %65,5 %62,3 %56,3 %
Programación agénticaVibe Code Bench91,9 %89,6 %90,3 %90,3 %
Programación agénticaTerminal-bench 4.057,4 %58,2 %66,4 %57,9 %
Ingeniería de MLPostTrainBench45,3 %44,3 %49,3 %40,2 %
Ciencia y matemáticasTerminal-Bench Science 0.157,6 %68,1 %63,3 %52,6 %
Ciencia y matemáticasLABBench 288,8 %85,4 %73,1 %68,6 %
Ciencia y matemáticasRiemannBench76,0 %72,0 %69,6 %65,6 %
Contexto largoGraphWalks, hasta 128K99,7 %98,7 %90,6 %91,4 %
Contexto largoGraphWalks, de 256K a 1M84,2 %71,8 %66,8 %65,0 %
Uso del ordenadorAgent's Last Exam39,5 %34,2 %38,2 %—
Uso del ordenadorOSWorld-2.0 (subconjunto offline)69,2 %72,6 %——
MultimodalChartography71,6 %71,0 %66,3 %46,2 %
MultimodalLVBench91,7 %87,5 %83,7 %79,7 %
CiberseguridadCWE-bench v168,0 %68,0 %67,0 %58,0 %

Cara a cara solo con Claude Opus 5.5, Gemini 4 Argon va por delante en 14 de las 18 filas en las que ambos tienen puntuación y por detrás en cuatro: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench y Terminal-Bench Science[1].

Lee la tabla con la metodología de Google en la mano

Todas las puntuaciones de esa tabla proceden del anuncio de Google, y la página de metodología de Google explica de dónde sale cada cifra. Hay tres detalles que cambian cuánto peso merecen las diferencias[5]:

  1. La mayoría de las puntuaciones de los rivales las reporta cada proveedor. Google dice que los resultados de los modelos que no son Gemini "proceden de las cifras reportadas por los propios proveedores, salvo que se indique lo contrario", con el ajuste de razonamiento máximo disponible de cada rival cuando se reporta.
  2. Algunas puntuaciones de Argon las calcula Google. Los resultados de Argon en DeepSWE v1.1 y Terminal-bench 4.0 los ejecutó Google, mientras que las cifras de Astra, Fable y Opus proceden de leaderboards públicos o de system cards. Es una práctica normal, pero significa que el entorno de evaluación no siempre es idéntico.
  3. Las entradas no siempre fueron iguales. En LVBench, Google usó 1 fotograma por segundo para Gemini, pero 800 fotogramas para Astra, 600 para Opus 5.5 y 300 para Fable 5.1 "debido a limitaciones de la API". Los modelos no vieron el mismo presupuesto de fotogramas, así que toma con cautela la diferencia en video largo.

Nada de esto hace que la tabla sea incorrecta. Sí significa que una ventaja de 1 punto, como en Vals Index o CWE-bench, es un empate a efectos prácticos, mientras que diferencias de 12 a 17 puntos, como en Harvey's Legal Agent Benchmark o en GraphWalks de 256K a 1M, son señales reales.

Especificaciones y precio, lado a lado

Los benchmarks son solo la mitad de la decisión. Esto es lo que publica cada proveedor sobre límites y precio.

Gemini 4 ArgonGPT-6 AstraClaude Opus 5.5
DisponibilidadSolo socios del Fairwind Program; desarrolladores "lo antes posible"[1]Disponible para el público general[2]Disponible para el público general[4]
Ventana de contextoNo publicada1.050.000 tokens[2]1M tokens[4]
Salida máxima por respuesta1M tokens[1]128.000 tokens[2]128K (300K con la beta de Batch API)[4]
Tipos de entradaTexto más gráficos, documentos y video largo, según Google[1]Texto, imagen[2]Texto, imagen[4]
Entrada / salida por 1M tokens$2 / $10 en la tarifa introductoria, después $4 / $20[1]$10 / $50, más por encima de 272K de entrada[2]$4 / $20[3]
Entrada en caché por 1M tokens$0.10 durante el periodo introductorio[1]$1[2]$0.20 por acierto de caché[3]

El precio por token y el precio por tarea no son lo mismo; el desglose del precio de Gemini 4 Argon calcula cuatro tipos de tareas en los tres modelos.

Gemini 4 Argon vs GPT-6 Astra

Argon gana a Astra en la mayoría de las filas de trabajo del conocimiento y de contexto largo, y con amplios márgenes en las pruebas de agentes legales y financieros: 19,6 % frente a 5,4 % en el benchmark de Harvey y 65,4 % frente a 53,5 % en Vals Finance Agent v2[1]. Además cuesta una quinta parte del precio de lista de Astra durante el periodo introductorio, y dos quintas partes después[1][2].

Astra es la mejor opción para el uso del ordenador y los benchmarks de software más difíciles. Lidera OSWorld-2.0 (72,6 % frente a 69,2 %), FrontierSWE v2 (65,5 % frente a 55,0 %) y Terminal-Bench Science (68,1 % frente a 57,6 %)[1]. Las diferencias de 10,5 puntos en FrontierSWE v2 y Terminal-Bench Science son las mayores derrotas de Argon en su propia tabla de lanzamiento, así que los equipos cuyo trabajo se parezca a esos benchmarks deberían probar antes de cambiar. Astra también supera por poco a Argon en Terminal-bench 4.0, 58,2 % frente a 57,4 %.

Gemini 4 Argon vs Claude Opus 5.5

Es el emparejamiento más reñido en programación. Argon supera por poco a Opus 5.5 en DeepSWE v1.1 (77,9 % frente a 74,2 %) y Vibe Code Bench (91,9 % frente a 90,3 %), mientras que Opus 5.5 gana Terminal-bench 4.0 por 9 puntos (66,4 % frente a 57,4 %) y PostTrainBench por 4 (49,3 % frente a 45,3 %)[1]. Si tus agentes viven en una shell, Opus 5.5 aguanta bien frente al modelo más nuevo.

Fuera de la programación, Argon se distancia. La diferencia en el benchmark legal es de 15,8 puntos, en GraphWalks de contexto largo de 256K a 1M es de 17,4 puntos y en LABBench 2 es de 15,7 puntos[1]. Cuando termine el periodo introductorio de Argon, los dos modelos tendrán el mismo precio de lista de $4 y $20 por millón de tokens[1][3], así que la elección depende del trabajo, no del precio.

Qué modelo usar para cada tarea

  • Investigación legal y financiera, conjuntos largos de documentos, video largo: Gemini 4 Argon, cuando puedas acceder a él. Son sus ventajas más amplias.
  • Salidas únicas muy largas, como migraciones completas o informes de más de 128K tokens: Gemini 4 Argon es el único de los tres que puede hacerlo en una sola respuesta.
  • Agentes de programación centrados en la terminal: Claude Opus 5.5, que lidera Terminal-bench 4.0 con un margen claro.
  • Uso del ordenador y las tareas de SWE más difíciles: GPT-6 Astra, que lidera OSWorld-2.0 y FrontierSWE v2.
  • Cualquier cosa que necesites lanzar este mes: Astra u Opus 5.5, porque Gemini 4 Argon todavía no tiene API pública[1].

En reAPI, Claude Opus 5.5 y GPT-6 Astra están disponibles con una sola API key y un único endpoint de chat completions, así que puedes ejecutar hoy la misma evaluación en ambos y añadir Gemini 4 Argon cuando llegue. La página del modelo Gemini 4 Argon sigue su disponibilidad.

Preguntas frecuentes

¿Gemini 4 Argon es mejor que GPT-6 Astra?

En la mayor parte de la tabla de Google, sí: Argon tiene la puntuación más alta en 14 de las 19 filas frente a Astra, con un empate. Astra lidera en FrontierSWE v2, Terminal-Bench Science, OSWorld-2.0 y, por poco, Terminal-bench 4.0[1].

¿Gemini 4 Argon es mejor que Claude Opus 5.5?

En 14 de las 18 filas comparables de la tabla de Google. Opus 5.5 lidera en Terminal-bench 4.0, PostTrainBench, FrontierSWE v2 y Terminal-Bench Science[1].

¿Cómo se compara Gemini 4 Argon con Claude Fable 5.1?

Argon puntúa más alto que Fable 5.1 en 15 de las 17 filas en las que Google publica ambos. Fable 5.1 va ligeramente por delante en FrontierSWE v2 (56,3 % frente a 55,0 %) y Terminal-bench 4.0 (57,9 % frente a 57,4 %)[1].

¿Cuál es el mejor resultado de Gemini 4 Argon en benchmarks?

GraphWalks hasta 128K, con un 99,7 %. Las victorias más significativas son las de grandes diferencias: Harvey's Legal Agent Benchmark con un 19,6 % frente al 5,4 % de Astra y el 3,8 % de Opus 5.5, y GraphWalks de 256K a 1M con un 84,2 %[1].

¿Estas puntuaciones de benchmarks son independientes?

No del todo. Proceden del anuncio de Google; Google dice que la mayoría de las puntuaciones de los rivales las reporta cada proveedor, y que algunas pruebas de Argon las ejecutó él mismo[5].

¿Cuál es más barato: Gemini 4 Argon, GPT-6 Astra o Claude Opus 5.5?

Gemini 4 Argon con su tarifa introductoria de $2/$10. Después, Argon y Opus 5.5 cuestan ambos $4/$20, y Astra $10/$50 por 1M tokens[1][2][3].

Cómo elegir entre Gemini 4 Argon, Astra y Opus 5.5

La tabla de Google defiende con fuerza que Gemini 4 Argon es el mejor modelo general de los tres, con las mayores ventajas en legal, finanzas, contexto largo y video largo, y una salida de 1M tokens que nadie más iguala. También muestra dónde el argumento es más débil: agentes de terminal y de uso del ordenador, donde Opus 5.5 y Astra siguen ganando.

Dos matices impiden que esto sea un veredicto final. Las puntuaciones proceden del proveedor del modelo que gana la mayoría, y Argon es el único modelo de la comparativa al que todavía no puedes llamar. Construye tu evaluación sobre Astra y Opus 5.5 ahora, y vuelve a ejecutarla cuando Gemini 4 Argon se abra a los desarrolladores.

Referencias

  1. Google. Gemini 4 Argon: our next era of frontier intelligence (including benchmark table). Consultado en octubre de 2026 en blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon
  2. OpenAI. GPT-6 Astra model page. Consultado en octubre de 2026 en developers.openai.com/api/docs/models/gpt-6-astra
  3. Anthropic. Pricing. Consultado en octubre de 2026 en platform.claude.com/docs/en/about-claude/pricing
  4. Anthropic. Models overview. Consultado en octubre de 2026 en platform.claude.com/docs/en/about-claude/models/overview
  5. Google DeepMind. Gemini 4 Argon model evaluation: approach, methodology and results. Consultado en octubre de 2026 en deepmind.google/models/evals-methodology/gemini-4-argon