Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Cómo usar Gemini 3.6 Flash: velocidad, precio y limitaciones
2026/07/27

Cómo usar Gemini 3.6 Flash: velocidad, precio y limitaciones

Cómo usar Gemini 3.6 Flash: benchmarks oficiales, dónde pierde frente a GPT-5.6 Luna y Sonnet 5, cuatro cambios API y los modelos Flash-Lite y Cyber.

El 21 de julio de 2026, Google lanzó tres modelos Gemini en un mismo anuncio: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite y un especialista en seguridad restringido llamado Gemini 3.5 Flash Cyber[1]. Sin modelo Pro, sin evento de presentación, sin reclamos de una nueva frontera de inteligencia. El anuncio completo argumenta una sola cosa: los equipos que ejecutan agentes en producción necesitan menos tokens y menor latencia por tarea, no un modelo más grande.

Esa orientación te dice para quién es. Aprender a usar bien Gemini 3.6 Flash se trata principalmente de la matemática compuesta, porque Google redujo el precio de salida y el modelo también emite menos tokens para hacer el mismo trabajo. Esos dos efectos se multiplican. Esta guía cubre los datos de benchmarks oficiales, dónde 3.6 Flash honestamente pierde frente a GPT-5.6 Luna y Claude Sonnet 5, los cuatro cambios API que rompen código anterior, y cuál de los tres modelos se ajusta realmente a tu carga de trabajo.

TL;DR: la serie Gemini Flash de julio de 2026

ModeloPrecio de lista por 1M tokensPosicionamiento
Gemini 3.6 Flash$1.50 entrada / $7.50 salidaCaballo de batalla para codificación, agentes y trabajo de conocimiento. Aproximadamente 17% menos tokens de salida que 3.5 Flash[4]
Gemini 3.5 Flash-Lite$0.30 entrada / $2.50 salidaModelo más rápido en la serie 3.5 a 350 tokens de salida por segundo[4]. Tuberías de alto volumen
Gemini 3.5 Flash CyberNo hay precio públicoBuscador de vulnerabilidades dentro del agente CodeMender de DeepMind. Solo gobiernos y socios verificados[3]

Dos notas de roadmap se esconden en el mismo post: Gemini 3.5 Pro aún está en pruebas de socios sin fecha pública, y Google confirmó que ha comenzado su ejecución de preentrenamiento más ambiciosa hasta ahora, para Gemini 4[1].

En reAPI, Gemini 3.6 Flash funciona a $1.20 entrada y $6.00 salida por millón de tokens, lo que es el 80% de la tarifa publicada por Google. Flash-Lite y Flash Cyber no están en el gateway.

El juego de la eficiencia

Gemini 3.6 Flash key art

Gemini 3.6 Flash cuesta $1.50 por millón de tokens de entrada y $7.50 por millón de salida, con entrada en caché a $0.15 por millón[1]. Su predecesor cobraba $9 por millón de salida, así que Google redujo el precio de salida en aproximadamente 17% mientras mejoraba las puntuaciones de benchmarks en toda la línea.

El precio de etiqueta es la mitad más pequeña de la historia. Artificial Analysis midió que 3.6 Flash consume aproximadamente 17% menos tokens de salida que 3.5 Flash en cargas de trabajo idénticas[4], y Google reportó reducciones de tokens de hasta 65% en el benchmark DeepSWE de Datacurve[1]. El modelo también requiere menos pasos de razonamiento y menos llamadas a herramientas para terminar trabajo multietapa.

Para un agente que hace bucles docenas de veces por tarea, esos efectos se apilan: tokens más baratos, menos tokens, menos bucles. Una comparación de precio por token subestima la brecha.

Benchmarks oficiales contra sus propios predecesores

Gráfico de lanzamiento de Google comparando Gemini 3.6 Flash contra Gemini 3.5 Flash y Gemini 3.1 Pro en DeepSWE, MLE-Bench, GDPVal-AA v2 y OSWorld-Verified

El gráfico de lanzamiento de Google compara 3.6 Flash contra 3.5 Flash y el más antiguo 3.1 Pro en cuatro benchmarks de agente[1].

BenchmarkGemini 3.1 ProGemini 3.5 FlashGemini 3.6 Flash
DeepSWE v1.1 (ingeniería de software de horizonte largo)12%37%49%
MLE-Bench (ingeniería de aprendizaje automático)42.6%49.7%63.9%
GDPVal-AA v2 (trabajo de conocimiento, Elo)96513491421
OSWorld-Verified (uso de computadora)76.2%78.4%83.0%

Tres ganancias más sobre la generación anterior se encuentran en la metodología de evaluación de Google: SWE-Bench Pro a 58.7% contra 55.1%, Terminal-Bench 2.1 a 78.0% contra 76.2%, y la prueba de recuperación de contexto largo GDM-MRCR v2 a profundidad de token de 1M completo, donde 3.6 Flash aproximadamente duplica a ambos predecesores a 54.0% contra menos de 27%[5].

De la tarjeta del modelo: el conocimiento se movió a marzo de 2026 desde enero de 2025, la envoltura de contexto se queda en 1M entrada y 64K tokens de salida, y el modelo acepta texto, imágenes, audio y video de forma nativa[2].

Dónde 3.6 Flash gana y dónde pierde

El gráfico de Google solo compara Gemini contra Gemini. Aquí está la imagen entre proveedores usando resultados publicados de mediados de 2026[5].

BenchmarkGemini 3.6 FlashGPT-5.6 LunaGrok 4.5Claude Sonnet 5
DeepSWE v1.149%67%n/an/a
Terminal-Bench 2.178.0%84.7%n/an/a
SWE-Bench Pro58.7%n/a64.7%n/a
MLE-Bench63.9%n/an/a66.9%
GDPVal-AA v2 (Elo)1421n/an/a1607
OSWorld-Verified83.0%n/an/an/a

Ningún modelo barre la tabla, y 3.6 Flash no está intentándolo. Lidera en uso de computadora OSWorld-Verified, en ambas variantes de razonamiento de gráficos CharXiv, y en ambas pruebas de contexto largo GDM-MRCR[5]. Esas son las rutas multimodales y de contexto largo que Google ha poseído consistentemente.

Claramente está rezagado frente a GPT-5.6 Luna en codificación de agente, en ambos DeepSWE y Terminal-Bench. Está rezagado frente a Claude Sonnet 5 en ingeniería de aprendizaje automático y trabajo de conocimiento, y el Elo de 1607 de Sonnet 5 en GDPVal-AA es una clase de peso diferente del 1421 de 3.6 Flash[5].

La lectura independiente está de acuerdo. Artificial Analysis califica 3.6 Flash a 50 en su Índice de Inteligencia, rango 21 de 187 modelos rastreados. Eso no es inteligencia fronteriza, y Google no lo está reclamando. La misma evaluación lo ubica primero en velocidad de salida en su clase a 303.6 tokens por segundo y describe su uso de tokens como bastante conciso, mientras nota que el tiempo al primer token, a 11.54 segundos con esfuerzo de pensamiento alto, se encuentra en el extremo lento de su nivel[4].

Una advertencia de metodología antes de que alguien cite la tabla entre proveedores: las puntuaciones de vendedores generalmente se reportan en la configuración de pensamiento máximo de cada modelo, y los arneses de agente difieren entre vendedores. Trata los espacios pequeños como ruido y solo los grandes como señal.

La lectura práctica. Si el trabajo es potencia de agente de codificación cruda, GPT-5.6 Luna y Claude Sonnet 5 aún mantienen la parte superior de la tabla, a varios múltiplos del precio. Si el trabajo es uso de computadora, trabajo multimodal pesado en documentos, o recuperación de contexto largo a escala, 3.6 Flash ofrece la mejor puntuación por dólar en su rango.

Gemini 3.5 Flash-Lite

El segundo lanzamiento apunta al extremo opuesto de la curva. Flash-Lite funciona a 350 tokens de salida por segundo según Artificial Analysis, con precio de $0.30 por millón de entrada y $2.50 por millón de salida, lo que es una quinta y un tercio de las tarifas de 3.6 Flash[1][4].

Ganancias de benchmarks de Gemini 3.5 Flash-Lite contra Gemini 3.1 Flash-Lite en Terminal-Bench, GDPVal-AA y recuperación de contexto largo

El salto generacional es más grande aquí que en cualquier otro lugar en el lanzamiento[1]:

  • Terminal-Bench 2.1: 54.0% contra 31.0% para 3.1 Flash-Lite, un movimiento de 23 puntos en codificación de terminal de agente.
  • GDPVal-AA v2: 1140 Elo contra 642, casi el doble en trabajo de conocimiento del mundo real.
  • GDM-MRCR v2 contexto largo: 72.2% contra 60.1%.

La comparación que vale la pena pausar es contra el 3 Flash más antiguo y más grande: Flash-Lite ahora gana SWE-Bench Pro a 54.2% contra 49.6% y OSWorld-Verified a 74.0% contra 65.1%[1]. El modelo más barato actual vence a la generación anterior en su nivel medio en codificación y uso de computadora.

Google lo posiciona para trabajo de alto rendimiento: búsqueda de agente, procesamiento de documentos a granel, clasificación, abanico de subagentos, con niveles de pensamiento configurables desde mínimo, el predeterminado, hasta alto[1].

Gemini 3.5 Flash Cyber

El tercer modelo es el que Google no te venderá. Flash Cyber es una versión de 3.5 Flash afinada para encontrar, validar y parchear vulnerabilidades de seguridad, y se envía exclusivamente dentro de CodeMender, el agente de seguridad de código de DeepMind, en un piloto limitado para gobiernos y socios de confianza[3].

El afinamiento se apoya en activos que pocos laboratorios tienen: la base de datos de OSV.dev de más de 700,000 vulnerabilidades de código abierto, más de una década de resultados de OSS-Fuzz, y datos de flujo de trabajo de seguridad de bases de código de escala de Google incluyendo Chromium[3]. Dentro de CodeMender, múltiples subagenties de Flash Cyber analizan diferentes rutas de código y fusionan hallazgos en un informe, que es la apuesta arquitectónica: un modelo barato llamado hasta cinco veces compitiendo con llamadas individuales a mucho más grandes.

Puntuaciones de CyberGym comparando Gemini 3.5 Flash Cyber dentro de CodeMender contra GPT-5.5-Cyber, Claude Mythos 5, GPT-5.6 Sol y Claude Mythos Preview

SistemaPuntuación de CyberGym
GPT-5.5-Cyber en agente OpenAI85.6%
Claude Mythos 5 en agente Anthropic83.8%
GPT-5.6 Sol en agente OpenAI83.6%
Gemini 3.5 Flash Cyber en CodeMender (máx 5 llamadas)83.2%
Claude Mythos Preview en agente Anthropic83.1%

Lee eso honestamente: Flash Cyber no encabeza la tabla. El GPT-5.5-Cyber dedicado de OpenAI lidera por 2.4 puntos y Mythos 5 lo supera por 0.6. El reclamo de Google es rendimiento competitivo de un modelo de tamaño Flash, que es un reclamo de costo en lugar de una corona[3].

Donde sí gana es en las evaluaciones más profundas de Google. En una prueba del motor V8 JavaScript confirmó 55 problemas reales únicos contra 47 para 3.5 Flash estándar y 36 para Claude Opus 4.6, incluyendo 10 que ningún otro modelo encontró[3]. El equipo de Investigación de Vulnerabilidades en la Nube de Google reporta usarlo para encontrar una vulnerabilidad de corrupción de memoria en un servicio de producción y construir una cadena de exploit funcional, evitando ASLR y W^X, dentro de dos horas[3].

Lo que explica la correa. Google declara que la capacidad es de uso dual, limita el acceso a defensores verificados, la despliega solo dentro del flujo de reportes de CodeMender, y requiere aprobación humana antes de que los parches se envíen[3].

Cómo usar Gemini 3.6 Flash: cuatro cambios API que rompen código anterior

La tarjeta del modelo describe 3.6 Flash como basado directamente en 3.5 Flash, la misma base de razonamiento disperso multimodal nativa y la misma envoltura de 1M/64K, con las ganancias provenientes del entrenamiento posterior en lugar de un modelo base nuevo[2]. La superficie de solicitud es donde se realiza el trabajo.

  1. Los IDs de modelo son gemini-3.6-flash y gemini-3.5-flash-lite[1].
  2. thinking_budget es reemplazado por un enum de cadena thinking_level. 3.6 Flash usa medium de forma predeterminada, Flash-Lite usa minimal[1].
  3. Los controles de muestreo clásicos se han ido. temperature, top_p y top_k fueron eliminados y deben eliminarse de las cargas de solicitud[1].
  4. candidate_count no es soportado, y los giros de modelo rellenado previamente, es decir, conversaciones que terminan en un rol de modelo no vacío, son rechazados[1].

Ambos modelos públicos exponen el conjunto completo de herramientas integradas, incluyendo uso de computadora, anclaje de búsqueda y ejecución de código[1]. Viniendo de 3.5 Flash, la migración es un cambio de cadena de modelo más eliminar parámetros deprecados. No hay superficie de SDK nueva para aprender.

Cuál modelo deberías elegir

Una heurística de enrutamiento directamente de los números publicados:

  • Por defecto a 3.6 Flash para bucles de agente que impliquen codificación, uso de computadora, análisis de documentos, o cualquier cosa multietapa. Las ganancias de eficiencia de tokens se componen exactamente donde los costos de agente explotan.
  • Enruta trabajo a granel y sensible a latencia a Flash-Lite: extracción, clasificación, búsqueda de resumen, abanico de subagentos. Sube thinking_level solo donde las comprobaciones de calidad muestreada digan que debes.
  • Mantén codificación de frontera en modelos de frontera. Si la autonomía de clase DeepSWE es el trabajo, los números honestos dicen que GPT-5.6 Luna y Claude Sonnet 5 todavía terminan tareas que 3.6 Flash no puede, y la prima puede valer la pena en ejecuciones de bajo volumen y alto riesgo.
  • Flash Cyber no es una opción que obtengas a menos que seas un gobierno o un socio invitado.

Llamar a Gemini 3.6 Flash junto a tus otros modelos

Nota lo que ese lista de enrutamiento realmente dice. Tres de los cuatro puntos envían trabajo a algún lugar que no sea Gemini. La conclusión honesta de la propia tabla de benchmarks de Google es que 3.6 Flash debería ganar algo de tu tráfico y perder el resto, y la división se mueve cada vez que un vendedor hace envío.

reAPI expone Gemini 3.6 Flash a través de un punto final /v1/chat/completions compatible con OpenAI, así que el cliente que ya llama a GPT y Claude también la llama. Ten en cuenta que el id de modelo de alambre mantiene el punto de Google:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

resp = client.chat.completions.create(
    model="gemini-3.6-flash",
    messages=[{"role": "user", "content": "Summarize this report and pull out the numbers."}],
    max_tokens=16000,
    stream=True,
)

Las tarifas en el gateway son $1.20 por millón de tokens de entrada y $6.00 por millón de salida, lo que es el 80% de las $1.50 / $7.50 publicadas por Google. El gateway también expone un tipo de punto final Gemini nativo para este modelo, así que los SDK escritos contra tu propio formato funcionan sin una reescritura. Las tarifas actuales y la superficie de solicitud viven en reapi.ai/models/gemini-3-6-flash y reapi.ai/docs/gemini-3-6-flash.

Para dejar claro sobre cobertura: Flash-Lite y Flash Cyber no están en el gateway. Flash Cyber no está disponible para nadie fuera del piloto de Google sin importar cómo lo llames.

FAQ

¿Es Gemini 3.6 Flash realmente más barato que 3.5 Flash?

Sí, en salida: $7.50 contra $9 por millón de tokens, aproximadamente una reducción del 17%. Porque el modelo también emite aproximadamente 17% menos tokens por el mismo trabajo, el costo efectivo por tarea completada cae más de lo que el precio de etiqueta sugiere. La entrada en caché es $0.15 por millón[1][4].

¿Cuál es la ventana de contexto de Gemini 3.6 Flash?

1M tokens de entrada y 64K tokens de salida, con texto, imagen, audio y video aceptados de forma nativa[2].

¿Necesito cambiar código para actualizar desde 3.5 Flash?

Minimalmente. Intercambia la cadena de modelo a gemini-3.6-flash, reemplaza thinking_budget con thinking_level y elimina temperature, top_p, top_k y candidate_count de solicitudes[1].

¿Es Gemini 3.6 Flash mejor que GPT-5.6 Luna o Claude Sonnet 5?

No en codificación de agente. Luna lidera DeepSWE 67% a 49% y Terminal-Bench 84.7% a 78.0%, y Sonnet 5 lidera MLE-Bench y GDPVal-AA[5]. Gemini 3.6 Flash gana uso de computadora, razonamiento de gráficos y recuperación de contexto largo, a una fracción del precio.

¿Puedo acceder a Gemini 3.5 Flash Cyber?

No a menos que seas una agencia gubernamental o un socio invitado en el piloto de CodeMender[3].

¿Qué pasó con Gemini 3.5 Pro?

Sigue en pruebas de socios sin fecha anunciada, mientras Google ha confirmado que Gemini 4 preentrenamiento ya está en marcha[1].

¿Qué tan rápido es Gemini 3.6 Flash?

Artificial Analysis lo ubica primero en velocidad de salida en su clase a 303.6 tokens por segundo, pero el tiempo al primer token a 11.54 segundos de esfuerzo de pensamiento alto es lento para su nivel[4]. Transmite cualquier cosa que una persona vea.

¿Cómo llamo a Gemini 3.6 Flash con el SDK de OpenAI?

Apunta el cliente de OpenAI a https://api.reapi.ai/v1 y establece model a gemini-3.6-flash, manteniendo el punto en el id. El punto final es compatible con OpenAI, así que no se necesita reescritura de SDK.

Leer un lanzamiento que compite en economía unitaria

Este lanzamiento vale la pena entender como un movimiento de precio en lugar de un movimiento de capacidad. Google no envió nivel Pro, no hizo reclamo de frontera, y puso su ingeniería en los dos números que deciden cuánto cuesta un agente: precio por token y tokens por tarea. Ambos bajaron aproximadamente 17%, y se multiplican. Contra eso, la tabla entre proveedores muestra a 3.6 Flash perdiendo codificación de agente frente a GPT-5.6 Luna y trabajo de conocimiento frente a Claude Sonnet 5, lo que es el intercambio correcto para un modelo en este rango en lugar de un defecto.

La versión práctica: haz bucles de agente predeterminados en él, envía extracción a granel hacia abajo, mantén codificación de frontera en modelos de frontera, y mide el costo efectivo por tarea completada en lugar de tasas por token, porque ese es el único número en el que la ganancia de eficiencia de tokens aparece. Así es cómo usar Gemini 3.6 Flash sin pagar precios de frontera por trabajo que ya hace bien, o esperar que gane las filas que claramente pierde.

References

  1. Google. Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber. Retrieved July 2026 from blog.google/technology/google-deepmind
  2. Google DeepMind. Gemini 3.6 Flash model card. Retrieved July 2026 from deepmind.google/models/gemini
  3. Google DeepMind. Introducing Gemini 3.5 Flash Cyber and CodeMender. Retrieved July 2026 from deepmind.google/discover/blog
  4. Artificial Analysis. Gemini 3.6 Flash — intelligence, performance, and price analysis. Retrieved July 2026 from artificialanalysis.ai/models
  5. OfficeChai. Gemini 3.6 Flash beats Gemini 3.5 Flash and Gemini 3.1 Pro on most benchmarks. Retrieved July 2026 from officechai.com

Further reading