Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Guide Gemini 3.6 Flash : performance, prix et limites
2026/07/27

Guide Gemini 3.6 Flash : performance, prix et limites

Gemini 3.6 Flash : résultats officiels, où il perd face à GPT-5.6 Luna et Claude Sonnet 5, quatre changements API cassants, et Flash-Lite et Cyber.

Le 21 juillet 2026, Google a lancé trois modèles Gemini en une seule annonce : Gemini 3.6 Flash, Gemini 3.5 Flash-Lite, et un spécialiste de la sécurité appelé Gemini 3.5 Flash Cyber[1]. Pas de modèle Pro, pas de keynote, pas de revendication sur une nouvelle frontière de l'intelligence. Tout le lancement affirme une chose : les équipes exécutant des agents en production ont besoin de moins de tokens et de latence plus basse par tâche, pas d'un modèle plus grand.

Cet positionnement vous dit pour qui c'est. Bien utiliser Gemini 3.6 Flash consiste surtout à comprendre les mathématiques de la compounding, car Google a abaissé le prix de la sortie et le modèle émet aussi moins de tokens pour faire le même travail. Ces deux effets se multiplient. Ce guide couvre les données de benchmark officielles, les cas où 3.6 Flash perd honnêtement face à GPT-5.6 Luna et Claude Sonnet 5, les quatre changements API qui cassent le code reporté, et quel modèle parmi les trois convient vraiment à votre charge de travail.

TL;DR : la gamme Gemini Flash de juillet 2026

ModèleTarif catalogue par 1M tokensPositionnement
Gemini 3.6 Flash1,50 $ entrée / 7,50 $ sortieMoteur de référence pour le codage, les agents et le travail cognitif. Environ 17 % de tokens de sortie en moins que 3.5 Flash[4]
Gemini 3.5 Flash-Lite0,30 $ entrée / 2,50 $ sortieModèle le plus rapide de la série 3.5 avec 350 tokens de sortie par seconde[4]. Pour les pipelines haute performance
Gemini 3.5 Flash CyberTarif non publicDétecteur de vulnérabilités embarqué dans l'agent CodeMender de DeepMind. Gouvernements et partenaires vérifiés uniquement[3]

Deux notes sur la feuille de route se cachent dans le même article : Gemini 3.5 Pro est toujours en test partenaire sans date publique, et Google a confirmé avoir lancé sa plus ambitieuse phase de pré-entraînement à ce jour, pour Gemini 4[1].

Sur reAPI, Gemini 3.6 Flash fonctionne à 1,20 $ entrée et 6,00 $ sortie par million de tokens, ce qui représente 80 % du tarif publié par Google.

La stratégie d'efficacité

Illustration clé de Gemini 3.6 Flash

Gemini 3.6 Flash coûte 1,50 $ par million de tokens d'entrée et 7,50 $ par million en sortie, avec entrée en cache à 0,15 $ par million[1]. Son prédécesseur facturait 9 $ par million en sortie, donc Google a réduit le tarif de sortie d'environ 17 % tout en améliorant les résultats de benchmark sur tous les fronts.

Le prix annoncé ne représente que la moitié de l'histoire. Artificial Analysis a mesuré que 3.6 Flash consomme environ 17 % de tokens de sortie en moins que 3.5 Flash sur des charges identiques[4], et Google a signalé des réductions de tokens jusqu'à 65 % sur le benchmark DeepSWE de Datacurve[1]. Le modèle effectue également moins d'étapes de raisonnement et moins d'appels d'outils pour terminer le travail multi-étapes.

Pour un agent qui boucle des dizaines de fois par tâche, ces effets s'accumulent : tokens moins chers, moins de tokens, moins de boucles. Une comparaison de prix par token sous-estime l'écart.

Benchmarks officiels contre les générations précédentes

Graphique de lancement de Google comparant Gemini 3.6 Flash à Gemini 3.5 Flash et Gemini 3.1 Pro sur DeepSWE, MLE-Bench, GDPVal-AA v2 et OSWorld-Verified

Le graphique de lancement de Google compare 3.6 Flash à 3.5 Flash et l'ancien 3.1 Pro sur quatre benchmarks agentiques[1].

BenchmarkGemini 3.1 ProGemini 3.5 FlashGemini 3.6 Flash
DeepSWE v1.1 (ingénierie logicielle long terme)12 %37 %49 %
MLE-Bench (ingénierie machine learning)42,6 %49,7 %63,9 %
GDPVal-AA v2 (travail cognitif, Elo)96513491421
OSWorld-Verified (utilisation informatique)76,2 %78,4 %83,0 %

Trois gains supplémentaires sur la génération précédente se trouvent dans la méthodologie d'évaluation de Google : SWE-Bench Pro à 58,7 % contre 55,1 %, Terminal-Bench 2.1 à 78,0 % contre 76,2 %, et le test de récupération en long contexte GDM-MRCR v2 à la profondeur complète de 1M tokens, où 3.6 Flash double environ les deux prédécesseurs à 54,0 % contre moins de 27 %[5].

Selon la carte du modèle : la date limite des connaissances s'est déplacée à mars 2026 par rapport à janvier 2025, l'enveloppe de contexte reste à 1M tokens d'entrée et 64K tokens de sortie, et le modèle accepte nativement le texte, les images, l'audio et la vidéo[2].

Où 3.6 Flash gagne et où il perd

Le graphique de Google compare seulement Gemini à Gemini. Voici le portrait multi-vendor utilisant les résultats publiés de mi-2026[5].

BenchmarkGemini 3.6 FlashGPT-5.6 LunaGrok 4.5Claude Sonnet 5
DeepSWE v1.149 %67 %n/an/a
Terminal-Bench 2.178,0 %84,7 %n/an/a
SWE-Bench Pro58,7 %n/a64,7 %n/a
MLE-Bench63,9 %n/an/a66,9 %
GDPVal-AA v2 (Elo)1421n/an/a1607
OSWorld-Verified83,0 %n/an/an/a

Aucun modèle ne gagne partout, et 3.6 Flash n'essaie pas. Il prime sur OSWorld-Verified pour l'utilisation informatique, sur les deux variantes de raisonnement graphique CharXiv, et sur les deux tests en long contexte GDM-MRCR[5]. Ce sont les couloirs multimodal et long contexte que Google domine constamment.

Il traîne clairement GPT-5.6 Luna sur le codage agentique, sur DeepSWE et Terminal-Bench. Il traîne Claude Sonnet 5 sur l'ingénierie ML et le travail cognitif, et l'Elo de Sonnet 5 à 1607 sur GDPVal-AA est une catégorie de poids différente de celui de 3.6 Flash à 1421[5].

La lecture indépendante agree. Artificial Analysis note 3.6 Flash à 50 sur son Indice d'Intelligence, rang 21 sur 187 modèles suivis. Ce n'est pas une intelligence de frontière, et Google ne le prétend pas. La même évaluation le classe premier en vitesse de sortie dans sa classe à 303,6 tokens par seconde et décrit son usage de tokens comme assez concis, tout en notant que le temps jusqu'au premier token, à 11,54 secondes en effort de raisonnement élevé, se situe à la fin lente de sa classe[4].

Une mise en garde méthodologique avant que quiconque cite le tableau multi-vendor : les scores de vendor sont généralement rapportés avec la configuration de raisonnement maximale de chaque modèle, et les harnais d'agent diffèrent entre les vendors. Traitez les petits écarts comme du bruit et seuls les grands comme des signaux.

La lecture pratique. Si le travail est la puissance brute d'agent de codage, GPT-5.6 Luna et Claude Sonnet 5 tiennent toujours le haut du tableau, à plusieurs fois le prix. Si le travail est l'utilisation informatique, le travail multimodal lourd en documents, ou la récupération long contexte à l'échelle, 3.6 Flash offre le meilleur score par dollar dans sa catégorie.

Gemini 3.5 Flash-Lite

Le deuxième lancement vise l'extrémité opposée de la courbe. Flash-Lite fonctionne à 350 tokens de sortie par seconde selon Artificial Analysis, tarifé à 0,30 $ par million d'entrée et 2,50 $ par million en sortie, ce qui représente un cinquième et un tiers des tarifs de 3.6 Flash[1][4].

Gains de benchmark de Gemini 3.5 Flash-Lite contre Gemini 3.1 Flash-Lite sur Terminal-Bench, GDPVal-AA et récupération long contexte

Le saut générationnel est plus grand ici qu'ailleurs dans le lancement[1] :

  • Terminal-Bench 2.1 : 54,0 % contre 31,0 % pour 3.1 Flash-Lite, un mouvement de 23 points en codage terminal agentique.
  • GDPVal-AA v2 : 1140 Elo contre 642, proche du double sur le travail cognitif du monde réel.
  • GDM-MRCR v2 long contexte : 72,2 % contre 60,1 %.

La comparaison qui vaut une pause est celle contre l'ancien et plus grand 3 Flash : Flash-Lite gagne maintenant SWE-Bench Pro à 54,2 % contre 49,6 % et OSWorld-Verified à 74,0 % contre 65,1 %[1]. Le modèle le moins cher actuel bats la génération précédente de gamme intermédiaire sur le codage et l'utilisation informatique.

Google la positionne pour le travail haute performance : recherche agentique, traitement de documents en masse, classification, fan-out de sous-agents, avec niveaux de raisonnement configurables du minimal, le défaut, jusqu'à élevé[1].

Gemini 3.5 Flash Cyber

Le troisième modèle est celui que Google ne vous vendra pas. Flash Cyber est une version de 3.5 Flash affinage fine sur la détection, validation et correction de vulnérabilités de sécurité, et elle ne se livre qu'exclusivement à l'intérieur de CodeMender, l'agent de sécurité de code de DeepMind, dans un pilote limité pour gouvernements et partenaires de confiance[3].

L'affinage fin s'appuie sur des actifs que peu de labs possèdent : la base de données OSV.dev de plus de 700 000 vulnérabilités open-source, plus d'une décennie de résultats d'OSS-Fuzz, et des données de workflow de sécurité de codebases à l'échelle Google incluant Chromium[3]. À l'intérieur de CodeMender, plusieurs sous-agents Flash Cyber analysent différents chemins de code et fusionnent les découvertes en un rapport, c'est le pari architectural : un modèle bon marché appelé jusqu'à cinq fois en compétition avec des appels uniques à beaucoup plus grands.

Scores de CyberGym comparant Gemini 3.5 Flash Cyber à l'intérieur de CodeMender contre GPT-5.5-Cyber, Claude Mythos 5, GPT-5.6 Sol et Claude Mythos Preview

SystèmeScore CyberGym
GPT-5.5-Cyber dans l'agent OpenAI85,6 %
Claude Mythos 5 dans l'agent Anthropic83,8 %
GPT-5.6 Sol dans l'agent OpenAI83,6 %
Gemini 3.5 Flash Cyber dans CodeMender (max 5 appels)83,2 %
Claude Mythos Preview dans l'agent Anthropic83,1 %

Lisez cela honnêtement : Flash Cyber ne figure pas au sommet du graphique. GPT-5.5-Cyber dédié de OpenAI mène de 2,4 points et Mythos 5 le surpasse de 0,6. La revendication de Google est une performance compétitive d'un modèle taille Flash, ce qui est une affirmation de coût plutôt qu'une couronne[3].

Où il gagne vraiment est dans les évaluations plus profondes de Google. Sur un test du moteur JavaScript V8, il a confirmé 55 problèmes réels uniques contre 47 pour 3.5 Flash standard et 36 pour Claude Opus 4.6, incluant 10 que nul autre modèle n'a trouvés[3]. L'équipe de Recherche sur les Vulnérabilités Cloud de Google rapporte l'avoir utilisé pour trouver une vulnérabilité de corruption mémoire dans un service en production et construire une chaîne d'exploitation fonctionnelle, contournant ASLR et W^X, en deux heures[3].

Ce qui explique la laisse. Google déclare que la capacité est à double usage, limite l'accès aux défenseurs vérifiés, ne la déploie que dans le workflow de rapportage de CodeMender, et requiert l'approbation humaine avant que les patches ne s'envolent[3].

Comment utiliser Gemini 3.6 Flash : quatre changements API qui cassent le code ancien

La carte du modèle décrit 3.6 Flash comme basé directement sur 3.5 Flash, la même base de raisonnement creux nativement multimodal et la même enveloppe 1M/64K, avec les gains provenant du post-entraînement plutôt que d'un nouveau modèle de base[2]. La surface de demande est où se trouve le travail.

  1. Les identifiants de modèle sont gemini-3.6-flash et gemini-3.5-flash-lite[1].
  2. thinking_budget est remplacé par une énumération de chaîne thinking_level. 3.6 Flash s'avère par défaut à medium, Flash-Lite à minimal[1].
  3. Les classiques knobs d'échantillonnage sont partis. temperature, top_p, et top_k ont été supprimés et devraient être effacés des charges utiles de demande[1].
  4. candidate_count n'est pas supporté, et les tours de modèle préremplis, c'est-à-dire les conversations terminant sur un rôle de modèle non vide, sont rejetés[1].

Les deux modèles publics exposent la suite d'outils construits complète, incluant utilisation informatique, ancrage de recherche et exécution de code[1]. Venant de 3.5 Flash, la migration est un changement de chaîne de modèle plus suppression de paramètres dépréciés. Il n'y a pas de nouvelle surface SDK à apprendre.

Quel modèle devrais-je choisir

Un heuristique de routage directement des nombres publiés :

  • Défaut à 3.6 Flash pour les boucles d'agent impliquant codage, utilisation informatique, analyse de documents, ou anything multi-étapes. Les gains d'efficacité de tokens s'accumulent exactement où les coûts d'agent explosent.
  • Route le travail en masse et sensible à la latence vers Flash-Lite : extraction, classification, résumé de recherche, fan-out de sous-agents. Élevez thinking_level uniquement où les contrôles de qualité échantillonnés disent que vous devez.
  • Gardez le codage de frontière sur les modèles de frontière. Si l'autonomie de classe DeepSWE est le travail, les nombres honnêtes disent que GPT-5.6 Luna et Claude Sonnet 5 terminent toujours les tâches que 3.6 Flash ne peut pas, et la prime peut en valoir la peine sur les exécutions basse volume, haute piquance.
  • Flash Cyber n'est pas un choix que vous obtenez sauf si vous êtes un gouvernement ou un partenaire invité.

Appeler Gemini 3.6 Flash aux côtés de vos autres modèles

Remarquez ce que cette liste de routage dit vraiment. Trois des quatre puces envoient le travail quelque part autre que Gemini. La conclusion honnête du tableau de benchmark propre de Google est que 3.6 Flash devrait gagner un peu de votre trafic et en perdre le reste, et la division se déplace chaque fois qu'un vendor livre.

reAPI expose Gemini 3.6 Flash via un point de terminaison /v1/chat/completions compatible OpenAI, donc le client appelant déjà GPT et Claude l'appelle aussi. Notez que l'identifiant du modèle en wire garde le point de Google :

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

resp = client.chat.completions.create(
    model="gemini-3.6-flash",
    messages=[{"role": "user", "content": "Summarize this report and pull out the numbers."}],
    max_tokens=16000,
    stream=True,
)

Les tarifs sur la passerelle sont 1,20 $ par million de tokens d'entrée et 6,00 $ par million en sortie, ce qui représente 80 % des tarifs publiés de Google de 1,50 $ / 7,50 $. La passerelle expose aussi un type de point de terminaison Gemini natif pour ce modèle, donc les SDKs écrits contre le propre format de Google fonctionnent sans réécriture. Les tarifs actuels et la surface de demande vivent à reapi.ai/models/gemini-3-6-flash et reapi.ai/docs/gemini-3-6-flash.

Pour être clair sur la couverture : Flash-Lite et Flash Cyber ne sont pas sur la passerelle. Flash Cyber n'est disponible pour personne en dehors du pilote de Google peu importe comment vous l'appelez.

FAQ

Gemini 3.6 Flash est-il vraiment moins cher que 3.5 Flash ?

Oui, en sortie : 7,50 $ contre 9 $ par million de tokens, grossièrement une coupe de 17 %. Parce que le modèle émet aussi environ 17 % moins de tokens pour le même travail, le coût effectif par tâche complétée tombe plus que le prix annoncé ne le suggère. L'entrée en cache coûte 0,15 $ par million[1][4].

Quelle est la fenêtre de contexte de Gemini 3.6 Flash ?

1M tokens d'entrée et 64K tokens de sortie, avec texte, image, audio et vidéo acceptés nativement[2].

Ai-je besoin de changer du code pour passer de 3.5 Flash ?

Minimalement. Échangez la chaîne du modèle pour gemini-3.6-flash, remplacez thinking_budget par thinking_level, et supprimez temperature, top_p, top_k, et candidate_count des demandes[1].

Gemini 3.6 Flash est-il meilleur que GPT-5.6 Luna ou Claude Sonnet 5 ?

Non en codage agentique. Luna mène DeepSWE 67 % à 49 % et Terminal-Bench 84,7 % à 78,0 %, et Sonnet 5 mène MLE-Bench et GDPVal-AA[5]. Gemini 3.6 Flash gagne utilisation informatique, raisonnement graphique, et récupération long contexte, à une fraction du prix.

Puis-je accéder à Gemini 3.5 Flash Cyber ?

Non sauf si vous êtes une agence gouvernementale ou un partenaire invité dans le pilote de CodeMender[3].

Qu'est-il arrivé à Gemini 3.5 Pro ?

Il reste en test partenaire sans date annoncée, tandis que Google a confirmé que le pré-entraînement de Gemini 4 est déjà en cours[1].

Quelle est la vitesse de Gemini 3.6 Flash ?

Artificial Analysis le classe premier en vitesse de sortie dans sa classe à 303,6 tokens par seconde, mais le temps jusqu'au premier token en effort de raisonnement élevé est 11,54 secondes, ce qui est lent pour sa classe[4]. Streamez anything une personne regarde.

Comment j'appelle Gemini 3.6 Flash avec le SDK OpenAI ?

Pointez le client OpenAI vers https://api.reapi.ai/v1 et définissez model pour gemini-3.6-flash, gardant le point dans l'id. Le point de terminaison est compatible OpenAI, donc pas de réécriture SDK n'est nécessaire.

Lire une annonce qui concurrence sur l'économie unitaire

Ce lancement vaut la peine d'être compris comme un mouvement de tarification plutôt qu'un mouvement de capacité. Google n'a pas livré de tier Pro, n'a pas fait de revendication de frontière, et a mis son ingénierie dans les deux nombres qui décident ce qu'un agent coûte : tarif par token et tokens par tâche. Les deux ont chuté d'environ 17 %, et ils se multiplient. Contre cela, le tableau multi-vendor montre 3.6 Flash perdant le codage agentique à GPT-5.6 Luna et le travail cognitif à Claude Sonnet 5, ce qui est le commerce correct pour un modèle dans cette classe plutôt qu'un défaut.

La version pratique : défaut aux boucles d'agent pour elle, envoyer l'extraction en masse plus bas, garder le codage de frontière sur les modèles de frontière, et mesurer le coût effectif par tâche complétée au lieu des tarifs par token, parce que c'est le seul nombre dans lequel le gain d'efficacité de tokens se montre. C'est comment utiliser Gemini 3.6 Flash sans payer les prix de frontière pour le travail qu'il fait déjà bien, ou s'attendre à ce qu'il gagne les lignes qu'il perd clairement.

Références

  1. Google. Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber. Consulté juillet 2026 de blog.google/technology/google-deepmind
  2. Google DeepMind. Gemini 3.6 Flash model card. Consulté juillet 2026 de deepmind.google/models/gemini
  3. Google DeepMind. Introducing Gemini 3.5 Flash Cyber and CodeMender. Consulté juillet 2026 de deepmind.google/discover/blog
  4. Artificial Analysis. Gemini 3.6 Flash — intelligence, performance, and price analysis. Consulté juillet 2026 de artificialanalysis.ai/models
  5. OfficeChai. Gemini 3.6 Flash beats Gemini 3.5 Flash and Gemini 3.1 Pro on most benchmarks. Consulté juillet 2026 de officechai.com

Lectures supplémentaires