Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Anleitung Gemini 3.6 Flash: Geschwindigkeit, Preis und Grenzen
2026/07/27

Anleitung Gemini 3.6 Flash: Geschwindigkeit, Preis und Grenzen

Gemini 3.6 Flash: offizielle Benchmarks, wo es gegen GPT-5.6 Luna und Sonnet 5 verliert, API-Änderungen die Code kaputt machen, Flash-Lite und Cyber.

Am 21. Juli 2026 stellte Google drei Gemini-Modelle in einer Ankündigung vor: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite und einen auf Sicherheit spezialisierten Fachmann namens Gemini 3.5 Flash Cyber[1]. Kein Pro-Modell, keine Keynote, keine Behauptung einer neuen Intelligenzgrenze. Die gesamte Ankündigung macht eines klar: Teams, die Agenten in der Produktion ausführen, brauchen weniger Tokens und niedrigere Latenz pro Task, nicht ein größeres Modell.

Diese Positionierung sagt dir, für wen es bestimmt ist. Gemini 3.6 Flash gut nutzen geht es vor allem um die mathematik der zusammengesetzten Effekte, denn Google hat den Ausgabepreis gesenkt und das Modell gibt auch weniger Tokens für die gleiche Arbeit aus. Diese zwei Effekte multiplizieren sich. Dieser Leitfaden behandelt die offiziellen Benchmark-Daten, wo 3.6 Flash ehrlich gegen GPT-5.6 Luna und Claude Sonnet 5 verliert, die vier API-Änderungen, die alten Code kaputt machen, und welche der drei Modelle wirklich zu deiner Arbeitslast passt.

TL;DR: die Gemini-Flash-Reihe im Juli 2026

ModellListenpreis pro 1M TokensPositionierung
Gemini 3.6 Flash1,50 $ Eingabe / 7,50 $ AusgabeUniversalmodell für Programmierung, Agenten und wissensintensive Aufgaben. Etwa 17 % weniger Output-Tokens als 3.5 Flash[4]
Gemini 3.5 Flash-Lite0,30 $ Eingabe / 2,50 $ AusgabeSchnellstes Modell der 3.5-Serie mit 350 Output-Tokens pro Sekunde[4]. Für hochvolumige Pipelines
Gemini 3.5 Flash CyberNicht öffentlich bepreistLückensucher im CodeMender-Agenten von DeepMind. Nur Regierungen und überprüfte Partner[3]

Zwei Hinweise zum Fahrplan verbergen sich in derselben Ankündigung: Gemini 3.5 Pro ist noch in Tests mit Partnern ohne öffentliches Datum, und Google hat bestätigt, dass es seine ehrgeizigste Vortrainingskampagne gestartet hat, für Gemini 4[1].

Auf reAPI läuft Gemini 3.6 Flash für 1,20 $ Eingabe und 6,00 $ Ausgabe pro Million Tokens, das sind 80 % der von Google veröffentlichten Quote.

Die Effizienz-Strategie

Gemini 3.6 Flash Artwork

Gemini 3.6 Flash kostet 1,50 $ pro Million Input-Tokens und 7,50 $ pro Million Output, mit gecachter Eingabe zu 0,15 $ pro Million[1]. Sein Vorgänger berechnete 9 $ pro Million Output, also hat Google den Output-Preis um etwa 17 % gesenkt und gleichzeitig Benchmark-Scores überall verbessert.

Der angegebene Preis ist nur die halbe Geschichte. Artificial Analysis gemessen, dass 3.6 Flash etwa 17 % weniger Output-Tokens verbraucht als 3.5 Flash bei identischen Aufgaben[4], und Google berichtet Token-Reduktionen von bis zu 65 % auf DeepSWEs Benchmark[1]. Das Modell braucht auch weniger Reasoning-Schritte und weniger Tool-Aufrufe, um mehrstufige Aufgaben zu beenden.

Für einen Agenten, der pro Task dutzende Male loopt, stapeln sich diese Effekte: billigere Tokens, weniger Tokens, weniger Loops. Ein Preis-pro-Token-Vergleich unterschätzt die Lücke.

Offizielle Benchmarks gegen Vorgängermodelle

Googles Launch-Diagramm vergleicht Gemini 3.6 Flash mit Gemini 3.5 Flash und Gemini 3.1 Pro auf DeepSWE, MLE-Bench, GDPVal-AA v2 und OSWorld-Verified

Googles Launch-Diagramm vergleicht 3.6 Flash mit 3.5 Flash und dem älteren 3.1 Pro auf vier agentic Benchmarks[1].

BenchmarkGemini 3.1 ProGemini 3.5 FlashGemini 3.6 Flash
DeepSWE v1.1 (langfristige Softwareentwicklung)12 %37 %49 %
MLE-Bench (Machine-Learning-Ingenieurwesen)42,6 %49,7 %63,9 %
GDPVal-AA v2 (Wissenarbeit, Elo)96513491421
OSWorld-Verified (Computernutzung)76,2 %78,4 %83,0 %

Drei weitere Verbesserungen zur Vorgängergeneration liegen in Googles Bewertungsmethodik: SWE-Bench Pro mit 58,7 % gegen 55,1 %, Terminal-Bench 2.1 mit 78,0 % gegen 76,2 %, und GDM-MRCR v2 Long-Context-Abruf in voller 1M-Token-Tiefe, wo 3.6 Flash beide Vorgänger bei 54,0 % gegen unter 27 % etwa verdoppelt[5].

Aus der Modellkarte: die Knowledge Cutoff-Datum verschob sich zu März 2026 von Januar 2025, das Kontext-Umschlag bleibt bei 1M Input- und 64K Output-Tokens, und das Modell akzeptiert nativ Text, Bilder, Audio und Video[2].

Wo 3.6 Flash gewinnt und wo nicht

Googles Diagramm vergleicht nur Gemini mit Gemini. Hier die Multi-Vendor-Perspektive mit veröffentlichten Ergebnissen von Mitte 2026[5].

BenchmarkGemini 3.6 FlashGPT-5.6 LunaGrok 4.5Claude Sonnet 5
DeepSWE v1.149 %67 %n/an/a
Terminal-Bench 2.178,0 %84,7 %n/an/a
SWE-Bench Pro58,7 %n/a64,7 %n/a
MLE-Bench63,9 %n/an/a66,9 %
GDPVal-AA v2 (Elo)1421n/an/a1607
OSWorld-Verified83,0 %n/an/an/a

Kein Modell gewinnt überall, und 3.6 Flash versucht das gar nicht. Es führt bei OSWorld-Verified Computernutzung, bei beiden CharXiv Chart-Reasoning-Varianten, und auf beiden GDM-MRCR Long-Context-Tests[5]. Das sind die Multi-Modal- und Long-Context-Bereiche, die Google beständig beherrscht.

Es hinkt deutlich GPT-5.6 Luna bei agentischer Programmierung, auf DeepSWE und Terminal-Bench. Es hinkt Claude Sonnet 5 bei Machine-Learning-Ingenieurwesen und Wissenarbeit, und Sonnet 5s 1607-Elo auf GDPVal-AA ist eine andere Gewichtsklasse als 3.6 Flashs 1421[5].

Unabhängige Analysen stimmen zu. Artificial Analysis bewertet 3.6 Flash mit 50 auf seinem Intelligence-Index, Rang 21 von 187 verfolgten Modellen. Das ist nicht Frontier-Intelligenz, und Google behauptet das auch nicht. Die gleiche Bewertung platziert es erste bei Output-Geschwindigkeit in seiner Klasse bei 303,6 Tokens pro Sekunde und beschreibt seine Token-Nutzung als ziemlich sparsam, während es bemerkt, dass die Zeit bis zum ersten Token bei 11,54 Sekunden unter hohem Thinking-Aufwand am langsamen Ende seiner Klasse liegt[4].

Eine methodische Warnung vor je einigen zitiert die Multi-Vendor-Tabelle: Vendor-Scores werden generell beim maximalen Thinking-Setup jedes Modells gemeldet, und Agent-Frameworks unterscheiden sich zwischen Vendors. Behandle kleine Lücken als Rauschen und nur große als Signal.

Die praktische Lesung. Wenn der Job rohe Codierungs-Agent-Kraft ist, halten GPT-5.6 Luna und Claude Sonnet 5 noch die Spitze des Bretts, zu mehreren Male dem Preis. Wenn der Job Computernutzung, dokumentenlastige Multi-Modal-Arbeit oder Long-Context-Abruf im großen Stil ist, bietet 3.6 Flash den besten Score pro Dollar in seiner Klasse.

Gemini 3.5 Flash-Lite

Der zweite Start zielt auf das andere Ende der Kurve. Flash-Lite läuft bei 350 Output-Tokens pro Sekunde laut Artificial Analysis, bepreist zu 0,30 $ pro Million Input und 2,50 $ pro Million Output, das sind ein Fünftel und ein Drittel von 3.6 Flashs Tarife[1][4].

Gemini 3.5 Flash-Lite Benchmark-Gewinne gegen Gemini 3.1 Flash-Lite auf Terminal-Bench, GDPVal-AA und Long-Context-Abruf

Der generationelle Sprung ist hier größer als anderswo im Start[1]:

  • Terminal-Bench 2.1: 54,0 % gegen 31,0 % für 3.1 Flash-Lite, eine 23-Punkte-Bewegung bei agentic Terminal-Programmierung.
  • GDPVal-AA v2: 1140 Elo gegen 642, etwa doppelt bei realistischer Wissenarbeit.
  • GDM-MRCR v2 Long-Context: 72,2 % gegen 60,1 %.

Der Vergleich, bei dem es sich zu pausieren lohnt, ist gegen das ältere, größere 3 Flash: Flash-Lite gewinnt jetzt SWE-Bench Pro mit 54,2 % gegen 49,6 % und OSWorld-Verified mit 74,0 % gegen 65,1 %[1]. Das billigste aktuelle Modell schlägt die Mittelklasse der Vorgängergeneration bei Programmierung und Computernutzung.

Google positioniert es für hochdurchsätzige Arbeit: agentische Suche, Massen-Dokumentenverarbeitung, Klassifizierung, Subagenten-Fan-Out, mit konfigurierbaren Thinking-Stufen von Minimal (Standard) bis Hoch[1].

Gemini 3.5 Flash Cyber

Das dritte Modell ist eines, das Google dir nicht verkauft. Flash Cyber ist eine Version von 3.5 Flash feinabgestimmt auf die Suche, Validierung und Behebung von Sicherheitslücken, und sie kommt nur exklusiv in CodeMender, DeepMinds Code-Security-Agent, in einem limitierten Piloten für Regierungen und vertraute Partner[3].

Das Fine-Tuning stützt sich auf Assets, die wenige Labs haben: die OSV.dev-Datenbank von über 700.000 Open-Source-Lücken, über ein Jahrzehnt OSS-Fuzz-Ergebnisse und Security-Workflow-Daten aus Google-Skalierungs-Codebases inklusive Chromium[3]. Innerhalb von CodeMender analysieren mehrere Flash Cyber Subagenten verschiedene Code-Pfade und mergen Befunde in einen Bericht, das ist die architektonische Wette: ein günstiges Modell bis fünfmal aufgerufen konkurriert mit einzelnen Aufrufen an viel größere.

CyberGym-Scores vergleichen Gemini 3.5 Flash Cyber in CodeMender gegen GPT-5.5-Cyber, Claude Mythos 5, GPT-5.6 Sol und Claude Mythos Preview

SystemCyberGym-Score
GPT-5.5-Cyber in OpenAIs Agent85,6 %
Claude Mythos 5 in Anthropics Agent83,8 %
GPT-5.6 Sol in OpenAIs Agent83,6 %
Gemini 3.5 Flash Cyber in CodeMender (max 5 Aufrufe)83,2 %
Claude Mythos Preview in Anthropics Agent83,1 %

Lies das ehrlich: Flash Cyber toppt das Diagramm nicht. OpenAIs spezialisiert GPT-5.5-Cyber führt mit 2,4 Punkten und Mythos 5 schlägt es um 0,6. Googles Anspruch ist Wettbewerbsleistung von einem Modell der Größe Flash, was eher eine Kostenaussage als eine Krone ist[3].

Wo es wirklich gewinnt ist in Googles tiefergehenden Evaluationen. Auf einem V8-JavaScript-Engine-Test bestätigte es 55 einzigartige echte Probleme gegen 47 für Stock 3.5 Flash und 36 für Claude Opus 4.6, inklusive 10, die kein anderes Modell fand[3]. Googles Cloud-Forschungsteam berichtet, es zur Findung einer Memory-Corruption-Lücke in einem Produktionsdienst und zum Bau einer funktionierenden Exploit-Kette genutzt zu haben, wobei ASLR und W^X umgangen wurden, in zwei Stunden[3].

Das erklärt die Beschränkung. Google erklärt, dass die Fähigkeit dual-use ist, limitiert den Zugang auf überprüfte Verteidiger, stellt sie nur in CodeMenders Meldungsfluss bereit und braucht menschliche Genehmigung bevor Patches deployed werden[3].

Gemini 3.6 Flash nutzen: vier API-Änderungen, die alten Code kaputt machen

Die Modellkarte beschreibt 3.6 Flash als direkt auf 3.5 Flash basierend, das gleiche nativ multi-modale Sparse-Reasoning-Fundament und die gleiche 1M/64K-Hülle, mit Gewinnen aus Post-Training statt eines neuen Basis-Modells[2]. Die Request-Surface ist wo die Arbeit liegt.

  1. Modell-IDs sind gemini-3.6-flash und gemini-3.5-flash-lite[1].
  2. thinking_budget wird durch eine thinking_level-String-Enum ersetzt. 3.6 Flash defaultet auf medium, Flash-Lite auf minimal[1].
  3. Die klassischen Sampling-Schalter sind weg. temperature, top_p, und top_k wurden entfernt und sollten aus Request-Payloads gelöscht werden[1].
  4. candidate_count wird nicht unterstützt, und vorgefüllte Modell-Turns, also Gespräche die auf einer nicht-leeren Modell-Rolle enden, werden abgelehnt[1].

Beide öffentlichen Modelle stellen die vollständige eingebaute Tool-Suite zur Verfügung, inklusive Computernutzung, Search-Grounding und Code-Ausführung[1]. Von 3.5 Flash ist die Migration ein Modell-String-Tausch plus Löschen veralteter Parameter. Es gibt keine neue SDK-Surface zu lernen.

Welches Modell wähle ich

Eine Routing-Heuristik direkt aus den veröffentlichten Zahlen:

  • Default zu 3.6 Flash für Agent-Loops mit Programmierung, Computernutzung, Dokumenten-Parsing oder anything mehrstufig. Die Token-Effizienz-Gewinne addieren sich genau wo Agent-Kosten explodieren.
  • Route Massen- und latenzempfindliche Arbeit zu Flash-Lite: Extraktion, Klassifizierung, Suchabstrich, Subagenten-Fan-Out. Erhöhe thinking_level nur wo Sample-Qualitätschecks sagen dass du musst.
  • Halte Frontier-Programmierung auf Frontier-Modellen. Wenn DeepSWE-Klasse Autonomie der Job ist, sagen die ehrlichen Zahlen dass GPT-5.6 Luna und Claude Sonnet 5 Tasks beenden die 3.6 Flash nicht kann, und die Premium könnte auf Low-Volume-High-Stakes-Läufen wert sein.
  • Flash Cyber ist keine Wahl, die du treffen kannst es sei denn du bist eine Regierung oder ein eingeladener Partner.

Rufe Gemini 3.6 Flash neben deinen anderen Modellen auf

Bemerke was diese Routing-Liste wirklich sagt. Drei der vier Punkte senden Arbeit woanders als zu Gemini. Die ehrliche Schlussfolgerung von Googles eigenem Benchmark-Diagramm ist dass 3.6 Flash etwas von deinem Traffic gewinnen sollte und den Rest verlieren, und die Aufteilung verschiebt sich jedesmal wenn ein Vendor shipped.

reAPI stellt Gemini 3.6 Flash durch einen OpenAI-kompatiblen /v1/chat/completions-Endpoint zur Verfügung, also der Client, der schon GPT und Claude aufruft ruft das auch auf. Bemerke dass die Wire-Modell-ID Googles Punkt behält:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

resp = client.chat.completions.create(
    model="gemini-3.6-flash",
    messages=[{"role": "user", "content": "Summarize this report and pull out the numbers."}],
    max_tokens=16000,
    stream=True,
)

Tarife am Gateway sind 1,20 $ pro Million Input-Tokens und 6,00 $ pro Million Output, das sind 80 % von Googles veröffentlichten 1,50 $ / 7,50 $. Das Gateway stellt auch einen nativen Gemini-Endpoint-Typ für dieses Modell zur Verfügung, also SDKs gegen Googles eigenes Format geschrieben funktionieren ohne Umschreiben. Aktuelle Tarife und die Request-Surface leben auf reapi.ai/models/gemini-3-6-flash und reapi.ai/docs/gemini-3-6-flash.

Um klar zu sein über Coverage: Flash-Lite und Flash Cyber sind nicht im Gateway. Flash Cyber ist niemand außerhalb von Googles Pilot verfügbar egal wie du es rufst.

FAQ

Ist Gemini 3.6 Flash wirklich günstiger als 3.5 Flash?

Ja, bei Output: 7,50 $ gegen 9 $ pro Million Tokens, ungefähr eine 17 % Reduktion. Weil das Modell auch etwa 17 % weniger Tokens für die gleiche Arbeit abgibt, sinkt die effektive Kosten pro vollständige Task mehr als der angegebene Preis nahelegt. Gecachte Eingabe kostet 0,15 $ pro Million[1][4].

Was ist das Kontext-Fenster von Gemini 3.6 Flash?

1M Input-Tokens und 64K Output-Tokens, mit Text, Bild, Audio und Video nativ akzeptiert[2].

Muss ich Code ändern um von 3.5 Flash zu upgraden?

Minimal. Tausche die Modell-String zu gemini-3.6-flash, ersetze thinking_budget mit thinking_level, und entferne temperature, top_p, top_k, und candidate_count aus Requests[1].

Ist Gemini 3.6 Flash besser als GPT-5.6 Luna oder Claude Sonnet 5?

Nicht bei agentischer Programmierung. Luna führt DeepSWE 67 % zu 49 % und Terminal-Bench 84,7 % zu 78,0 %, und Sonnet 5 führt MLE-Bench und GDPVal-AA[5]. Gemini 3.6 Flash gewinnt Computernutzung, Chart-Reasoning und Long-Context-Abruf, zu einem Bruchteil des Preises.

Kann ich auf Gemini 3.5 Flash Cyber zugreifen?

Nein es sei denn du bist eine Regierungsbehörde oder ein eingeladener Partner im CodeMender-Pilot[3].

Was ist mit Gemini 3.5 Pro passiert?

Es bleibt in Partner-Tests ohne angekündigtes Datum, während Google bestätigt hat dass Gemini 4 Vortraining bereits läuft[1].

Wie schnell ist Gemini 3.6 Flash?

Artificial Analysis platziert es erste bei Output-Geschwindigkeit in seiner Klasse bei 303,6 Tokens pro Sekunde, aber die Zeit bis zum ersten Token bei hohem Thinking-Aufwand ist 11,54 Sekunden, das ist langsam für seine Klasse[4]. Streame alles das eine Person anschaut.

Wie rufe ich Gemini 3.6 Flash mit dem OpenAI SDK auf?

Zeige den OpenAI-Client auf https://api.reapi.ai/v1 und setze model zu gemini-3.6-flash, den Punkt in der ID bewahrend. Der Endpoint ist OpenAI-kompatibel, also kein SDK-Umschreiben notwendig.

Eine Ankündigung lesen, die auf Unit-Ökonomie konkurriert

Dieser Start verdient es als Preisbewegung statt Fähigkeitsbewegung verstanden zu werden. Google lieferte kein Pro-Tier, machte keine Frontier-Behauptung, und steckte seine Engineering in die zwei Zahlen, die entscheiden was ein Agent kostet: Preis pro Token und Tokens pro Task. Beide fielen etwa 17 %, und sie multiplizieren. Dagegen zeigt die Multi-Vendor-Tabelle 3.6 Flash, der agentische Programmierung an GPT-5.6 Luna und Wissenarbeit an Claude Sonnet 5 verliert, das ist der korrekte Trade für ein Modell in dieser Klasse statt ein Fehler.

Die praktische Version: default Agent-Loops zu ihm, schicke Massen-Extraktion runter, halte Frontier-Programmierung auf Frontier-Modellen, und messe effektive Kosten pro komplette Task statt pro-Token-Raten, weil das der einzige Nummer ist in dem der Token-Effizienz-Gewinn auftaucht. Das ist wie du Gemini 3.6 Flash ohne Bezahlen von Frontier-Preisen für Arbeit die es schon gut macht nutzt, oder erwarten dass es Reihen gewinnt wo es klar verliert.

Referenzen

  1. Google. Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber. Abgerufen Juli 2026 von blog.google/technology/google-deepmind
  2. Google DeepMind. Gemini 3.6 Flash model card. Abgerufen Juli 2026 von deepmind.google/models/gemini
  3. Google DeepMind. Introducing Gemini 3.5 Flash Cyber and CodeMender. Abgerufen Juli 2026 von deepmind.google/discover/blog
  4. Artificial Analysis. Gemini 3.6 Flash — intelligence, performance, and price analysis. Abgerufen Juli 2026 von artificialanalysis.ai/models
  5. OfficeChai. Gemini 3.6 Flash beats Gemini 3.5 Flash and Gemini 3.1 Pro on most benchmarks. Abgerufen Juli 2026 von officechai.com

Weiterführendes Lesen