
Gemini 3.6 Flash の使い方:速度、料金、制限事項
Gemini 3.6 Flash の使い方:ベンチマーク、Luna と Sonnet 5 に負ける場面、API 4 つの破壊的変更、Flash-Lite と Cyber。
2026 年 7 月 21 日に Google は 1 つの発表で 3 つの Gemini モデルをリリースしました:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、および制限付きセキュリティ専門家の Gemini 3.5 Flash Cyber[1]。Pro モデルなし、基調講演なし、新しいインテリジェンスの限界に関する主張なし。このリリース全体が主張していることは 1 つです:本番環境でエージェントを実行しているチームは、より大きなモデルではなく、タスクあたりのトークン数と遅延をより少なくする必要があります。
このフレーミングから、このモデルの対象者がわかります。Gemini 3.6 Flash を上手に使うことを学ぶことは、ほぼ複合数学についてです。Google は出力価格を削減し、モデルも同じ作業をするために少ないトークンを出力するため、これら 2 つの効果が乗算されるからです。このガイドでは、公式ベンチマークデータ、3.6 Flash が GPT-5.6 Luna と Claude Sonnet 5 に明らかに負ける場所、引き継がれたコードを破壊する 4 つの API 変更、および 3 つのモデルのどれが実際にワークロードに適合するかについて説明します。
TL;DR:2026 年 7 月 Gemini Flash ラインアップ
| モデル | 100万トークンあたりのリスト価格 | ポジショニング |
|---|---|---|
| Gemini 3.6 Flash | 入力 $1.50 / 出力 $7.50 | コーディング、エージェント、ナレッジワークの主力馬。3.5 Flash より出力トークンがおよそ 17% 少ない[4] |
| Gemini 3.5 Flash-Lite | 入力 $0.30 / 出力 $2.50 | 3.5 シリーズで最速のモデル、出力トークン毎秒 350 個[4]。大量パイプライン向け |
| Gemini 3.5 Flash Cyber | 非公開価格 | DeepMind の CodeMender エージェント内の脆弱性検出機。政府と検証済みパートナーのみ[3] |
同じ投稿に隠された 2 つのロードマップ注記があります:Gemini 3.5 Pro はパートナーテスト中で、公開日なし。Google は Gemini 4 の最も雄大な事前学習実行をすでに開始していることを確認しました[1]。
reAPI では、Gemini 3.6 Flash は 100 万トークンあたり入力 $1.20、出力 $6.00 で動作します。これは Google の公開レートの 80% です。Flash-Lite と Flash Cyber はゲートウェイにはありません。
効率性の動き

Gemini 3.6 Flash は 100 万入力トークンあたり $1.50、100 万出力トークンあたり $7.50 の費用がかかり、キャッシュされた入力は 100 万あたり $0.15[1]。前任者は 100 万出力あたり $9 を請求していたため、Google は出力価格をおよそ 17% 削減しながら全体的にベンチマークスコアを向上させました。
定価は話の小さい方です。Artificial Analysis は 3.6 Flash が同じワークロード上で 3.5 Flash よりもおよそ 17% 少ない出力トークンを消費していることを測定しました[4]。Google は Datacurve の DeepSWE ベンチマークで最大 65% のトークン削減を報告しました[1]。モデルはまた、多段階作業を完了するのに必要な推論ステップとツール呼び出しが少なくなります。
タスクあたり数十回ループするエージェントの場合、これらの効果が積み重なります:より安いトークン、より少ないトークン、より少ないループ。トークンあたりの価格比較は、ギャップを過小評価します。
独自の前任者に対する公式ベンチマーク

Google の起動チャートは、4 つのエージェンティックベンチマークで 3.6 Flash と 3.5 Flash と古い 3.1 Pro を比較しています[1]。
| ベンチマーク | Gemini 3.1 Pro | Gemini 3.5 Flash | Gemini 3.6 Flash |
|---|---|---|---|
| DeepSWE v1.1 (長期地平線ソフトウェアエンジニアリング) | 12% | 37% | 49% |
| MLE-Bench (機械学習エンジニアリング) | 42.6% | 49.7% | 63.9% |
| GDPVal-AA v2 (ナレッジワーク、Elo) | 965 | 1349 | 1421 |
| OSWorld-Verified (コンピュータの使用) | 76.2% | 78.4% | 83.0% |
Google の評価方法論にはさらに 3 つの前世代に対する増益があります:SWE-Bench Pro は 55.1% に対して 58.7%、Terminal-Bench 2.1 は 76.2% に対して 78.0%、および GDM-MRCR v2 長期文脈検索テストは完全な 100 万トークン深度で、3.6 Flash は両方の前任者を 27% 以下に対して 54.0% で大まかに 2 倍にしました[5]。
モデルカードから:ナレッジカットオフは 2025 年 1 月から 2026 年 3 月に移動し、コンテキストエンベロープは入力 100 万個と出力 64K トークンのままで、モデルはテキスト、画像、オーディオ、ビデオをネイティブに受け入れます[2]。
3.6 Flash が勝つ場所と負ける場所
Google のチャートは Gemini を Gemini と比較するだけです。ここは 2026 年半ばの公開結果を使用したクロスベンダーの図[5]です。
| ベンチマーク | Gemini 3.6 Flash | GPT-5.6 Luna | Grok 4.5 | Claude Sonnet 5 |
|---|---|---|---|---|
| DeepSWE v1.1 | 49% | 67% | n/a | n/a |
| Terminal-Bench 2.1 | 78.0% | 84.7% | n/a | n/a |
| SWE-Bench Pro | 58.7% | n/a | 64.7% | n/a |
| MLE-Bench | 63.9% | n/a | n/a | 66.9% |
| GDPVal-AA v2 (Elo) | 1421 | n/a | n/a | 1607 |
| OSWorld-Verified | 83.0% | n/a | n/a | n/a |
どのモデルもボードを一掃しておらず、3.6 Flash はそうしようとしていません。OSWorld-Verified コンピュータの使用、両方の CharXiv チャート推論バリアント、および両方の GDM-MRCR 長期文脈テストでリード[5]。これらは、Google が一貫して所有してきた、マルチモーダルと長期文脈のレーンです。
明らかに GPT-5.6 Luna はエージェンティックなコーディング、DeepSWE と Terminal-Bench の両方で遅れています。Claude Sonnet 5 は ML エンジニアリングとナレッジワークで遅れており、Sonnet 5 の GDPVal-AA の 1607 Elo は 3.6 Flash の 1421 とは異なる重量級です[5]。
独立した読みが同意します。Artificial Analysis は 3.6 Flash をインテリジェンス指数で 50、追跡された 187 モデルのうち 21 位にスコアします。それは限界インテリジェンスではなく、Google はそれを主張していません。同じ評価はそのクラスで出力速度で最初で 303.6 トークン毎秒として、そのトークン使用を相当にコンパクトだと説明し、高い思考努力の下で最初のトークンまでの時間は 11.54 秒であり、そのティアの遅い端に座っていることに注意[4]します。
クロスベンダー表を引用する前の 1 つの方法論の注意:ベンダースコアは通常、各モデルの最大思考構成で報告され、エージェント治具はベンダー間で異なります。小さなギャップはノイズとして扱い、大きなものだけをシグナルとして扱います。
実用的な読み。仕事が生のコードエージェント馬力の場合、GPT-5.6 Luna と Claude Sonnet 5 は依然として数倍の価格でボードの上部を保持しています。仕事がコンピュータの使用、文書が重いマルチモーダル作業、または大規模での長期文脈検索である場合、3.6 Flash はその括弧内でドル当たりの最良のスコアを提供します。
Gemini 3.5 Flash-Lite
2 番目のリリースは曲線の反対側を対象としています。Flash-Lite は Artificial Analysis で測定された毎秒 350 の出力トークンで実行され、100 万入力あたり $0.30、100 万出力あたり $2.50 で価格設定されています。これは 3.6 Flash のレートの 5 分の 1 と 3 分の 1[1][4]です。

世代間のジャンプはリリースの他のどこよりもここではより大きい[1]:
- Terminal-Bench 2.1:3.1 Flash-Lite の 31.0% に対して 54.0%、エージェンティック端末コーディングで 23 ポイント移動。
- GDPVal-AA v2:642 に対して 1140 Elo、実際のナレッジワークでほぼ 2 倍。
- GDM-MRCR v2 長期文脈:60.1% に対して 72.2%。
一時停止する価値がある比較は、古く、より大きな 3 Flash に対する比較です:Flash-Lite は SWE-Bench Pro を 49.6% に対して 54.2%、OSWorld-Verified を 65.1% に対して 74.0% で勝っています[1]。最も安い現在のモデルは、コーディングとコンピュータの使用で前の世代の中位ティアを打ちます。
Google はそれを高スループット作業に配置しています:エージェンティック検索、バルク文書処理、分類、サブエージェントファンアウト、思考レベルは最小限で設定可能、デフォルト、高い[1]。
Gemini 3.5 Flash Cyber
3 番目のモデルは、Google が売らないモデルです。Flash Cyber は 3.5 Flash のバージョンで、セキュリティ脆弱性を検出、検証、修正するために微調整され、限定されたパイロットで政府と信頼できるパートナーのためだけに CodeMender DeepMind のコード セキュリティエージェントの内側に船舶[3]。
微調整は数人の研究室が持つ資産に寄りかかっています:700,000 以上のオープンソース脆弱性の OSV.dev データベース、10 年以上の OSS-Fuzz 結果、および Chromium を含む Google スケールコードベースからのセキュリティワークフロー データ[3]。CodeMender 内で、複数の Flash Cyber サブエージェントが異なるコードパスを分析し、結論を 1 つのレポートにマージします。これが建築賭けです:安いモデルは最大 5 回呼び出され、はるかに大きいものへの単一呼び出しを競います。

| システム | CyberGym スコア |
|---|---|
| OpenAI エージェント内の GPT-5.5-Cyber | 85.6% |
| Anthropic エージェント内の Claude Mythos 5 | 83.8% |
| OpenAI エージェント内の GPT-5.6 Sol | 83.6% |
| CodeMender 内の Gemini 3.5 Flash Cyber (最大 5 呼び出し) | 83.2% |
| Anthropic エージェント内の Claude Mythos Preview | 83.1% |
正直に読んでください:Flash Cyber はチャートの一番上にはありません。OpenAI の専用 GPT-5.5-Cyber は 2.4 ポイント先行し、Mythos 5 は 0.6 でそれをエッジします。Google の主張は Flash サイズのモデルからの競争力のあるパフォーマンスで、これはクラウンではなくコスト請求[3]です。
それが勝つ場所は Google 自身のより深い評価です。V8 JavaScript エンジン テストでは、ストック 3.5 Flash の 47 に対して 55 個のユニークな実問題と Claude Opus 4.6 の 36 を確認しました。他のモデルが見つけた 10 を含む[3]。Google の Cloud Vulnerability Research チームは、それを使用して本番環境のメモリ破損脆弱性を見つけ、ASLR と W^X をバイパスしながら 2 時間以内にワーキング エクスプロイト チェーンを構築したことを報告しています[3]。
これが紐を説明します。Google は機能が二重使用であると述べており、検証済みのディフェンダーへのアクセスを制限し、CodeMender のレポートワークフロー内でのみ展開し、パッチが配出される前に人間の承認を必要とします[3]。
Gemini 3.6 Flash を使用する方法:古いコードを破壊する 4 つの API 変更
モデルカードは 3.6 Flash を 3.5 Flash に基づいて説明しており、同じネイティブマルチモーダル スパース推論基盤と同じ 1M/64K エンベロープで、利益はベースモデルではなく学習後から来ています[2]。リクエスト サーフェスが仕事をしている場所です。
- モデル ID は
gemini-3.6-flashとgemini-3.5-flash-lite[1]です。 thinking_budgetはthinking_level文字列列挙に置き換えられます。 3.6 Flash はmediumに、Flash-Lite はminimalにデフォルト設定[1]です。- 古典的なサンプリングノブは消えています。
temperature、top_p、top_kは削除され、リクエスト ペイロードから削除する必要があります[1]。 candidate_countはサポートされていません。プリフィルモデルは、非空のモデルロールで終わる会話をこっそり否定することを意味します[1]。
両方の公開モデルは、コンピュータの使用、検索グラウンディング、コード実行を含む、完全な組み込みツール スイートを公開しています[1]。3.5 Flash から来て、移行はモデル文字列の変更と非推奨パラメータの削除です。新しい SDK サーフェスを学ぶ必要はありません。
どのモデルを選ぶべきか
公開番号からまっすぐにルーティング ヒューリスティック:
- 3.6 Flash にデフォルトしてください。コーディング、コンピュータの使用、文書の解析、または何かマルチステップが関係するエージェント ループ。トークン効率利益がエージェント コストが爆発する場所でまさに複合です。
- バルク、レイテンシ を考慮した作業を Flash-Lite にルーティングしてください:抽出、分類、検索要約、サブエージェント ファンアウト。サンプリング品質チェックが必須だと言うときのみ
thinking_levelを上げてください。 - フロンティア コーディングをフロンティア モデルに保つ。 DeepSWE クラスの自律性が仕事の場合、正直な数は GPT-5.6 Luna と Claude Sonnet 5 が依然として 3.6 Flash ができないタスクを終了し、低ボリュームの高い賭けられた実行でのプレミアムは価値があるかもしれません。
- Flash Cyber は選択肢ではありません。 あなたが政府またはパイロットへの招待されたパートナーでない限り。
Gemini 3.6 Flash を他のモデルと並行して呼び出す
そのルーティング リストが実際に言っていることに注意してください。4 つの箇条書き中 3 つは仕事を Gemini 以外の場所に送ります。Google 自身のベンチマーク テーブルから正直な結論は、3.6 Flash がトラフィックの一部に勝つべきであり、残りを失うべきであり、分割はベンダーが配出するたびに移動するということです。
reAPI は Gemini 3.6 Flash を OpenAI 互換性 /v1/chat/completions エンドポイント経由で公開しており、クライアントはすでに GPT と Claude を呼び出しており、それも呼び出しています。ワイヤー モデル ID が Google のドットを保つことに注意してください:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_REAPI_KEY",
base_url="https://api.reapi.ai/v1",
)
resp = client.chat.completions.create(
model="gemini-3.6-flash",
messages=[{"role": "user", "content": "このレポートを要約し、数字を引き出してください。"}],
max_tokens=16000,
stream=True,
)ゲートウェイ上のレート は 100 万入力トークンあたり $1.20、100 万出力トークンあたり $6.00 で、これは Google の公開 $1.50 / $7.50 の 80% です。ゲートウェイはこのモデルのネイティブ Gemini エンドポイント タイプも公開しているため、Google 自身の形式に対して書かれた SDK は書き直しなしで機能します。現在のレートとリクエスト サーフェスは reapi.ai/models/gemini-3-6-flash と reapi.ai/docs/gemini-3-6-flash にあります。
明確にするために:Flash-Lite と Flash Cyber はゲートウェイにはありません。Flash Cyber は、Google のパイロットの外部の誰にも利用できません。それをどのように呼び出すかに関係なく。
FAQ
Gemini 3.6 Flash は実際に 3.5 Flash より安いですか?
はい、出力:100 万トークンあたり $9 に対して $7.50、ほぼ 17% 削減。モデルは同じ仕事でおよそ 17% 少ないトークンを出力するため、完成したタスクあたりの有効コストは定価よりも多く低下します。キャッシュされた入力は 100 万あたり $0.15[1][4]です。
Gemini 3.6 Flash のコンテキスト ウィンドウとは何ですか?
100 万入力トークンと 64K 出力トークン、テキスト、画像、オーディオ、ビデオをネイティブで受け入れる[2]。
3.5 Flash からアップグレードするコードを変更する必要がありますか?
最小限。モデル文字列を gemini-3.6-flash に交換し、thinking_budget を thinking_level で置き換え、リクエストから temperature、top_p、top_k、candidate_count を削除してください[1]。
Gemini 3.6 Flash は GPT-5.6 Luna または Claude Sonnet 5 より優れていますか?
エージェンティックなコーディングではありません。Luna は DeepSWE 67% 対 49% と Terminal-Bench 84.7% 対 78.0%、Sonnet 5 リード MLE-Bench と GDPVal-AA を導く[5]。Gemini 3.6 Flash はコンピュータの使用、チャート推論、長期文脈検索で勝ち、価格のほんの一部です。
Gemini 3.5 Flash Cyber にアクセスできますか?
政府機関またはパイロット CodeMender の招待されたパートナーでない限りはいいえ[3]。
Gemini 3.5 Pro に何が起こったのですか?
それはパートナー テストに残り、発表された日付なし、Google は Gemini 4 の事前学習がすでに進行中であることを確認しました[1]。
Gemini 3.6 Flash はどの程度高速ですか?
Artificial Analysis はそのクラスで出力速度で 303.6 トークン毎秒で最初にランクしていますが、高い思考努力で最初のトークンまでの時間は 11.54 秒で、そのティアの遅い端です[4]。人が見るものをストリーミングしてください。
OpenAI SDK で Gemini 3.6 Flash を呼び出すにはどうすればよいですか?
OpenAI クライアントを https://api.reapi.ai/v1 に指し、model を ID のドットを保ちながら gemini-3.6-flash に設定してください。エンドポイントは OpenAI 互換性であるため、SDK の書き換えは必要ありません。
ユニット経済学で競争するリリースを読む
このローンチは機能の動きではなく価格の動きとして理解する価値があります。Google は Pro ティアを配出、フロンティア請求を作られ、エンジニアリングを何が代理費用を決定する 2 つの数に入れました:トークンあたりの価格とタスクあたりのトークン。両方がおよそ 17% 下がり、彼らは乗算します。これに対して、クロスベンダー表は 3.6 Flash が GPT-5.6 Luna へのエージェンティックコーディングを失い、Claude Sonnet 5 へのナレッジワークを失っていることを示しています。これは、この括弧のモデルの欠陥ではなく、正しい取引です。
実用的なバージョン:エージェント ループをそれにデフォルト、バルク抽出を低くルーティング、フロンティア モデルのフロンティア コーディングを保ち、トークン効率利益が表示される唯一の数であるため、完成したタスクあたりの有効なコストを測定してください。それは Gemini 3.6 Flash を フロンティア価格でそれはそれはすでに十分に実行する仕事をどうするかを知ることなく使用し、それはそれははっきりと失う行をそれが勝つことを期待することなく使用する方法です。
参考文献
- Google. Gemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber の導入。 2026 年 7 月から blog.google/technology/google-deepmind から取得しました。
- Google DeepMind. Gemini 3.6 Flash モデルカード。 2026 年 7 月から deepmind.google/models/gemini から取得しました。
- Google DeepMind. Gemini 3.5 Flash Cyber と CodeMender の導入。 2026 年 7 月から deepmind.google/discover/blog から取得しました。
- Artificial Analysis. Gemini 3.6 Flash — インテリジェンス、パフォーマンス、価格分析。 2026 年 7 月から artificialanalysis.ai/models から取得しました。
- OfficeChai. Gemini 3.6 Flash は大ベンチマークで Gemini 3.5 Flash と Gemini 3.1 Pro に勝る。 2026 年 7 月から officechai.com から取得しました。
さらに読む
- reAPI. Claude Opus 5 の使い方。 reapi.ai/blog/how-to-use-claude-opus-5
- reAPI. Gemini 3.6 Flash エンドポイント リファレンス。 reapi.ai/docs/gemini-3-6-flash
- reAPI. モデル カタログ。 reapi.ai/models
著者

カテゴリ
他の記事

Seedream 5 Proのコンテンツフィルター:何がブロックされるのか
Seedream 5 Proのコンテンツフィルターは複数の層で実行され、拒否時にどの層が該当したかはほとんど明記されません。各層がブロックする内容と、不変の制限についても解説します。


GPT-5.5の使い方:エージェント型の強みと唯一の弱点
GPT-5.5の使い方を詳しく解説。Terminal-Benchでの首位獲得、見た目より小さい価格上昇の実態、誰も言及しない86%幻覚率、そして必要な検証ループについて。


Hailuo AI料金徹底比較:他のAI動画生成との差
Hailuo AIのMiniMax H3をSeedance 2.5、Kling 3.0、Veo 3.1と比較。秒単価、動画長、音声、参照入力の違いを解説します。
