
GPT-5.6の使い方:Sol、Terra、Luna比較ガイド
GPT-5.6の使い方:Sol・Terra・Lunaの料金比較、Terminal-Benchのポイント、新しいmax・ultraモード、そして最適なtierの選び方を解説します。
OpenAIは2026年6月26日にGPT-5.6の限定プレビューを開始しましたが、最も奇妙だったのはほぼ誰も使用できなかったことです。アクセスはAPIとCodexを通じ、米国政府の要請に基づいた段階的ロールアウトのなか、約20の厳選パートナーに限定されました[1]。
その制限は解除されました。GPT-5.6の使い方は、いま待機ゲームではなく実践的な課題であり、答えは主に3つのtierのいずれかを選ぶことになります:Solはフラッグシップ、Terraはバランス型の主力、Lunaはコスト重視モデル。それぞれは一時的な変種ではなく、1つの世代番号の下で安定したcapability tierです。
本ガイドは、3 tierの設計、OpenAIが推す基準ベンチマークと4つのアスタリスクの意味、新しいmaxとultra reasoning mode、Terraを語る価格設定、そしてこのロールアウトを形作ったcybersecurity審査を説明します。
TL;DR
- 3つの安定したtier。 Sol(フラッグシップ)、Terra(バランス型、GPT-5.5比で約2分の1の価格)、Luna(高速で低コスト)[1]。
- SolがTerminal-Bench 2.1を制覇:単一エージェント時88.8%、
ultramode時91.9%。Claude Mythos 5対比での差は0.8ポイントで、ノイズ幅内です[1]。 ultraは1エージェントではなく複数エージェント。 並列でサブエージェントをオーケストレートするため、スコアは単一エージェント・ベースラインとは直接比較できません[1]。- Terraが商業的な魅力。 GPT-5.5クラスのコーディング能力を半額で提供[1]。
- reAPIではすべてのtierがOpenAI公表レートの80%で利用可能:Sol $4.00 / $24.00、Terra $2.00 / $12.00、Luna $0.80 / $4.80(100万トークンあたり)。
- 評価範囲は意図的に限定。 OpenAIはコーディング、生物学、cybersecurityのみを公開し、SWE-bench、GDPval、数学、幻覚測定は保留[1]。
GPT-5.6とは何か
GPT-5.6は、2026年4月に完全に再学習されたagentic modelのGPT-5.5の後継です。GPT-5.5が1つのmodelで複数のreasoning-effortレベルを提供していたのに対し、GPT-5.6は1つの世代番号の下に3つのtierをもつfamilyとなります。OpenAIの説明は明確です:世代番号は生成を識別し、Sol、Terra、Lunaはそれぞれ独立した進化が可能な安定したcapability tierを示しています[1]。
この方針は、本リリースの最も重要な設計判断です。「どの程度スマートか」を「どの程度新しいか」から切り離しています。将来の世代がSolに手を入れないで新しいLunaを提供できますし、SolのアップグレードがTerraのすべてのユーザーにパイプラインの再テストを強制することもありません。
| Tier | ポジショニング |
|---|---|
| GPT-5.6 Sol | フラッグシップで、新しいmaxとultra reasoning modeの唯一の提供者。cybersecurityと長期エージェントtask向け |
| GPT-5.6 Terra | バランス型の主力。GPT-5.5と同等の機能で約2分の1の価格。ほとんどのproductionワークロードに適合 |
| GPT-5.6 Luna | 高速で低コスト。大容量の定型業務向け |
複数のサードパーティ報告では、SolのコンテキストウィンドウをGPT-5.5世代から43%大きい約1.5ミリオントークンと推定しています。ただし、OpenAIのプレビューポストは仕様表より安全性と評価に焦点を当てていました[1]。この数字は報告値として扱い、公式確認ではないと理解してください。
Terminal-Bench 2.1と4つのアスタリスク
OpenAIはプレビューでコーディング、生物学、cybersecurityの3つのベンチマーク領域のみを公表し、残りはGA時点の発表に保留しています[1]。最重要はTerminal-Bench 2.1で、計画と反復とツール調整が必要なagenticコマンドラインワークフローをテストします。

| Model | Terminal-Bench 2.1 |
|---|---|
GPT-5.6 Sol (ultramode) | 91.9% |
| GPT-5.6 Sol | 88.8% |
| Claude Mythos 5 | 88.0% |
| GPT-5.6 Terra | 84.3% |
| Claude Fable 5 | 84.3% |
| GPT-5.5 | 83.4% |
| GPT-5.6 Luna | 82.5% |
| Claude Opus 4.8 | 78.9% |
| Gemini 3.1 Pro Preview | 70.7% |
よく読む必要があります。この表は「新しいstate of the art」という見出しから想像する以上に正直です。4つの理由があります[1]。
91.9%の記録はultraを使用していますが、これは単一エージェントではなく。 Solが複数のサブエージェントをオーケストレートした結果です。単一エージェント・ベースラインとの比較はりんごとみかんです。公正な比較はSolの88.8%です。
単一エージェント・SolはClaude Mythos 5を0.8ポイント上回ります。 同じmodelの2度の実行で0.8ポイント以上の差は珍しくありません。OpenAIはコーディング曲線の頂点で実質的な利点を保有しますが、このベンチマークでは狭い差です。
TerraはClaude Fable 5と同等で、GPT-5.5をわずかに上回ります。 84.3%はFable 5と完全に一致し、前世代より1ポイント未満です。価格低下と組み合わせると、これが真の商業的価値です:同じコーディング能力を半額で実現。capabilityの飛躍ではありません。
Gemini 3.1 Pro Previewは約21ポイント遅れています。 この差は実在しますが、ベンチマーク限定です。Geminiは長文コンテキスト検索やマルチモーダル作業では他で優位性を示しており、ここでは測定されていません。
生物学については、OpenAIはSolがGPT-5.5より強いGeneBench v1結果を達成し、より少ないtokenを消費していると報告します。ただし生のデータは非公表のため、検証可能なスコアではなく方向性ある主張です[1]。
maxとultra
最も重要な追加はベンチマーク表には載りません。GPT-5.6は2つのreasoning設定を導入し、どちらもSoloのみの提供です[1]。

max は既出の思考レバーをさらに進めたもの:単一エージェントが1つの難しい問題に最大限の時間をかけて思考します。
ultra は本当に新しいプリミティブです。単一エージェントを超え、複雑な作業を並列パーツに分割して再統合するサブエージェントを展開します。これはOpenAIが複数エージェント・オーケストレーションを単一modelのendpointに組み込むこと。過去1年、開発者がフレームワークで手作業してきたパターンです。
実践的な意味は明確です:マルチファイルリファクターやエンドツーエンド監査では、オーケストレーション層を自分で構築する必要がなくなります。代わりにコストと遅延が問題になります。複数エージェントはより多くの合計tokenとより長い実行時間を意味するからです。結果を変える数ポイントの価値がある高リスクtaskにultraを限定してください。
また、ベンチマーク比較は慎重になる必要があります。複数エージェントを静かに展開するエージェントが出したスコアは、単一フォワードパスとは異なる種類の成果です。
価格設定

| Tier | OpenAI公表(入力/出力・100万tokenあたり) | reAPI価格(入力/出力・100万tokenあたり) |
|---|---|---|
| GPT-5.6 Sol | $5 / $30 | $4.00 / $24.00 |
| GPT-5.6 Terra | $2.50 / $15 | $2.00 / $12.00 |
| GPT-5.6 Luna | $1 / $6 | $0.80 / $4.80 |
OpenAIの数字で2つが目立ちます。SolはGPT-5.5の正確な$5/$30価格を保ったまま機能を追加。新しいmodeも付属。これは同じ価格でより多く手に入る稀なケースです。そしてTerraはGPT-5.5級のコーディング能力を半額で。ほとんどのチームが実際に感じる変化です[1]。Solのtoken効率改善を加えれば、それは比較可能な結果をより少ないoutput tokenで達成するため、task単位の実質的なコスト削減は公表レートより大きいです。
全tierはreAPI上でOpenAIリスト価格の80%です。tier間の相対経済性は変わりません。Terraはデフォルト、Lunaはボリュームplayのままです。
GPT-5.6はPrompt Cachingも再構成:明示的なキャッシュ切断点と30分のキャッシュ最小生存期間を追加。キャッシュ書き込みはキャッシュなし入力レートの1.25倍に請求。キャッシュ読み込みは90%割引を保持します[1]。毎ステップで大きなsystem promptを再送信するエージェントの場合、予測可能なキャッシュが請求額を支配できます。
ロールアウトを形作った審査
アクセスが解放された今でも理解する価値があります。これは脚注ではなく先例だからです。
OpenAIは、ローンチ前にmodelの能力をプレビューした後、米国政府の要請で初期リリースを約20の厳選パートナーに限定しました[1]。きっかけはcybersecurity能力。SolはVulnerability Researchを著しく前進させ、ChromiumとFirefoxを含む評価では、exploitの構成要素となるBugとexploitation primitiveを自動抽出しました。テスト条件下では機能的なfull-chain exploitの自動生成はしません。OpenAIはSolがPreparedness FrameworkのCyber Critical閾値を超えないと述べており、この区別がリリースの全体的理由です[1]。
注目すべきことに、OpenAIはこの配置を常設化しないと述べています。この手の政府アクセス・プロセスは長期デフォルトにはならないべきと。なぜなら、それを必要とする防御側から最良のツールを奪うからです[1]。
共に出荷されたセキュリティスタックは知る価値があります。高capability modelが今後どう出荷されるかを予示するからです:訓練済みrefusal、生成を一時停止して大きなmodelで検証できるreal-time cyberと生物学classifier、フラグ付きactivity対象のaccount層審査、最機密capabilityへの差別化アクセス。OpenAIは普遍的jailbreak対する自動化red-teamingに70万以上のA100相当GPU時間を投下[1]。
OpenAIは正直です:このsafeguardは時に失敗します。正当なsecurity研究者がdual-use requestでrefusalに遭遇することもあります。
主張が強い場所と弱い場所
強い。 Agenticコマンドラインコーディング。単一エージェント・SolがベンチマークをリードしてUltraがそれを拡張。Token効率。大容量エージェントでは複合効果が出ます。Mid-tierの価値。Terraの価格低下はリリースで最も広く有用な改善。そしてネイティブな複数エージェント・オーケストレーション。開発者が手で作ってきた層が不要になります[1]。
弱い。 見出しは1ベンチマーク・0.8ポイント勝利。評価範囲は意図的に狭い。SWE-bench、GDPval、数学、幻覚測定は非公表。GPT-5.6がGPT-5.5を悩ませた信頼できる幻覚問題を修正したかは不明。すべてOpenAIの自社harness下のvendor報告[1]。
拡張テストスイートと独立スコアリングが登場するまで、汎用能力への判断は保留されるべきです。
GPT-5.6の使い方:どのtierを選ぶか
ほとんどのproductionworkloadにはTerra。 GPT-5.5級の能力を約半額で提供。ベンチマークはそのコーディングがClaude Fable 5と同等と示します。
Long-horizonコーディング、security作業、ultraを正当化するもの向けSol。 サブエージェント・オーケストレーションは、数ポイント差がoutcome変える高risk taskでは実質的価値。定型callでは価値なし。
大容量、latency-sensitive、定型traffic向けLuna。 Terminal-Bench 82.5%はGPT-5.5の83.4%から遠くなく、コストは大幅に低い。
reAPIでGPT-5.6を呼び出す
3つのtierは皆、単一のOpenAI互換/v1/chat/completions endpointの背後に在ります。tierの切り替えはintegrationではなく、model-string変更です。wire IDはOpenAIの点を保ちます:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_REAPI_KEY",
base_url="https://api.reapi.ai/v1",
)
resp = client.chat.completions.create(
model="gpt-5.6-terra",
messages=[{"role": "user", "content": "Refactor this module and add tests."}],
max_tokens=16000,
stream=True,
)tierを変えるにはgpt-5.6-terraをgpt-5.6-solまたはgpt-5.6-lunaに置き換えてください。同じkeyとclientがClaudeとGeminiも到達するため、tier選択とvendor選択は同じ型の決定になります。ベンチマーク表がデフォルト・modelを1行失わせ別行を勝たせるときの要点です。
現行レートはreapi.ai/models/gpt-5-6-sol、reapi.ai/models/gpt-5-6-terra、reapi.ai/models/gpt-5-6-lunaに在ります。
FAQ
maxとultra mode間の違いは何ですか?
maxは単一エージェントが1つの問題に長く深く思考。ultraは複数サブエージェントをオーケストレートし、複雑な作業を並列分割・再統合。どちらもSolo独占。ultraが91.9%見出しを生成[1]。
GPT-5.6 SolはコーディングでClaudeより優れていますか?
Terminal-Bench 2.1では単一エージェント・Sol 88.8%がClaude Mythos 5(88.0%)を0.8ポイント上回り。実質的ですが狭い。ultraではSol 91.9%に到達ですがサブエージェント使用のため直接比較ではありません[1]。
どのGPT-5.6 tierを使うべきですか?
ほとんどのproduction workloadにはTerra。GPT-5.5級能力を約半額で。Long-horizonコーディング、security、またはultraを正当化するtaskにはSol。大容量定型callにはLuna[1]。
なぜ米国政府が関わったのですか?
SolはVulnerability Research含むcybersecurity能力を著しく前進。OpenAIのCyber Critical閾値超過なし。政府要請でOpenAIは約20の厳選パートナー向け段階的プレビューを実施。cyberフレームワーク開発と並行[1]。
GPT-5.6はGPT-5.5の幻覚問題を修正しましたか?
不明。OpenAIはプレビューでコーディング、生物学、cybersecurity評価のみ公表。幻覚と知識task測定は保留[1]。High-stakes outputはsource-grounded検証と組み合わせてください。
GPT-5.6 Solのコンテキストウィンドウ大きさは?
サードパーティ報告は約1.5ミリオン token。GPT-5.5世代比43%大きい推定。OpenAIプレビュー記事は仕様表確認なし[1]。
Prompt Cachingで何が変わりましたか?
明示的キャッシュ切断点と30分minimum cache生存期間。キャッシュ書き込みはキャッシュなし入力レートの1.25倍請求。キャッシュ読み込みは90%割引保持[1]。
OpenAI SDKでGPT-5.6をどう呼び出しますか?
clientをhttps://api.reapi.ai/v1指向。modelをgpt-5.6-sol、gpt-5.6-terra、gpt-5.6-lunaにセット。IDの点保持。
3-tierリリースを読む
GPT-5.6は1つのアナウンスメント内の2つのリリースです。1つは通常の・実行されたfamily更新:合理的naming reset、コスト半減化でcapability失なし、マルチエージェント・オーケストレーションをendpoint内に焼き込むultra mode。もう1つはfrontier model。初期可用性は政府と調整設定、70万GPU時間のsecurity stackの背後から出荷。
実際に構築する人向けに、有用な要約はどちらの話より小さい。頂部のベンチマーク・リード0.8ポイント。vendor報告。感じる変化はTerraの価格。これがGPT-5.6の思慮深い使い方:mid-tierをデフォルト。ultraを正当化するtask向けSolをリザーブ。拡張評価スイートが幻覚問題の動向を教えるまで、source-grounded検証を継続。
参考文献
- OpenAI. モデル — GPT-5.6 family、reasoning mode、仕様。 2026年7月取得 platform.openai.com/docs/models
- OpenAI. 価格設定 — model・tier別per-tokenレート。 2026年7月取得 platform.openai.com/docs/pricing
さらに詳しく
- reAPI. Claude Opus 5の使い方。 reapi.ai/blog/how-to-use-claude-opus-5
- reAPI. Claude Fable 5の使い方。 reapi.ai/blog/how-to-use-claude-fable-5
- reAPI. Modelカタログ。 reapi.ai/models
著者

カテゴリ
maxとultra価格設定ロールアウトを形作った審査主張が強い場所と弱い場所GPT-5.6の使い方:どのtierを選ぶかreAPIでGPT-5.6を呼び出すFAQmaxとultra mode間の違いは何ですか?GPT-5.6 SolはコーディングでClaudeより優れていますか?どのGPT-5.6 tierを使うべきですか?なぜ米国政府が関わったのですか?GPT-5.6はGPT-5.5の幻覚問題を修正しましたか?GPT-5.6 Solのコンテキストウィンドウ大きさは?Prompt Cachingで何が変わりましたか?OpenAI SDKでGPT-5.6をどう呼び出しますか?3-tierリリースを読む参考文献さらに詳しく他の記事

Sora 2 API停止:エクスポート・マイグレーション・実コスト検証
Sora 2 API は2026年9月24日に停止。公式代替なし。動画をエクスポート、APIエンドポイントを書き換え、各プランの実コストを検証します。


Seedance 2.1とSeedance 2.0 Mini:登場するもの
Seedance 2.1は品質が20%向上し、Seedance 2.0 Miniは低価格になるとの情報があります。情報源、ByteDanceの否定、公開への備えを整理します。


DeepSeek Harness・OpenCode・Claude:ツール比較
DeepSeek Harness、OpenCode、Claude Code を、ランタイム所有権、モデル選択、プラグイン、権限、セットアップ負担、エージェントループコストで比較します。
