Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
GPT-5.6の使い方:Sol、Terra、Luna比較ガイド
2026/07/27

GPT-5.6の使い方:Sol、Terra、Luna比較ガイド

GPT-5.6の使い方:Sol・Terra・Lunaの料金比較、Terminal-Benchのポイント、新しいmax・ultraモード、そして最適なtierの選び方を解説します。

OpenAIは2026年6月26日にGPT-5.6の限定プレビューを開始しましたが、最も奇妙だったのはほぼ誰も使用できなかったことです。アクセスはAPIとCodexを通じ、米国政府の要請に基づいた段階的ロールアウトのなか、約20の厳選パートナーに限定されました[1]

その制限は解除されました。GPT-5.6の使い方は、いま待機ゲームではなく実践的な課題であり、答えは主に3つのtierのいずれかを選ぶことになります:Solはフラッグシップ、Terraはバランス型の主力、Lunaはコスト重視モデル。それぞれは一時的な変種ではなく、1つの世代番号の下で安定したcapability tierです。

本ガイドは、3 tierの設計、OpenAIが推す基準ベンチマークと4つのアスタリスクの意味、新しいmaxultra reasoning mode、Terraを語る価格設定、そしてこのロールアウトを形作ったcybersecurity審査を説明します。

TL;DR

  • 3つの安定したtier。 Sol(フラッグシップ)、Terra(バランス型、GPT-5.5比で約2分の1の価格)、Luna(高速で低コスト)[1]
  • SolがTerminal-Bench 2.1を制覇:単一エージェント時88.8%、ultra mode時91.9%。Claude Mythos 5対比での差は0.8ポイントで、ノイズ幅内です[1]
  • ultraは1エージェントではなく複数エージェント。 並列でサブエージェントをオーケストレートするため、スコアは単一エージェント・ベースラインとは直接比較できません[1]
  • Terraが商業的な魅力。 GPT-5.5クラスのコーディング能力を半額で提供[1]
  • reAPIではすべてのtierがOpenAI公表レートの80%で利用可能:Sol $4.00 / $24.00、Terra $2.00 / $12.00、Luna $0.80 / $4.80(100万トークンあたり)。
  • 評価範囲は意図的に限定。 OpenAIはコーディング、生物学、cybersecurityのみを公開し、SWE-bench、GDPval、数学、幻覚測定は保留[1]

GPT-5.6とは何か

GPT-5.6は、2026年4月に完全に再学習されたagentic modelのGPT-5.5の後継です。GPT-5.5が1つのmodelで複数のreasoning-effortレベルを提供していたのに対し、GPT-5.6は1つの世代番号の下に3つのtierをもつfamilyとなります。OpenAIの説明は明確です:世代番号は生成を識別し、Sol、Terra、Lunaはそれぞれ独立した進化が可能な安定したcapability tierを示しています[1]

この方針は、本リリースの最も重要な設計判断です。「どの程度スマートか」を「どの程度新しいか」から切り離しています。将来の世代がSolに手を入れないで新しいLunaを提供できますし、SolのアップグレードがTerraのすべてのユーザーにパイプラインの再テストを強制することもありません。

Tierポジショニング
GPT-5.6 Solフラッグシップで、新しいmaxultra reasoning modeの唯一の提供者。cybersecurityと長期エージェントtask向け
GPT-5.6 Terraバランス型の主力。GPT-5.5と同等の機能で約2分の1の価格。ほとんどのproductionワークロードに適合
GPT-5.6 Luna高速で低コスト。大容量の定型業務向け

複数のサードパーティ報告では、SolのコンテキストウィンドウをGPT-5.5世代から43%大きい約1.5ミリオントークンと推定しています。ただし、OpenAIのプレビューポストは仕様表より安全性と評価に焦点を当てていました[1]。この数字は報告値として扱い、公式確認ではないと理解してください。

Terminal-Bench 2.1と4つのアスタリスク

OpenAIはプレビューでコーディング、生物学、cybersecurityの3つのベンチマーク領域のみを公表し、残りはGA時点の発表に保留しています[1]。最重要はTerminal-Bench 2.1で、計画と反復とツール調整が必要なagenticコマンドラインワークフローをテストします。

Terminal-Bench 2.1のagenticコマンドライン・コーディングスコア。GPT-5.6 Sol(ultraモード)、GPT-5.6 Sol、Claude Mythos 5、GPT-5.6 Terra、Claude Fable 5、GPT-5.5、GPT-5.6 Luna、Claude Opus 4.8、Gemini 3.1 Pro Previewの比較

ModelTerminal-Bench 2.1
GPT-5.6 Sol (ultramode)91.9%
GPT-5.6 Sol88.8%
Claude Mythos 588.0%
GPT-5.6 Terra84.3%
Claude Fable 584.3%
GPT-5.583.4%
GPT-5.6 Luna82.5%
Claude Opus 4.878.9%
Gemini 3.1 Pro Preview70.7%

よく読む必要があります。この表は「新しいstate of the art」という見出しから想像する以上に正直です。4つの理由があります[1]

91.9%の記録はultraを使用していますが、これは単一エージェントではなく。 Solが複数のサブエージェントをオーケストレートした結果です。単一エージェント・ベースラインとの比較はりんごとみかんです。公正な比較はSolの88.8%です。

単一エージェント・SolはClaude Mythos 5を0.8ポイント上回ります。 同じmodelの2度の実行で0.8ポイント以上の差は珍しくありません。OpenAIはコーディング曲線の頂点で実質的な利点を保有しますが、このベンチマークでは狭い差です。

TerraはClaude Fable 5と同等で、GPT-5.5をわずかに上回ります。 84.3%はFable 5と完全に一致し、前世代より1ポイント未満です。価格低下と組み合わせると、これが真の商業的価値です:同じコーディング能力を半額で実現。capabilityの飛躍ではありません。

Gemini 3.1 Pro Previewは約21ポイント遅れています。 この差は実在しますが、ベンチマーク限定です。Geminiは長文コンテキスト検索やマルチモーダル作業では他で優位性を示しており、ここでは測定されていません。

生物学については、OpenAIはSolがGPT-5.5より強いGeneBench v1結果を達成し、より少ないtokenを消費していると報告します。ただし生のデータは非公表のため、検証可能なスコアではなく方向性ある主張です[1]

maxultra

最も重要な追加はベンチマーク表には載りません。GPT-5.6は2つのreasoning設定を導入し、どちらもSoloのみの提供です[1]

GPT-5.6 reasoning modeの比較。maxは単一エージェントが1つの難問に長く深く思考。ultraはオーケストレーターが複数のサブエージェントを並列展開

max は既出の思考レバーをさらに進めたもの:単一エージェントが1つの難しい問題に最大限の時間をかけて思考します。

ultra は本当に新しいプリミティブです。単一エージェントを超え、複雑な作業を並列パーツに分割して再統合するサブエージェントを展開します。これはOpenAIが複数エージェント・オーケストレーションを単一modelのendpointに組み込むこと。過去1年、開発者がフレームワークで手作業してきたパターンです。

実践的な意味は明確です:マルチファイルリファクターやエンドツーエンド監査では、オーケストレーション層を自分で構築する必要がなくなります。代わりにコストと遅延が問題になります。複数エージェントはより多くの合計tokenとより長い実行時間を意味するからです。結果を変える数ポイントの価値がある高リスクtaskにultraを限定してください。

また、ベンチマーク比較は慎重になる必要があります。複数エージェントを静かに展開するエージェントが出したスコアは、単一フォワードパスとは異なる種類の成果です。

価格設定

GPT-5.6の価格tier:Sol $5入力/$30出力、Terra $2.50/$15、Luna $1/$6(100万tokenあたり)

TierOpenAI公表(入力/出力・100万tokenあたり)reAPI価格(入力/出力・100万tokenあたり)
GPT-5.6 Sol$5 / $30$4.00 / $24.00
GPT-5.6 Terra$2.50 / $15$2.00 / $12.00
GPT-5.6 Luna$1 / $6$0.80 / $4.80

OpenAIの数字で2つが目立ちます。SolはGPT-5.5の正確な$5/$30価格を保ったまま機能を追加。新しいmodeも付属。これは同じ価格でより多く手に入る稀なケースです。そしてTerraはGPT-5.5級のコーディング能力を半額で。ほとんどのチームが実際に感じる変化です[1]。Solのtoken効率改善を加えれば、それは比較可能な結果をより少ないoutput tokenで達成するため、task単位の実質的なコスト削減は公表レートより大きいです。

全tierはreAPI上でOpenAIリスト価格の80%です。tier間の相対経済性は変わりません。Terraはデフォルト、Lunaはボリュームplayのままです。

GPT-5.6はPrompt Cachingも再構成:明示的なキャッシュ切断点と30分のキャッシュ最小生存期間を追加。キャッシュ書き込みはキャッシュなし入力レートの1.25倍に請求。キャッシュ読み込みは90%割引を保持します[1]。毎ステップで大きなsystem promptを再送信するエージェントの場合、予測可能なキャッシュが請求額を支配できます。

ロールアウトを形作った審査

アクセスが解放された今でも理解する価値があります。これは脚注ではなく先例だからです。

OpenAIは、ローンチ前にmodelの能力をプレビューした後、米国政府の要請で初期リリースを約20の厳選パートナーに限定しました[1]。きっかけはcybersecurity能力。SolはVulnerability Researchを著しく前進させ、ChromiumとFirefoxを含む評価では、exploitの構成要素となるBugとexploitation primitiveを自動抽出しました。テスト条件下では機能的なfull-chain exploitの自動生成はしません。OpenAIはSolがPreparedness FrameworkのCyber Critical閾値を超えないと述べており、この区別がリリースの全体的理由です[1]

注目すべきことに、OpenAIはこの配置を常設化しないと述べています。この手の政府アクセス・プロセスは長期デフォルトにはならないべきと。なぜなら、それを必要とする防御側から最良のツールを奪うからです[1]

共に出荷されたセキュリティスタックは知る価値があります。高capability modelが今後どう出荷されるかを予示するからです:訓練済みrefusal、生成を一時停止して大きなmodelで検証できるreal-time cyberと生物学classifier、フラグ付きactivity対象のaccount層審査、最機密capabilityへの差別化アクセス。OpenAIは普遍的jailbreak対する自動化red-teamingに70万以上のA100相当GPU時間を投下[1]

OpenAIは正直です:このsafeguardは時に失敗します。正当なsecurity研究者がdual-use requestでrefusalに遭遇することもあります。

主張が強い場所と弱い場所

強い。 Agenticコマンドラインコーディング。単一エージェント・SolがベンチマークをリードしてUltraがそれを拡張。Token効率。大容量エージェントでは複合効果が出ます。Mid-tierの価値。Terraの価格低下はリリースで最も広く有用な改善。そしてネイティブな複数エージェント・オーケストレーション。開発者が手で作ってきた層が不要になります[1]

弱い。 見出しは1ベンチマーク・0.8ポイント勝利。評価範囲は意図的に狭い。SWE-bench、GDPval、数学、幻覚測定は非公表。GPT-5.6がGPT-5.5を悩ませた信頼できる幻覚問題を修正したかは不明。すべてOpenAIの自社harness下のvendor報告[1]

拡張テストスイートと独立スコアリングが登場するまで、汎用能力への判断は保留されるべきです。

GPT-5.6の使い方:どのtierを選ぶか

ほとんどのproductionworkloadにはTerra。 GPT-5.5級の能力を約半額で提供。ベンチマークはそのコーディングがClaude Fable 5と同等と示します。

Long-horizonコーディング、security作業、ultraを正当化するもの向けSol。 サブエージェント・オーケストレーションは、数ポイント差がoutcome変える高risk taskでは実質的価値。定型callでは価値なし。

大容量、latency-sensitive、定型traffic向けLuna。 Terminal-Bench 82.5%はGPT-5.5の83.4%から遠くなく、コストは大幅に低い。

reAPIでGPT-5.6を呼び出す

3つのtierは皆、単一のOpenAI互換/v1/chat/completions endpointの背後に在ります。tierの切り替えはintegrationではなく、model-string変更です。wire IDはOpenAIの点を保ちます:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

resp = client.chat.completions.create(
    model="gpt-5.6-terra",
    messages=[{"role": "user", "content": "Refactor this module and add tests."}],
    max_tokens=16000,
    stream=True,
)

tierを変えるにはgpt-5.6-terragpt-5.6-solまたはgpt-5.6-lunaに置き換えてください。同じkeyとclientがClaudeとGeminiも到達するため、tier選択とvendor選択は同じ型の決定になります。ベンチマーク表がデフォルト・modelを1行失わせ別行を勝たせるときの要点です。

現行レートはreapi.ai/models/gpt-5-6-solreapi.ai/models/gpt-5-6-terrareapi.ai/models/gpt-5-6-lunaに在ります。

FAQ

maxultra mode間の違いは何ですか?

maxは単一エージェントが1つの問題に長く深く思考。ultraは複数サブエージェントをオーケストレートし、複雑な作業を並列分割・再統合。どちらもSolo独占。ultraが91.9%見出しを生成[1]

GPT-5.6 SolはコーディングでClaudeより優れていますか?

Terminal-Bench 2.1では単一エージェント・Sol 88.8%がClaude Mythos 5(88.0%)を0.8ポイント上回り。実質的ですが狭い。ultraではSol 91.9%に到達ですがサブエージェント使用のため直接比較ではありません[1]

どのGPT-5.6 tierを使うべきですか?

ほとんどのproduction workloadにはTerra。GPT-5.5級能力を約半額で。Long-horizonコーディング、security、またはultraを正当化するtaskにはSol。大容量定型callにはLuna[1]

なぜ米国政府が関わったのですか?

SolはVulnerability Research含むcybersecurity能力を著しく前進。OpenAIのCyber Critical閾値超過なし。政府要請でOpenAIは約20の厳選パートナー向け段階的プレビューを実施。cyberフレームワーク開発と並行[1]

GPT-5.6はGPT-5.5の幻覚問題を修正しましたか?

不明。OpenAIはプレビューでコーディング、生物学、cybersecurity評価のみ公表。幻覚と知識task測定は保留[1]。High-stakes outputはsource-grounded検証と組み合わせてください。

GPT-5.6 Solのコンテキストウィンドウ大きさは?

サードパーティ報告は約1.5ミリオン token。GPT-5.5世代比43%大きい推定。OpenAIプレビュー記事は仕様表確認なし[1]

Prompt Cachingで何が変わりましたか?

明示的キャッシュ切断点と30分minimum cache生存期間。キャッシュ書き込みはキャッシュなし入力レートの1.25倍請求。キャッシュ読み込みは90%割引保持[1]

OpenAI SDKでGPT-5.6をどう呼び出しますか?

clientをhttps://api.reapi.ai/v1指向。modelgpt-5.6-solgpt-5.6-terragpt-5.6-lunaにセット。IDの点保持。

3-tierリリースを読む

GPT-5.6は1つのアナウンスメント内の2つのリリースです。1つは通常の・実行されたfamily更新:合理的naming reset、コスト半減化でcapability失なし、マルチエージェント・オーケストレーションをendpoint内に焼き込むultra mode。もう1つはfrontier model。初期可用性は政府と調整設定、70万GPU時間のsecurity stackの背後から出荷。

実際に構築する人向けに、有用な要約はどちらの話より小さい。頂部のベンチマーク・リード0.8ポイント。vendor報告。感じる変化はTerraの価格。これがGPT-5.6の思慮深い使い方:mid-tierをデフォルト。ultraを正当化するtask向けSolをリザーブ。拡張評価スイートが幻覚問題の動向を教えるまで、source-grounded検証を継続。

参考文献

  1. OpenAI. モデル — GPT-5.6 family、reasoning mode、仕様。 2026年7月取得 platform.openai.com/docs/models
  2. OpenAI. 価格設定 — model・tier別per-tokenレート。 2026年7月取得 platform.openai.com/docs/pricing

さらに詳しく