Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Claude Sonnet 5 の使い方:推論レベル、コスト、制限
2026/07/27

Claude Sonnet 5 の使い方:推論レベル、コスト、制限

Claude Sonnet 5の使い方を完全解説。Opus 4.8ベンチマーク比較、推論レベルによる料金差、トークナイザー密度変化、API移行手順を網羅。

Anthropicは2026年6月30日にClaude Sonnet 5をリリースしました。その触れ込みは異常なほど直接的でした:Opus級の性能をコーディング作業と自律運用で実現しながら、Sonnetの価格で提供するというものです[1]。公式ベンチマークもこの主張の大部分を裏付けています。

Claude Sonnet 5をうまく使うために必要な知識は、ローンチポストが強調していない2つのポイントに集約されます。推論レベル(effort ladder)がコスト削減の本当の手段であること、そしてトークナイザーが密になったため、Sonnet 4.6と同じプロンプトでも約30%多くのトークンを消費し、単なるモデル切り替えで請求額が増加し、出力が切れてしまう可能性があることです[1]

本ガイドでは、ベンチマーク、Sonnet 5がOpus 4.8と並ぶ領域と劣る領域、APIの仕様変更4つ、9月以降の価格改定、そして実際に運用すべき対象を網羅します。

TL;DR

  • 知識作業ではほぼOpus級。 GDPval-AA v2のEloスコアは1618でOpus 4.8の1615と統計的に同等[1]
  • 困難なタスクではなお差がある。 SWE-bench Pro 63.2%対69.2%、USAMO 2026は79.5%対96.7%[1]
  • プロモーション価格は2026年8月31日まで:入力$2、出力$10(100万トークンあたり)。9月1日以降は$3、$15に引き上げ[1]
  • Sonnetで初めて推論レベルの完全セットlowmediumhigh(デフォルト)、xhighmax[1]
  • トークナイザーは約30%密になった。 トークンあたりの価格は変わらないため、同じリクエストはSonnet 4.6より高くなります。移行前に再度計測してください[1]
  • budget_tokensとサンプリングパラメータは400を返す[1]

Claude Sonnet 5とは

Claude Sonnet 5(claude-sonnet-5)はSonnet 4.6の後継として、そのまま置き換え可能です。Anthropicはこれを「最もエージェント指向なSonnetモデル」と呼んでいます。計画立案、ブラウザやターミナルの操作、長時間の自律実行をこなし、これまではより大規模で高価なモデルが必要だったレベルの作業を実現します[1]

このモデルはclaude.aiの無料ユーザーとProユーザーのデフォルトとしてリリースされ、同時にClaude API、Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundryのプレビューでも利用可能です。デフォルトでは1Mトークンのコンテキストウィンドウを持ち、最大出力は128Kトークンです[1]

ベンチマーク

Claude Sonnet 5のベンチマーク:エージェント駆動コーディング、推論、コンピュータ操作、知識作業でSonnet 4.6とOpus 4.8と比較

ベンチマークSonnet 5Sonnet 4.6Opus 4.8(参考)
エージェント駆動コーディング(SWE-bench Pro)63.2%58.1%69.2%
エージェント駆動コーディング(Terminal-Bench 2.1)80.4%67.0%82.7%
推論(HLE、ツールなし)43.2%34.6%49.8%
推論(HLE、ツール利用)57.4%46.8%57.9%
コンピュータ操作(OSWorld-Verified)81.2%78.5%83.4%
知識作業(GDPval-AA v2、Elo)161813951615

2つの点が目立ちます。Sonnet 4.6との比較では完全な優位性で、実質的な伸びが見られます:Terminal-Benchは13.4ポイント上昇し、知識作業のEloは223ポイント上がります。また、知識作業ではSonnet 5がOpus 4.8を1618対1615で上回りますが、これは統計的には同等です。エージェント駆動コーディングとコンピュータ操作ではトップモデルから2~6ポイント内に留まっています[1]

「数ポイント差で3分の1の価格」という隙間が、Sonnet 5の全価値提案です。

システムカードからの詳細数値:古典的な500問のSWE-bench Verifiedサブセットで85.2%、9言語のSWE-bench Multilingualで78.3%、CognitionのFrontierCode v1で38.8(Sonnet 4.6の15.1の2倍以上)。Cursorの独立測定ではCursorBench 61.2%(Sonnet 4.6 49%、Opus 4.8 63.8%)。BrowseCompは単一エージェント84.7%、マルチエージェント86.6%に達します[1]

正直な弱点:USAMO 2026でSonnet 5は79.5%で、Sonnet 4.6の55.0%から大幅に上ですが、Opus 4.8の96.7%には遠く及びません[1]。高度な形式的数学はこのモデルの役割ではありません。

推論レベルはコストドライバー

Sonnet 5はSonnetシリーズで初めて完全な推論レベルセットを公開します:lowmediumhigh(デフォルト)、xhighmax[1]。これは見た目だけの機能ではありません。Opus級の品質をSonnet価格で提供するというスローガンを実現する手段なのです。

BrowseCompのエージェント検索性能を推論レベル別に表示。Claude Sonnet 5、Opus 4.8、Sonnet 4.6の成功率とタスク当たりコストをプロット

BrowseComの曲線が最も分かりやすい説明です。Sonnet 5の精度はlowで約60%からmaxで約85%に上昇し、同等のOpus 4.8レベルの精度を著しく低いコスト(タスク当たり)で達成します。Opus 4.8は最高性能で若干上回りますが、Sonnet 5はそこまでの性能をはるかに低価格で実現でき、これは大量エージェントループが必要とするものそのものです[1]

コンピュータ操作は、より控えめな結果を示しています。

OSWorld-Verifiedにおけるコンピュータ操作性能を推論レベル別に表示。すべてのレベルでOpus 4.8がClaude Sonnet 5を上回る

OSWorld-VerifiedではOpus 4.8がすべての推論レベルで前進しています。Sonnet 5はSonnet 4.6をはるかに上回り、著しく低価格ですが、ピクセル単位のGUI制御がコアワークロードであれば、トップモデルは実質的な優位性を持っています[1]

実践的なルール:最も難しい長期的なコーディングとエージェントタスクにはxhigh、ほとんどの作業にはhigh、遅延に敏感なシンプルなタスクにはmediumまたはlow。ルート単位でチューニングし、どこでもmaxをデフォルトにしないこと。

コスト同等のティアとの比較

システムカードはGPT-5.5とGemini 3.5 Flashと比較した競争相手の数値を公開しています。これは「その価格帯のモデルに勝つ」と読むべきで、「すべてに勝つ」ではありません[1]

評価Sonnet 5GPT-5.5Gemini 3.5 Flash
SWE-bench Pro63.258.655.1
Terminal-Bench 2.180.483.476.2
HLE(ツールなし)43.241.440.2
HLE(ツール利用)57.452.2n/a
OSWorld-Verified81.278.778.4
FrontierCode v138.825.5n/a
GDPval-AA v2(Elo)161815091357
AutomationBench13.512.914.5
HealthBench Professional57.851.8n/a

Sonnet 5はGPT-5.5との直接対決のほとんどで勝利し、最も引用される1つで落ちます:Terminal-Bench 2.1で、GPT-5.5はCodex CLIを83.4対80.4で操作します。Gemini 3.5 Flashとの比較ではより広い領域で優位で、AutomationBenchが唯一の例外です。AutomationBenchスコアは全体的に低いことに注意してください。これは未飽和ベンチマークで、解決済みではありません[1]

Opus 4.8と並ぶ領域と劣る領域

同等または優位: GDPval-AA v2知識作業(1618対1615)、BrowseComのエージェント検索で同等精度かつより低コスト、Real-World Finance v2(1219対1222)、AA-Briefcase職務別Elo(1393対1352)[1]

劣位: SWE-bench Pro(63.2対69.2)、Terminal-Bench 2.1(80.4対82.7)、OSWorld(81.2対83.4)、HLEツールなし(43.2対49.8)、CursorBench(61.2対63.8)、Toolathlon(54.3対59.9)、USAMO 2026(79.5対96.7)[1]

パターンは一貫しています。開放的な知識作業とエージェント検索ではSonnet 5は実質的にOpus級です。最も難しいコーディング、コンピュータ操作、形式的数学ではOpus 4.8が実質的だが控えめな優位性を保持しています。エージェントターン数が多く、コストが支配的なワークロードでは、Sonnet 5が合理的なデフォルトで、Opusが困難なタスクへのエスカレーションパスです。

Claude Sonnet 5を使う方法:既存コードを破す4つの変更

Sonnet 5はOpus 4.7/4.8のリクエスト仕様を採用しているため、移行は単なる文字列置換以上のものです[1]

適応的推論がデフォルトで有効。 Sonnet 4.6は指定されない限り推論なしで実行されました。Sonnet 5は初期段階で適応的に思考し、リクエストごとにタスクが必要とする推論量を決定します。高速性が必要な場合は明示的に無効にできます。

budget_tokensは削除。 手動推論予算は400を返すようになりました。推論レベルで深度を制御してください。

サンプリングパラメータは拒否される。 デフォルト以外のtemperaturetop_ptop_kは400を返します。プロンプトで制御してください。

トークナイザーは約30%密になった。 Sonnet 5はOpus 4.7で導入されたトークナイザーを共有しており、同じテキストがおよそ30%多くのトークンになります。トークン当たりの価格は変わらないため、同等のリクエストはSonnet 4.6より高くなる可能性があり、古いトークナイザー用に調整されたmax_tokens制限は現在、思考途中で出力を切断することがあります。

最後の点は高い落とし穴です。リスト価格がSonnet 4.6から きれいにマッピングされると仮定せず、独自のプロンプトで実際の支出を再計算してください。

注目に値する機能追加:Sonnet 5は高解像度画像階層を持つ最初のSonnetモデルで、長辺で最大2576ピクセル、4784ビジュアルトークン(古い1568ピクセルキャップ対比)です。自動的にアクティベートされ、密集したドキュメント、チャート、スクリーンショット理解に関連します[1]

価格

項目プロモーション(2026年8月31日まで)標準(2026年9月1日以降)
入力$2 / MTok$3 / MTok
出力$10 / MTok$15 / MTok
キャッシュ読み取り~$0.20 / MTok~$0.30 / MTok
バッチ$1 / $5標準の50%

Opus 4.8の$5 / $25に対して、Sonnet 5はプロモーション価格で約3分の1、標準価格で約60%です[1]。推論レベル選択とプロンプトキャッシングを組み込むと、よく調整されたエージェントワークロードでは差がさらに広がります。

2つの注意事項。密になったトークナイザーは、リスト比較を信頼するのではなく、実際の支出を再計算すべきことを意味します。また、Priority Tierはソネット5では利用できません[1]

コードが対処すべきセーフティ動作

Sonnet 5は実時間サイバーセキュリティセーフガードを搭載した最初のSonnetモデルです。禁止または高リスクのサイバーおよび生物学のトピックに関連するリクエストは拒否される可能性があり、エラーではなく成功HTTP 200で拒否理由と共に返されます[1]

セキュリティツールまたはライフサイエンスワークフローを構築している場合、無害だが隣接するリクエストがクラシファイアをトリガーする可能性があります。その理由を明示的に処理してください。すべての200がユーザー可能なコンテンツを運ぶと仮定しないでください。Anthropicはまた、Sonnet 4.6より低い幻想と迎合率を報告しており、出力が人間のチェックなしに下流で信頼される場所では重要です[1]

Claude Sonnet 5を使用すべき人

これは、コスト当たりのターン数が複合する大量エージェントワークロードの合理的なデフォルトです:コーディングエージェント、ブラウザとターミナル自動化、取得と研究ループ。LLMを出荷機能に埋め込む製品ビルダー、および1Mウィンドウと低トークン価格が大量処理を実行可能にする長いコンテキストドキュメント作業に適しています。

最難関コーディング、ピクセル完全なコンピュータ操作、または形式的数学の場合、代わりにOpus 4.8またはOpus 5に手を伸ばしてください。トップモデルの数ポイントの領先はプレミアムに値します。

reAPIでSonnet階層モデルを実行

直言すると:Claude Sonnet 5は本日reAPIゲートウェイにはありません。 利用可能なSonnetモデルはClaude Sonnet 4.6で、ゲートウェイ上のClaudeモデルはOpus 5、Opus 4.8、Opus 4.7、Sonnet 4.6、Fable 5です。

これは聞こえるほど問題ではありません。価格がどこに実際に着地するかが理由です。Sonnet 5は9月以降$3 / $15にリストされます。reAPIでは、Claude Opus 5は$2.40 / $12.00で実行され、 Sonnet 4.6も同じです。したがって、ワンティア上のモデルはSonnet 5の標準リスト価格より低い費用でゲートウェイで実行でき、Opus 5はAnthropicが説明する「Fable 5の費用の半分でフロンティアインテリジェンス」モデルです。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

resp = client.chat.completions.create(
    model="claude-opus-5",
    messages=[{"role": "user", "content": "Plan and run this multi-step refactor."}],
    max_tokens=16000,
    stream=True,
)

エンドポイントはOpenAI互換で、ネイティブAnthropicの/v1/messagesサーフェスも利用可能です。レートとリクエスト形式はreapi.ai/modelsにあり、Opus 5リファレンスはreapi.ai/docs/claude-opus-5にあります。

評価がSonnet 5の動作ではなく価格を必要とする場合、Anthropicを通じて直接呼び出してください。

FAQ

Claude Sonnet 5はOpus 4.8より優れていますか?

開放的な知識作業とエージェント検索では、彼らは実質的に同等で、Sonnet 5はGDPval-AA v2でOpus 4.8を1618対1615で上回ります。最も難しいコーディング、コンピュータ操作、形式的数学ではOpus 4.8は控えめですが実質的な領先を保持しています[1]

Claude Sonnet 5はいくら?

2026年8月31日を通じて100万入力トークンあたり$2、100万出力トークンあたり$10。9月1日以降は$3 / $15に上昇します。プロンプトキャッシングはキャッシュコンテキスト読み取りを約90%削減し、バッチAPIは料金を半減します[1]

xhigh推論レベルとは?

highmaxの間の推論設定で、長期的なエージェントおよびコーディングタスク用にチューニングされています。Sonnet 5は完全な推論レベルセットをサポートする最初のSonnetモデルです[1]

Sonnet 4.6から移行後、コストが上昇したのはなぜですか?

トークナイザーは約30%密になっており、同じテキストは変わらないトークン当たり価格で約30%多くのトークンになります。プロンプトを再計測し、長い出力が切られないようにmax_tokensを上げてください[1]

Claude Sonnet 51Mトークンコンテキストウィンドウをサポートしていますか?

はい。標準トークン当たりレートでデフォルトで1M(長コンテキスト追加料金なし)、最大128Kの出力トークン[1]

Sonnet 4.6から移行時に何が壊れますか?

budget_tokensは400を返し、非デフォルトサンプリングパラメータは400を返し、適応的推論はデフォルトになり、密になったトークナイザーはコストと切断動作の両方を変更します[1]

Claude Sonnet 5はコンピュータを制御できますか?

はい。ツール使用、Webサーチ、Webフェッチ、コード実行、コンピュータ操作をサポートし、OSWorld-Verifiedで81.2%を達成します(Opus 4.8は83.4%)[1]

Claude Sonnet 5はreAPIで利用可能ですか?

現在ではありません。ゲートウェイはClaude Opus 5、Opus 4.8、Opus 4.7、Sonnet 4.6、Fable 5を搭載しています。reAPI上のOpus 5は、Sonnet 5の標準リスト価格よりトークンあたり低い費用です。

ティアと価格ポイント間の選択

Claude Sonnet 5はその中心的な約束を達成します。コーディングとエージェント作業では、Opus 4.8に十分近く、プロモーション期間中の3分の1のコストで合理的なデフォルトになり、困難なタスクの場合はトップモデルを予約します。GPT-5.5とGemini 3.5 Flashとのヘッドツーヘッド対決のほとんどで勝ちますが、Terminal-Bench、AutomationBench、形式的数学では正直な例外があります。

2つのことがこの計算があなたのワークロードとの接触で生き残るかどうかを決定します。9月の価格ステップはそれをOpusの3分の1から約60%に取り、密になったトークナイザーはリスト比較が実際の支出を過小評価することを意味します。コミットする前に、独自のプロンプト上で両方を計測してください。これは、請求書でトークナイザーを発見することなくClaude Sonnet 5を使用する方法です。また、ティアラベルが実際に完了したタスクあたりに支払う数値より重要ではない理由でもあります。

参考文献

  1. Anthropic. Introducing Claude Sonnet 5. Retrieved July 2026 from anthropic.com/news/claude-sonnet-5
  2. Anthropic. Models overview — specs and pricing for all current Claude models. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/models/overview
  3. Anthropic. Pricing — token, cache, and batch rates. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/pricing

さらに詳しく