Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Claude Opus 5の使い方:ベンチマーク、Effort、費用
2026/07/27

Claude Opus 5の使い方:ベンチマーク、Effort、費用

Claude Opus 5の公開ベンチマーク表、請求額を左右するEffortレベル、二つの破壊的なAPI変更、移行ステップまで、完全に説明します。

Anthropicは2026年7月24日にClaude Opus 5をローンチし、Claude Opus 4.8に対する段階的な改善と位置づけています[6]。価格は先代と全く同じです。入力トークン当たり$5、出力当たり$25[3]。つまり、Claude Opus 5を使いこなすことは、リストプライスとはほぼ無関係で、多くのチームが触ったことのない制御ツールに全てかかっています。

それはEffortです。Anthropicはベンチマークごとに一つの数字を公開するのではなく、全Effortレベル(5段階)のスコア対コスト曲線を公開しました[1]。その曲線における最も安いランク段階から最も高いランク段階までのスプレッドは、プロンプト改善では回収できない幅があり、公式ガイダンスは全てを上げるのではなく、自分たちのevalに対してはしご状の調整を行うことです[2]

TL;DR

  • リストプライスは同じ、モデルは別。 入力トークン$5 / 出力$25 per百万トークン、Opus 4.8から不変です[2]。reAPIでは同じモデルは$2.40 / $12.00で走ります。これはAnthropicの公開レートの48%です。
  • Thinkingはデフォルトでオンになりました。 Opus 4.8ではthinkingフィールドを省略するとthinkingなしでした。Opus 5では同じリクエストがthinkします[2]。max_tokensはthinkingと応答テキストの両方を合わせた上限なので、引き継いだ厳しい予算は途中で切れる可能性があります。
  • Thinkingを無効にするのはEffort high 以下に制限されます。 thinking: {"type": "disabled"}xhigh または max を組み合わせると400が返されます。このチェックはリクエストごとに走ります[2]
  • Opus 5が全て勝つわけではありません。 Anthropic自身のテーブルでは、agentic codingのDeepSWE v1.1でGPT-5.6 Solに負けています。68.8%対72.7%[1]
  • Effortの設定を引き継がないでください。 Anthropicは lowmedium がトークンとレイテンシのわずかで強力な品質を出すと言っており、デフォルト high から始めて自分たちのevalに対して両方向に動くよう促しています[2]
  • Priority Tierはカバーしていません。共有Opusプールではなく自身のレート制限バケットに座ります[5][4]

Claude Opus 5とは

Anthropicはエンタープライズワークとcomplex agentic codingの向けとしてClaude Opus 5を位置づけています[2]。APIの識別子は claude-opus-5 です。日付サフィックスを付ける必要はありません。

プロパティClaude Opus 5
APIモデルIDclaude-opus-5
コンテキストウィンドウ1M トークン(デフォルトと最大)
最大出力128k トークン
リストプライス入力/出力トークンあたり百万$5 / $25
Fast mode$10 / $50、Claude APIのみ
Thinkingデフォルトでオン、適応型
Effortレベルlow, medium, high, xhigh, max, デフォルト high
プロンプトキャッシュ最小値512トークン(従来は1,024)

小さいコンテキスト変種はありません[2]。1Mウィンドウがあるだけです。Claude API以外では、モデルはAmazon BedrokでAndropicの anthropic.claude-opus-5 として、Google CloudではClaude APIの claude-opus-5 として、Microsoft Foundryでも利用可能です[2]。Fast modeは例外です。Claude APIのみで走り、3つのクラウドプラットフォームのいずれにも存在しません[2]

完全な公開ベンチマークテーブル

Anthropicが公開したClaude Opus 5ベンチマークテーブル。Opus 5、Fable 5、Opus 4.8、GPT-5.6 Solをagentic terminal coding、knowledge work、novel problem-solving、agentic search、reasoning、computer use、agentic coding、business workflows、legal、health、biologyで比較

これはAnthropicの公開比較を完全に転記したもので、Opus 5が勝たない行も含まれています[1]。Fable 5列が異なるモデル名を含む場合、それはAnthropicのアノテーション自体です。

ベンチマークOpus 5Fable 5Opus 4.8GPT-5.6 Sol
Agentic terminal coding (Frontier-Bench v0.1)43.3%33.7%21.1%34.4%
Knowledge work (GDPval-AA v2, Elo)1861174715931736
Novel problem-solving (ARC-AGI-3)30.2%1.5%7.8%
Agentic search (BrowseComp)90.8%87.4%84.3%90.4%
Multidisciplinary reasoning (HLE, no tools)56.3%56.5%49.8%
Multidisciplinary reasoning (HLE, with tools)64.7%63.9%57.9%
Computer use (OSWorld 2.0)70.6%66.1%55.7%62.6%
Agentic coding (DeepSWE v1.1)68.8%69.7%59.0%72.7%
Agentic coding (FrontierCode v1.1, Main)53.4%53.5%46.5%47.5%
Business workflows (AutomationBench)26.0%17.4%17.0%18.1%
Legal (Legal Agent Benchmark, held-out)11.7%13.3%10.4%2.5%
Health (HealthBench Professional)59.8%66.0% (Mythos 5)57.4%60.5%
Biology (BioMysteryBench, hard)49.4%46.5%42.4%
Biology (BioMysteryBench, human-solved)90.1%89.0% (Mythos 5)88.5%

方法論に関する注釈があります。Frontier-Benchをeffortレベルで分解するcompanion chartでは、Anthropicはこれらの結果がmini-SWE-agent harnessのinternal runから来たもので、GKE backendを使用し、5回の試行あたりのrewardを平均して、safety classifiersがOpus 5またはFable 5からのリクエストを拒否した場合はOpus 4.8を代わりに使用したと述べています[1]。これらはベンダー実施の評価です。これらを方向指標として読んでください。中立的な監査ではなく。

勝つ場所と負ける場所

Opus 5は14行中9行を勝ち取ります。勝つ余裕は明らかではありません。Frontier-Benchはlopus 4.8の21.1%からOpus 5の43.3%に進みます。2倍以上です。ARC-AGI-3は1.5%から30.2%に跳ね上がります。その行の最も近い競争相手はGPT-5.6 Solの7.8%です。AutomationBenchは26.0%で17%から18%のクラスターに立ち向かいます[1]

他の5行を負けています。そしてこれらは勝ちより、モデルを選ぶのに役立ちます。

  • DeepSWE v1.1、agentic coding:68.8%対GPT-5.6 Solの72.7%。これはボード上で明白な敗北です。Opus 5がマーケットされているワークロードに着地します。Anthropicが行を残しました。
  • HealthBench Professional:59.8%。Mythos 5が66.0%、GPT-5.6 Solが60.5%の後ろです。
  • Legal Agent Benchmark:11.7%対Fable 5の13.3%。どちらの数字も低いので、ベンチマークはゴールから距離を測定しているだけです。
  • HLEツールなし(56.3%対56.5%)とFrontierCode Main(53.4%対53.5%)はノイズ内のタイです。しかし彼らはOpus 5がFable 5全体に支配する請求を排除します。

パターン:Opus 5は長時間実行、ツール使用、多くのステップ状態を保持するタスクで勝ちます。単一ショット難問では並ぶか負けます。

Effortレベルが請求額を決定します

Anthropicは各ベンチマークあたり一つの数字ではなく、完全なスコア対コストラダーを公開します。これを読むと、モデルをどのように構成するか変わります[1]

Frontier-Bench v0.1でのagentic codingスコア対試行あたりコスト。Claude Opus 5、Fable 5、Opus 4.8、GPT-5.6 SolのEffortレベルラダーを対数コストスケールでプロット

三つのことが従います。

トップランクは推奨されるスタートポイントではありません。 Anthropicの指示はデフォルト high から始めて、あなたのevalsに基づいてどちらかの方向に調整することです。品質が保たれる場所でステップダウンしてトークンとレイテンシを保存します。最も要求の厳しい作業のためステップアップしてください[2]。その文がどこから始まるかに注意してください。推奨エントリーポイントはラダーの最上部ではなく真ん中です。そしてEffortはより多くの重みを運ぶようになりました。なぜなら、Opus 5はより信頼性を持って余分なEffortをより良い結果に変換するから、以前のOpusモデルより優れています[2]

LowとMediumはこれまでより強力です。 Anthropicは明確に低Effort での効率に言及しており、lowmedium は高いsettingのトークンとレイテンシのわずかで強い品質を生成すると言っています[2]。Opus 4.8から持ち越したEffort defaultはスタートポイントとして間違っています。

Effortはコストレバーです。promptではありません。 公式ガイダンスはデフォルト high から開始してから自分のevalsに対してどちらかの方向に動くことです。品質が保たれる場所でステップダウンしてトークンとレイテンシを保存します。最も要求の厳しい作業のためステップアップしてください[2]xhigh または max では、モデルがsubagentsとツール呼び出しにわたってthinkしたり行動したりするための部屋があるように、大きい max_tokens を設定してください[2]

水面下での二つの破壊的変更

リクエスト表面はほぼOpus 4.8から継承されます。Sampling parametersはまだ拒否されます。固定thinkingbudgetはまだ拒否されます。そしてlast-assistant-turn prefillはまだ失敗します。しかし二つのことは変わりました。そして両者はコードを無修正で持ち越す破壊します。

Thinkingはパラメータを省略するときに走ります。 Opus 4.8では、 thinking フィールドのないリクエストはthinkingなしで走りました。Opus 5では、同じリクエストがthinkします。各ターンにモデルが決定します[2]。wire valueは変わりませんでした。 thinking: {"type": "adaptive"} はまだ有効で、デフォルトと同等です。何が変わったのは、あなたが何も言わないときに何が起こるかです。 max_tokens はthinkingと応答テキストの合計の厳しい制限なので、Anthropicはthinkingなしで以前実行したワークロードにそれを再訪することを伝えます[2]。目に見える出力だけに調整された予算は今、途中で応答を截断します。

Thinkingをオフにするには、Effort high 以下が必要です。 thinking: {"type": "disabled"}xhigh または max とペアリングすると400が返されます。チェックはすべてのリクエストで実行されるため、 high で成功したセッションは、後続の呼び出しがEffortを上げてThinkingがまだ無効なときの時点で失敗を開始します[2]

Anthropicはthinkingオフで何が間違うのかも記録しています。モデルはツール呼び出しをテキスト出力に書き込むことができます。あるいは内部XMLタグを目に見える応答にリークします[2]。最初の失敗モードはエージェントループで危険なものです。ターンは綺麗に終わり、呼び出しはnever実行されるため。公式推奨事項はthinkingをkeepして、代わりに低いEffortレベルでコストを制御することです。

三つの追加事項は知る価値があります。

  • Mid-conversation tool changes(ベータヘッダー mid-conversation-tool-changes-2026-07-01)ではあなたがセッションの存続期間のツールリストをピンすることの代わりに、turnの間でツールを追加または削除しながらプロンプトキャッシュを保持することができます[2]
  • A "default" fallbacks mode(ベータヘッダー server-side-fallback-2026-07-01)はあなたが保守するリストのかわりに、拒否カテゴリー別にAnthropicのお勧めフォールバックモデルを適用します[2]
  • プロンプトキャッシュ最小値は512トークンに下がりました 従来の1,024から。そのため以前キャッシュするには短すぎたプロンプトはコード変更なしでキャッシュエントリーを作成します[2]

請求額を実際に動かすもの

ここは完全な公開レートカードです[3]

アイテム百万トークンあたり価格
入力$5
出力$25
キャッシュhitsとrefreshes$0.50
キャッシュwrite(5分)$6.25
キャッシュwrite(1時間)$10
Batch入力$2.50
Batch出力$12.50
Fast mode入力$10
Fast mode出力$50

Batch APIは両方の次元で標準レートの半分で走ります。そしてfast modeは両方を倍にします[3]。Anthropicはopus 5をClaude Fable 5の費用の半分でfrontier intelligenceを提供する説明します[2]。これはレートカードに対してチェックアウトします。Fable 5は$10 / $50で一覧表示されます[3]

三つのレバーが各トークンレートよりも重要です。

Effort。 ラダーにわたって公開されたcost-per-attemptスプレッドは、1つのルートを xhigh から medium に動かすことが、あらゆるprompt rewriteを保存するほど広いです[1]

Verbosity。 Anthropicはデフォルト応答とwritten deliverableはOpus 5上でより長く実行すると述べています[2]。Thinkingトークンは出力として請求されます。そして余分なproseも同様です。Effortを低くするとthinkingを減らしますが、見える出力を確実に短くします。そのため明示的な簡潔性指令を書いてください。

削除できる検証scaffolding。 Opus 5は言われることなくそれ自身の仕事を検証します。そしてAnthropicは以前のモデルから持ち越された指令は、「最終検証ステップを含める」または「検証するためにsubagentを使用する」のような、over-verificationを引き起こすと言っています[2]。それらを削除すると、品質トレードオフなしでトークン支出が低下します。これは最適化の珍しい種類です。

レート制限とPriority Tier

ロールアウト中にチームをキャッチする二つの操作上の事実。

Priority Tierはクラウド Opus 5をカバーしていません。Anthropicのサービス層文書はPriority Tierがすべての利用可能なClaudeモデルでサポートされていることを示しています。ただしClaude Mythos 5、Claude Mythos Preview、Claude Opus 5、およびClaude Sonnet 5を除き[5]。容量計画がPriority Tierカバレッジを仮定した場合、ここには適用されません。

Opus 5も自身のレート制限バケットを持っています。combined Opus limitはOpus 4.8、4.7、4.6、および4.5にわたるトラフィックに適用されます。Opus 5はそのプールの一部ではありません[4]。これは移行中の良いニュースです。Opus 5トラフィックは既存のOpus 4.8ルートが依存する予算を食べません。Fast modeは標準Opus限度から分かれた専用限度を再度持っています。超えられた場合、 retry-after headerを持つ429を返します[4]

Claude Opus 5の使い方:移行チェックリスト

Anthropicの移行ガイダンスはモデル文字列変更とプラス二つの挙動変更の確認を削減します[2]。実際にはリストはもう少し長いです。

  1. モデル文字列を claude-opus-5 に変更します。
  2. Thinkingを無効にする各ルートを監査します。Thinkingを無効に保ってEffortを high 以下にドロップするか、Effortレベルを保ってthinkingフィールドを削除します。
  3. thinking フィールドを設定しないルートでmax_tokensを上げます。現在考えており、予算の両方を対象とします。
  4. あなたのevalsに対してEffort sweepを再実行してください。デフォルト high から始めて、Opus 4.8の設定を継承するのではなく、両方向に動きます。
  5. プロンプトから検証指令を削除します。ハーネスから検証ステップ。
  6. ユーザー向けルートに明示的な簡潔性指令を追加します。
  7. キャッシュ不可能なものを削除したことで書いた短いプロンプトをチェックしてください。新しい512トークン最小に対して。
  8. 拒否をエラーではなく応答として処理します。Safety classifiersはリクエストを拒否し、HTTPエラーのかわりにstop reasonを返すことができます。そのため最初のコンテンツブロックを無条件で読むコードは壊れます。

他のモデルと並びClaude Opus 5を呼び出す

上記の全てが同じ操作上の問題を指しています。このモデルは5つのEffortレベル、独自のレート制限バケット、Priority Tierなし、およびagentic codingをGPT-5.6 Solに失ったそして健康をMythos 5に失ったベンチマークテーブルを持っています。正しい構成は一つの設定ではありません。これはワークロードあたりのルーティング決定です。そしてベンダーが配送するたびに変更されます。

これはわざと建てる価値のある層です。コードレビュー通過とbulk extraction jobは同じEffortで走ることがなく、Opus 5が失うルートはOpus 5の習慣から外に留まる管理がありません。一つのSDKクライアント各ベンダー、各ベンダー毎の一つのキー、そしてベンダー毎の一つの計費表面でそれを処理することがマルチモデル作業の費用が実際に積算する場所です。

reAPIはOpenAIと互換性のある /v1/chat/completions endpointを通じてClaude Opus 5を公開するため、GPT呼び出しとGemini呼び出しのためにあなたが既に使っているクライアントがこれも呼び出します。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

resp = client.chat.completions.create(
    model="claude-opus-5",
    messages=[{"role": "user", "content": "Refactor this module and add tests."}],
    max_tokens=16000,
    stream=True,
)

ゲートウェイ上のレートは百万入力トークンあたり$2.40そして百万出力$12.00。Anthropicの公開する $5 / $25の48%です。完全なリクエスト表面、 output_config.effort と上のthinking規則を含めて、reapi.ai/docs/claude-opus-5ページに記録されています。そして現在のレートはreapi.ai/models/claude-opus-5](/models/claude-opus-5)上で生きています。

これの全ては何もルーティング決定を削除します。それはそれを作成する際にintegration taxを削除します。

FAQ

Claude Opus 5はClaude Fable 5より優れていますか?

Anthropicの公開テーブルの14行中9行で、そしてFable 5のリストプライスの半分[3]。しかしFable 5はツールなしのHLE、FrontierCode Main、とLegal Agent Benchmarkをまだ取ります。そしてHealthBench Professionalの行はMythos 5に行きます[1]

Claude Opus 5はOpus 4.8より費用がかかりますか?

いいえ。両方とも百万トークンあたり$5入力と$25出力で一覧表示されます[3]。Anthropicは価格変更なしで能力跳躍を配送しました[2]

Opus 4.8からの最大の破壊的変更は何ですか?

Thinkingはデフォルトでオンです。 thinking フィールドを省略したリクエストはOpus 4.8では思考なしで走り、Opus 5では思考します。これはコストと max_tokens の両方の挙動を変えます。二つ目は、thinking: {"type": "disabled"} が Effort xhigh または max では400を返すようになった点です[2]

どのEffortレベルを使うべきですか?

デフォルト high から始めて、あなたのevalsに対して両方向にスイープしてください[2]。Anthropicは max をフレームします。最も深い推論のための最上階層として。良い標準よりむしろ。そして別のことながらeffort lowmedium はこのモデル上でトークンとレイテンシの分数で保持する[2]

Claude Opus 5コンテキストウィンドウは何ですか?

1Mトークン。これはデフォルトと最大の両方です。小さいコンテキスト変種はありません。最大出力は128kトークン[2]

Claude Opus 5はPriority Tierでカバーされていますか?

いいえ。Priority Tierは利用可能なすべてのClaudeモデルをカバーします。ただしMythos 5、Mythos Preview、Opus 5、およびSonnet 5を除き[5]。Opus 5も結合Opus 4.x プール[4]ではなく独自のレート制限バケットに座ります。

Thinkingをまだオフにできますか?

はい、Effort high 以下で。Anthropicはそれに対して助言し、モデルは可視テキストにツール呼び出しを書き込むか、思考が無効にされるときに内部タグをリークするかもしれないことを記録し、代わりにEffortを低くすることを推奨します[2]

OpenAI SDKでClaude Opus 5を呼び出す方法は?

OpenAIクライアントを https://api.reapi.ai/v1 にポイントしてください。設定 model から claude-opus-5 へ。そして通常のチャットリクエストを送ってください。endpointはOpenAI互換なので、SDKリレイトは必要ありません。

Effortレベルを選んで進む

この釈放について興味深いことはpricing pageが最も有用ではない部分であるということです。リストプライスは移動しなかった。そのため全てのデルタは挙動にあります。デフォルトでthinkingオン。もともとなかった400。キャッシュフロア半減。そしてEffort ladderの推奨エントリーポイントが最上段ではなく中央の手摺りです。Anthropicも公開しました。5つのベンチマーク行は新しいflagshipを失ったもの。9つが勝つそれは価値のある9つです。

あなたが移行しているなら、仕事は小さくそして具体的です。モデル文字列を変更してください。Thinkingを無効にするルートを監査してください。Thinkingが今暗黙のうちに置かれる max_tokens 場所を上げてください。古いモデルの為にあなたが書いた検証指令を削除してください。そしてあなたのevals対して努力を掃き。それはラダーが登るのを止める最上部を支払わずにClaude Opus 5を使用する方法です。

References

  1. Anthropic. Introducing Claude Opus 5 — benchmark comparison table and effort-level cost curves. Retrieved July 2026 from anthropic.com/news/claude-opus-5
  2. Anthropic. What's new in Claude Opus 5 — behavior changes, new features, availability, and migration. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/models/whats-new-opus-5
  3. Anthropic. Pricing — token, cache, batch, and fast-mode rates. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/pricing
  4. Anthropic. Rate limits — per-model buckets and fast-mode limits. Retrieved July 2026 from platform.claude.com/docs/en/api/rate-limits
  5. Anthropic. Service tiers — Priority Tier model coverage. Retrieved July 2026 from platform.claude.com/docs/en/api/service-tiers
  6. Anthropic. Release notes — Claude Opus 5 launch entry dated July 24, 2026. Retrieved July 2026 from platform.claude.com/docs/en/release-notes/overview

Further reading