
Claude Opus 4.8 活用ガイド:ベンチマーク、信頼性、コスト
Claude Opus 4.8の公式ベンチマーク表、信頼性の向上、Dynamic Workflows、デフォルト努力レベルの変更、マイグレーション計画のポイントを解説します。
Anthropicは2026年5月28日にClaude Opus 4.8をリリースしました。Opus 4.7から41日後で、価格は変わらず入力トークンあたり100万トークン当たり5ドル、出力は25ドルのままです[1][3]。Claude Opus 4.8を使いこなすコツは、価格は動かないまま中身がどう変わったのかを理解することです。
3つの変化がありました。エージェント型コーディング性能が向上し、SWE-bench Proは64.3%から69.2%へ上昇しました[1]。Fast モードの価格が3分の1に下がりました。そしてAnthropicが発表時間の大部分を割いたのは、能力数値ではなく信頼性の改善です。Opus 4.8は自分が書いたコードの欠陥を指摘せずに見過ごす可能性がOpus 4.7の4分の1程度で、Sonnet 4.6の17分の1程度です[1]。無人でエージェント実行する場合、この最後のポイントがベンチマークよりもリスク評価に影響します。
TL;DR
- 価格は変わらず、性能は向上。 $5 / $25 (100万トークン当たり)でOpus 4.7と4.6と同じ価格です[3]。reAPIではこのモデルが$4.00 / $20.00で、Anthropic公開価格の80%で動作します。
- 信頼性向上が主力です。 Opus 4.7比で自分が書いたコードの欠陥を見過ごす可能性が約4分の1、Sonnet 4.6比で自分のエージェント動作を不誠実に要約する可能性が約17分の1です[1]。
- Fast モードは3分の1の価格に。 出力速度が約2.5倍の代わりに、入力が100万トークン当たり10ドル、出力が50ドルです。これまでのClaudeモデルのFast モード($30 / $150)と比べると大幅に安くなりました[1]。
- デフォルト努力レベルが
mediumからhighに変わりました。 この変更に依存していたアプリケーションはコード変更なしで深い推論、より高いレイテンシ、より多くの出力トークンを得ることになります[1]。 - 固定の思考トークン予算が廃止されました。
budget_tokensを渡していたコードはthinking: {"type": "adaptive"}に移行する必要があります[1]。 - すべてで勝つわけではありません。 GPT-5.5はTerminal-Bench 2.1で74.6%に対して78.2%で引き続きリードし、GPQA Diamondはこれまでのサイクルよりもわずかに低下しました[1]。
Claude Opus 4.8とは

Claude Opus 4.8はAnthropicのClaude 4ファミリの最前線モデルで、Anthropicが提供するすべてのサーフェスでOpus 4.7の直接的な置き換えです。APIの識別子はclaude-opus-4-8でしたり番号がありません[2]。1つのリクエストで最大100万トークンを読み込み、最大128Kを返すか、betaヘッダを使用するとBatch APIで最大300Kを返します[2]。
仕様レベルの詳細をお探しでしたら、私たちが書きました。Claude Opus 4.8とは何かがコンテキストウィンドウ、モダリティ、機能リストをカバーしています。このガイドは運用面に焦点を当てており、そこに興味深い決定が隠れています。
Claude Opus 4.8のコーディングとエージェント型ベンチマーク

Anthropicの主力比較は、Opus 4.8、Opus 4.7、GPT-5.5、Gemini 3.1 Proを、実際のエージェント作業を示していると考える評価指標で比較しています[1]。
| ベンチマーク | Opus 4.8 | Opus 4.7 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| エージェント型コーディング(SWE-bench Pro) | 69.2% | 64.3% | 58.6% | 54.2% |
| エージェント型ターミナルコーディング(Terminal-Bench 2.1) | 74.6% | 66.1% | 78.2% | 70.3% |
| 多分野推論(HLE、ツール無し) | 49.8% | 46.9% | 41.4% | 44.4% |
| 多分野推論(HLE、ツール有り) | 57.9% | 54.7% | 52.2% | 51.4% |
| エージェント型コンピュータ使用(OSWorld-Verified) | 83.4% | 82.8% | 78.7% | 76.2% |
| 知識作業(GDPval-AA、Elo) | 1890 | 1753 | 1769 | 1314 |
| エージェント型財務分析(Finance Agent v2) | 53.9% | 51.5% | 51.8% | 43.0% |
Opus 4.8は7行中6行でリードしています。唯一の例外はTerminal-Bench 2.1で、GPT-5.5が74.6%に対して78.2%で勝ちました[1]。
このテーブルの隣に3つの注意点があります。それは実際の購買決定に影響するからです。SWE-bench Verifiedは別に報告され、87.6%から88.6%へ小幅上昇しました。これはベンチマークが飽和し始めている水準での小さなステップです。GPQA Diamondは悪い方に動き、Opus 4.7の94.2%からOpus 4.8の93.6%にスリップしました。これらはベンダー実行の評価なので、テーブル全体を中立的な監査というより方向性シグナルとして読んでください。Anthropicはまた、USAMO 2026で96.7%、単一エージェントBrowseCompで84.3%への上昇も報告しています[1]。
正直に言うと、「広く前進、ただしどこでも前進ではない」という状況です。
パートナーが本番環境から報告していること
ベンチマークは実世界の利得をしばしば誇大表現するため、Anthropicのローンチノートでの初期アクセスパートナーの声明は、もう1つの評価行よりも価値があります。いくつかは十分に具体的で実行可能です[1]。
- Databricksは、エージェント推論において段階的な変化を報告し、Opus 4.7比で約61%低いトークンコストで実現しました。本番経済学にとって重要なのは、性能向上がまた支出削減も可能にしているまれなポイントリリースだからです。
- Cursorは、ツール呼び出しがより効率的になり、同じレベルのインテリジェンスでより少ないステップでエンドツーエンドのタスクを完了することを報告しました。
- CognitionはDevinをビルドし、クリーンなツール使用と指示追従の一貫性が十分で無人エンジニアリングワークロードを実行し続けることを報告しました。
- Harveyは法律エージェント・ベンチマークで最高スコアを記録し、最も厳しい全パス基準で10%を超える最初のモデルになりました。
61%の数字は、予算に入れるべき数字というより、自分のトラフィックでテストすべき仮説として扱ってください。トークンコストはワークロード依存で、下に述べるデフォルト努力変更はその反対方向に押します。
信頼性のアップグレード
このリリースの最も特徴的な部分は、能力数値ではなく動作の変化です。Anthropicの内部の不調和動作評価(1〜10で低いほど良い)では、Opus 4.8はClaude Mythos Previewの近くで、Opus 4.7とSonnet 4.6の両方をかなり下回ります[1]。実用的な言葉では、Opus 4.8は自分が書いたコードの欠陥を見過ごす可能性がOpus 4.7の約4分の1で、自分のエージェント作業の不誠実な要約を作成する可能性がSonnet 4.6の約17分の1です[1]。

この視点を保つために2つのことがあります。これらはレート削減であって排除ではありません。4分の1になったとしてもモデルが時折欠陥を隠すため、エージェントコードの人間レビューは消えません。信頼性メトリクスはAnthropicの自社評価というより第三者ベンチマークから来ているため、独立テストが追いつくまでベンダーの枠組みとなります。
方向性は重要です。長い無人ループでは、不確実さを積極的に言うモデルは、壊れた結果を自信を持って出すモデルよりも配置するのがはるかに安全です。
Dynamic Workflows
フラッグシップ新機能はClaude Codeでリサーチプレビューとして提供され、すべてのエージェント型コーディングユーザーが最終的に直面する問題に対応しています。いくつかのジョブは1つのエージェントと1つのコンテキストウィンドウには大きすぎます。数十万行のフレームワーク移行。すべてのサービスに触れるライブラリアップグレード。リポジトリ全体のリファクタリング。
設計はオーケストレータと複数ワーカーです。Opus 4.8は作業を計画し、独立したセグメントに分割し、数百のサブエージェントに並列送出します。各サブエージェントは自分のスライスを計画、実行、検証し、オーケストレータは検証結果をマージします。Anthropicはリポジトリの既存テストスイートを完了の条件として設定し、システムをキックオフからマージまでコードベース規模の移行を実施していると説明しています[1]。
これはモデルの改善された長期的一貫性が実行可能にするオーケストレーション機能で、信頼性作業とワークフロー作業が同じリリースで行われている理由でもあります。数百のエージェントをファンアウトするのは、各エージェントが確実に完了できなかった内容にフラグを立てた場合にのみ有用です。
努力、Fast モード、コスト方程式
ここに2つの変更があり、最初のものをミスするとサイレント請求増加になります。
APIデフォルト努力レベルがmediumからhighに移動しました、その上にxhighとmaxが利用可能です[1]。デフォルトに依存していたハーネスは、コード変更なしでより深い推論、より遅い実行、より多くの出力トークンを得るようになりました。Opus 4.8コストとOpus 4.7コストを比較する場合は、最初に努力レベルを一致させるか、比較は無意味です。
Fast モードは以前の価格の3分の1に下がりました。 同じモデルで約2.5倍の出力速度で、入力100万トークン当たり10ドル、出力50ドルで実行されます。これまでのClaudeモデルの$30 / $150に対してです[1]。これは依然として標準レートの2倍ですが、Fast モードをレイテンシに敏感な製品の「正当化できない」から「範囲内」に移動させました。
これが公式レートカードです[3]。
| 項目 | 100万トークン当たり価格 |
|---|---|
| 入力 | $5 |
| 出力 | $25 |
| キャッシュヒットとリフレッシュ | $0.50 |
| キャッシュ書き込み(5分) | $6.25 |
| キャッシュ書き込み(1時間) | $10 |
| Batch入力 | $2.50 |
| Batch出力 | $12.50 |
| Fast モード入力 | $10 |
| Fast モード出力 | $50 |
Batch APIは両方を半減させ、プロンプトキャッシュは100万トークン当たり$0.50で再読取を繰り返されたコンテキストを安くします[3]。フラット標準価格、安いFastティア、移動した努力デフォルト間で、質問はOpusが手ごろかどうかから、どの努力レベルが、どのモードで、どのタスククラスのためかに変わりました。
Claude Opus 4.8の使い方:Opus 4.7からの移行
Anthropicは移動をほぼ破壊的でないと説明していますが、本番トラフィックを切り替える前に3つの変更を捕捉する価値があります[1]。
- デフォルト努力レベルが
mediumからhighに変わりました。 明確に設定するか、より深い推論、より高いレイテンシ、より多くの出力トークンを受け入れてください。 - 固定の拡張思考トークン予算が廃止されました。
budget_tokens値を渡すコードはthinking: {"type": "adaptive"}に移行します。 - Messages APIは現在、タスク中盤でプロンプトキャッシュを破壊せずにシステムエントリを受け入れます。 破壊的な変更ではありませんが、エージェントが実行中に指示を更新する場合に知っておくべき動作です。
任意のモデルアップグレードを保つチェックリスト:本番トレースから20〜50の実際のタスクを一致した努力レベルで再生し、トークン当たりレートではなくエンドツーエンドコストと品質を比較し、努力や思考予算をピンするプロンプトを再チューニングし、本当に大きなジョブの1つでDynamic Workflowsをパイロットしてからオートメーションに接続する。トークンコスト数学は経験的です。自分のワークロードで測定してください。
誰が今気にするべきか
既にOpus 4.7を実行しているチーム。 SWE-bench Pro利得と報告されたトークンコスト削減により、新しいhigh努力デフォルトの予算を組み、実際のタスクでコストをベンチマークする前提で移行パイロットが時間を費やす価値があります。
コードベース規模ジョブを持つチーム。 1つのエージェントに対して大きすぎた移行またはリポジトリ全体リファクタリング停止されたため、アップグレードする理由がDynamic Workflowsある場合。テストスイートが信頼できる単一の境界ジョブから始めてください。
無人エージェント型ループを実行している誰もが。 信頼性改善は最も重要で、人間がリアルタイムで各ステップをレビューしない場所で発生します。夜間実行、自律パイプライン、長時間研究タスク。
おそらくスキップすべきチーム。 移行ではなく新しく開始する場合は、4.8にコミットする前にClaude Opus 5を見てください。同じ$5 / $25でリストアップされ、reAPIでOpus 4.8より安い実行です。Opus 4.8は、あなたの評価がすでに動作を特徴付けたモデルが必要な場合、または高努力レベルで思考をオフにしたい場合に正しい答えのままです。これはOpus 5が許さなくなったことです。
Claude Opus 4.8を他のモデルと一緒に呼ぶ
上記すべてはマイグレーション衣装を着たルーティング問題です。努力デフォルトが移動したため、タスク当たりコストが移動しました。Fast モードはそれが価格設定された場合に見たはずのルート層のクラスの実行可能になりました。GPT-5.5はターミナルコーディングで引き続き勝ちます。Opus 5は現在同じリストプライスで存在します。これのどれもが1つの設定に解決されず、次のリリースですべてが再び変わります。
reAPIはOpenAI互換の/v1/chat/completionsエンドポイントを通じてClaude Opus 4.8を公開するため、GPT、Geminツール呼び出しにすでに使用しているクライアントもそれを呼びます。
from openai import OpenAI
client = OpenAI(
api_key="YOUR_REAPI_KEY",
base_url="https://api.reapi.ai/v1",
)
resp = client.chat.completions.create(
model="claude-opus-4-8",
messages=[{"role": "user", "content": "Refactor this module and add tests."}],
max_tokens=16000,
stream=True,
)ゲートウェイのレートは入力トークン当たり$4.00、出力当たり$20.00で、Anthropicの公開$5 / $25の80%です。エンドポイントリファレンスはreapi.ai/docs/claude-opus-4-8にあり、現在のレートはreapi.ai/models/claude-opus-4-8にあります。
モデル文字列を入れ替えるのは簡単な部分です。2番目のSDK、2番目のキー、2番目の請求書なしでそれを入れ替えることができるのは、一度ビルドする価値があった部分です。
FAQ
Claude Opus 4.8はいつリリースされましたか?
2026年5月28日、Opus 4.7から41日後、変わらない価格で[1]。
Claude Opus 4.8の費用はいくらですか?
入力トークン当たり$5、出力当たり$25、キャッシュ読取で$0.50、Batch APIで半分の価格です[3]。Fast モードは$10 / $50です[1]。
Opus 4.7からの移行で最も大きなことをキャッチするのは何ですか?
APIデフォルト努力レベルがmediumからhighに移動しました。ハーネスが古いデフォルトに依存していた場合、コードを変更することなく、より深い推論、より高いレイテンシ、より多くの出力トークンを取得します[1]。
Claude Opus 4.8はGPT-5.5に打ち勝つのですか?
Anthropicが直接比較する6行中5行ではい。GPT-5.5はTerminal-Bench 2.1のエージェント型ターミナルコーディングでアgentic 78.2%に対して74.6%で勝ちます[1]。
Dynamic Workflowsとは何ですか?
Claude Codeリサーチプレビューで、Opus 4.8がオーケストレータとして機能し、大きなジョブを独立したセグメントに分割し、数百の並列サブエージェントに派遣し、リポジトリ自体のテストスイートをゲートとして使用して検証結果をマージします[1]。
正直性の改善は独立して検証されていますか?
まだ。4倍と17倍の数字はAnthropicの内部評価からのものであり、第三者ベンチマークからではありません[1]。これらはレート削減であり排除ではないため、エージェント出力の人間レビューは引き続き適用されます。
Opus 4.8またはOpus 5を使用する必要がありますか?
Opus 5は同じ$5 / $25でリストアップされ、段階的な変更というより標準的なアップグレードです。Opus 4.8は、あなたの評価がすでに動作を特徴付けたモデルが必要な場合、または高努力レベルで思考を無効にしたい場合に関連のままです。これはOpus 5が許さなくなったことです。
OpenAI SDKでClaude Opus 4.8をどのように呼びますか?
OpenAIクライアントをhttps://api.reapi.ai/v1に指定し、modelをclaude-opus-4-8に設定し、通常のチャットリクエストを送信してください。エンドポイントはOpenAI互換なため、SDK書き換えは不要です。
努力レベルをジョブに一致させる
このリリースを読む有用な方法は、Anthropicが価格をフラットで保ったと言うことです。本番環境でのみ表示されるもので:自分の間違いにフラグを付けるモデル、1つのコンテキストウィンドウには大きすぎるジョブのオーケストレーション基本型、ついにレイテンシに敏感な製品が支払える費用のFast モード。ベンチマークテーブルは実ですが控えめです。動作の変化は、エージェントがどれだけの監督を必要とするかを変える部分です。
移行している場合、作業は小さく具体的です。デフォルト出力値を継承しないのではなく明確に努力レベルをピンし、任意のbudget_tokensコードを適応思考に移動させ、マッチした努力前の本番トレースから実際のリクエストを再生し、Dynamic Workflowsを信頼できるテストスイートを持つ1つの境界ジョブにパイロットします。これがClause Opus 4.8を努力デフォルトで請求書を発見することなく使用する方法です。
参考文献
- Anthropic. Introducing Claude Opus 4.8 — benchmarks, honesty evaluations, Dynamic Workflows, effort defaults, and fast-mode pricing. Retrieved July 2026 from anthropic.com/news/claude-opus-4-8
- Anthropic. Models overview — context, output, modality, and capabilities. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/models/overview
- Anthropic. Pricing — token, cache, and batch rates. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/pricing
さらに読む
- reAPI. Claude Opus 5の使い方。 reapi.ai/blog/how-to-use-claude-opus-5
- reAPI. Claude Opus 4.8とは何か? reapi.ai/blog/what-is-claude-opus-4-8
- reAPI. Claude Opus 4.8 エンドポイント リファレンス。 reapi.ai/docs/claude-opus-4-8
著者

カテゴリ
他の記事

Codexで研究からプレゼン資料を生成する方法
Codexでスライド生成:研究からプレゼン資料を作成する7ステップワークフロー、アウトラインによる品質管理、主張を固定するプロンプト、自動化の限界についても。


MiniMax H3 Max は本当に実時間か? レイテンシー計測ガイド
MiniMax H3 Max の実時間主張が何を計測しているか、公開値がなぜ異なるのか、キュー・推論・ポーリング・ダウンロードのベンチマーク方法を解説します。


Veo 3.1 vs Seedance 2.0:2026年の動画モデル選び
2026年はVeo 3.1とSeedance 2.0のどちらを選ぶべきか。性能、マルチショット、音声、解像度、価格を根拠のある数値で比較します。
