
Claude Fable 5.1 vs Astra: 選択ガイド
Claude Fable 5.1 と GPT-6 Astra をコンテキスト、ツール、キャッシング、保持期間、タスク適合性で比較。独自ワークロードで公平に評価する方法。
Claude Fable 5.1 と GPT-6 Astra は同じ公開 API 価格と同等の大規模なコンテキストウィンドウを持っていますが、互換性はありません。Fable 5.1 は通常、既存の Anthropic Messages ワークフロー、キャッシング集約的な長時間実行エージェント、または定期的に 272,000 以上の入力トークンを送信するジョブの方が適切です。Astra は Responses API エージェント、コンピュータ使用ワークロード、非同期ツールループ、およびモデルがまだ動作している間にステアリングから利益を得るワークフローにとって最初の試用の価値があります。どちらも、コーディング、リサーチ、または一般的な「難しいタスク」の自動的な勝者ではありません。
有用な質問は「どちらのモデルが賢いか?」ではなく「このワークロードをどのモデルがより少ない人間の介入で、許容されるレイテンシとコストで完了できるか?」です。Claude Fable 5.1 API ガイドと GPT-6 Astra API ガイドはリクエストの詳細を示します。この比較はそれらの周辺のルーティング決定を提供します。
クイックアンサー
- 確立された Anthropic Messages エージェント、大規模な再利用可能なプロンプトプレフィックス、またはストリクトな思考ブロック連続性には Claude Fable 5.1 で始めます。
- 非同期ツール、ターンの途中でのステアリング、またはコンピュータ使用が必要な Responses API エージェントには GPT-6 Astra で始めます。
- どちらも $10/MTok 入力、$50/MTok 出力でリストされています。Fable はより安いキャッシュ読み込み。Astra は 272K 入力トークンを超えて長コンテキスト プレミアムを課金します。[2][5]
- これをショートリスト、評決ではなく扱います。繰り返しテストが低いコスト/受け入れられたタスクを示した後にのみルーティングします。
最短の有用な決定表
| 実際の制約 | 最初に使用 | テストの理由 |
|---|---|---|
| 既存の本番フローが Anthropic Messages と保存された思考ブロックを使用 | Fable 5.1 | 移行パスと履歴ルールはそのスタック用に文書化されています |
| エージェントが Responses API ツール、バックグラウンド処理、またはターン途中のステアリングを使用 | Astra | これらのコントロールは Astra の公式 API ガイダンスの中心です |
| ほとんどのリクエストが大規模な安定プレフィックスを再利用 | Fable 5.1 | 発行されたキャッシュ読み込みレートが低い |
| リクエストが頻繁に 272K 入力トークンを超える | Fable 5.1 | Astra はそのしきい値を超える長いリクエスト全体の価格を変更します |
| コンピュータ操作が支配的なジョブ | Astra | OpenAI はコンピュータ使用用に配置し、コンピュータ使用ツーリングを公開します |
| Zero Data Retention 適格性が必須 | Astra、承認に従う | OpenAI は適格 API 顧客向けの ZDR サポートをリストします。Anthropic は Fable 5.1 を Covered Model としてリストし、デフォルト 30 日の保持期間と限定的な例外のみ |
| 出力品質は表示前に説明が難しい | 両方をテスト | タスク固有の受け入れルーブリックはカテゴリラベルより有用です |
「最初に」は意図的です。最終的な本番評決ではなく、賢明な最初のブランチを識別します。
実際に比較できるのは何か?
仕様シートはこれらのモデルが異常に近く見えます。
| 仕様 | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|
| API モデル ID | claude-fable-5-1 | gpt-6-astra |
| コンテキストウィンドウ | 1,000,000 トークン | 1,050,000 トークン |
| 最大出力 | 128,000 トークン | 128,000 トークン |
| 入力モダリティ | テキストと画像 | テキストと画像 |
| 出力モダリティ | テキスト | テキスト |
| 推論コントロール | low、medium、high、xhigh、max | low、medium、high、xhigh、max |
| ヘッドライン入力価格 | $10 / 1M トークン | $10 / 1M トークン |
| ヘッドライン出力価格 | $50 / 1M トークン | $50 / 1M トークン |
| 発行キャッシュ読み込み価格 | $0.25 / 1M トークン | $1 / 1M トークン |
これらの数字はベンダーのモデルおよび価格ドキュメントから来ています。[1][2][4][5]タスクがツールターンの数、レビュー担当者が回答を拒否する頻度、またはエージェントが既存のリポジトリを損傷するかどうかについては教えません。これらの変数は通常請求を決定します。
価格表にも欺瞞的に重要な違いがあります。Astra の場合、272,000 トークンより長い入力は標準入力とキャッシュ入力率の 2 倍で課金され、出力は標準出力率の 1.5 倍で課金されます。より高いレートはリクエスト全体に適用されます。272,000 トークンを超える部分だけではありません。[5]したがって、300,000 トークンのリポジトリタスクは Astra の $10/$50 ヘッドラインカーブに従いません。Fable 5.1 の発行価格ページは同等の長コンテキスト乗数をリストしていません。[2]
API サーフェスはモデル品質の前に決定できます
Fable 5.1 は Anthropic Messages API と常時オン適応思考を使用します。強制ツール選択を受け入れなくなりました: tool_choice 値があるツールが必要またはその値が特定のツールを指定するとHTTP 400 エラーが返されます。自動と無効ツール選択は引き続きサポートされます。Anthropic は、アプリケーションが有効なストラクチャデータを必要とする場合、ストリクトなツールスキーマ、ツール呼び出しの明示的な指示、またはStructured Outputs を推奨します。[3]
Astra は Chat Completions と Responses の両方をサポートしますが、OpenAI のモデルページは Astra のツール呼び出しに Responses API が必要と述べています。Responses ルートはモデルの非同期ツール呼び出し、ターン途中のステアリング、および構成更新も提供します。[4][6]Chat Completions に留まるアプリケーションはこれらのエージェント機能を公平に評価できません。
これは「同じプロンプト」比較が操作的に不公平である可能性があることを意味します。テキストは一致しながら、周囲の契約は異なります: ツールスキーマ、履歴表現、推論コントロール、再試行動作、およびエージェントフレームワークによって挿入された指示。孤立したリクエスト本体ではなく、完全な作業パスを比較します。
ワークロード別ルーティング、会社ラベル別ではなく
長寿命コーディングエージェント
エージェントが何を覚えておく必要があり、何を変更することが許可されているかを尋ねることから始めます。
Fable 5.1 はターンを横切って思考ブロックを実行するための正確なルールを持っています。以前の Claude モデルから互換性のある思考ブロックを読むことができますが、古いモデルは Fable 5.1 思考ブロックを消費できません。会話もアペンドオンリーのままである必要があります: システムプロンプト、ツール定義、または以前のメッセージの変更は、後の思考ブロックを無効にできます。[3]これは、エージェントが既に Anthropic の履歴モデルを使用している場合に管理可能ですが、モデル生成間のフォールバックルーティングを複雑にする可能性があります。
Astra は、コーディングハーネスが Responses ファーストであり、長時間の実行をステアリングから利益を得る場合に魅力的です。OpenAI はまた、ターン間で推論努力を変更できる構成更新についても説明しています。[6]これらのコントロールが自動的により安全な編集を生成すると推論しないでください。評価には、スコープクリープ、不要な書き直し、テスト失敗、およびレビュー担当者の修正の確認が引き続き必要です。
どちらのモデルの場合でも、保守タスクを含めます。グリーンフィールドパズルのみではなく。有用なコーディングセットには:
- クリアなテストが失敗する単一ファイルバグ;
- 不慣れなモジュール内のクロスファイル変更;
- 明示的な「触らない」境界を持つリクエスト;
- 実装が認可されていない回帰診断;
- 多くのファイル間で 1 つの関連事実を見つける必要がある長コンテキストタスク。
リサーチおよびプロフェッショナルドキュメント
Astra のアナウンスはリサーチと、スプレッドシート、プレゼンテーション、ドキュメント、およびその他のプロフェッショナルアーティファクトの作成を強調しています。[6]これにより、出力が通常のプロスではなく OpenAI のサポートツールを通じて生成されるアーティファクトである場合、合理的な最初の候補になります。
Fable 5.1 は、リサーチエージェントが既に大規模で反復的にキャッシュされたソースパケットに依存している場合に強力な最初の候補です。より安いキャッシュ読み込みは、キャッシュされていないプロンプトトークン数の小さな違いより重要になる可能性があります。モデルの 100 万トークンコンテキストは、ソースバンドルが Astra の 272K しきい値を超えても、発行された価格カード上の標準レートに留まります。[1][2]
引用カバレッジ、請求がサイトされた通路でサポートされているかどうか、およびシステムが出典が矛盾する場合にどのように動作するかに基づいてリサーチ出力を判断します。流暢さは追跡可能性より優先されるべきではありません。
コンピュータ使用
OpenAI はコンピュータ使用を中核 Astra ワークロードとして提示し、コンピュータ使用評価の結果を発行します。[6]これは Astra をブラウザとデスクトップコントロールの最初の評価スロットに配置することをサポートしています。サンドボックス、確認ゲート、ドメイン制限、およびすべてのアクションのレコードの必要性は削除されません。
Fable 5.1 はツール駆動ワークフローに引き続き参加できますが、名前付きツールを強制できないことは、決定論的なアクションステップの設計方法を変更します。すべてのターンが 1 つの検証されたアクションを発行する必要がある場合、失敗条件下で厳密なスキーマと明示的な指示をテストしてから、移行が完了したと見なします。
非常に長いプロンプト
コンテキストウィンドウはわずか 50,000 トークン異なりますが、請求曲線はより早く異なります。3 つのバンドで評価します:
- 100K 未満。通常のタスク品質と出力長が支配する;
- 200K~272K、キャッシュ動作がますます重要になる;
- 272K を超える、Astra のロングコンテキスト乗数が経済を変更する場所。
単なるコンテキストウィンドウの存在のためだけに埋めないでください。取得、圧縮、および安定したキャッシュプレフィックスは、気晴らしとコストの両方を減らすことができます。モデル比較には同じ最大ファイルダンプではなく、同じ関連証拠を含める必要があります。
保持期間とガバナンス
Anthropic は Fable 5.1 を Covered Model としてリストし、デフォルト 30 日の API 保持期間を指定します。Zero Data Retention は一般に利用できませんが、Anthropic は、明示的な認可を受ける適格なエンタープライズ顧客の狭いパスを文書化しています。[1]OpenAI は、適格な API 顧客向けの Zero Data Retention をサポートしているように Astra をリストしています。[4]
保持ポリシーが厳しい調達要件の場合、出力比較に費やす前に適格性を書面で解決します。「ZDR をサポート」は「すべてのアカウントで ZDR が有効」と同じではありません。
ローンチベンチマークが何ができて、何ができないか
OpenAI の Astra アナウンスは、Terminal-Bench Science 0.1 で Astra の 64.6% と Claude Fable 5.1 の 52.6% を報告し、その評価で Astra の API コストが約 31% 低いという推定値を添えています。[6]Anthropic 自身の Fable 5.1 アナウンスも、そのモデルに関するそのベンチマークの 52.6% を報告しています。[7]
これはベンチマークに似たタスクの関連信号です。これは中立的な監査ではなく、無関係な仕事の低コストを確立しません。コスト推定はベンチマークのトークンとツール使用パターンに依存します。キャッシング集約的な 400K トークンエージェントは反対の価格設定幾何学に直面できます。ベンチマークがルーティングを通知するときは常に発行者、モデル構成、ハーネス、日付、およびワークロードを記録してください。
公平なテストは受け入れられた作業をその単位として取ります
デフォルトモデルを変更する前に、本番タスクから小さな評価を構築します。20 の慎重に選択されたタスクは、多くの場合、高価な障害モードをカバーしている場合、数百の合成プロンプトより有用です。
各実行に対してこのようなレコードを使用します:
| フィールド | 重要な理由 |
|---|---|
| タスク ID と入力スナップショット | 両方のパスが同じ証拠を受け取ることを確認します |
| モデル、API、および努力 | 隠された構成の違いを防止します |
| 合計入力、キャッシュ入力、および出力トークン | 請求再構築を許可します |
| ツール呼び出しと失敗したツール呼び出し | オーケストレーションオーバーヘッドを公開します |
| ウォールクロック時間 | ユーザー見える遅延をキャプチャします |
| 人間の介入 | 明確化、ステアリング、および復旧をカウントします |
| 自動チェック | テスト、スキーマ検証、またはアーティファクトチェックを記録します |
| レビュー担当者評決 | 出力が受け入れられるかどうかを定義します |
各タスクを複数回実行します。その後、計算します:
acceptance_rate = accepted_runs / total_runs
cost_per_accepted_task = total_API_cost / accepted_runs
interventions_per_accepted_task = total_human_interventions / accepted_runsモデル名を読む前にルーブリックを固定してください。コードの場合、受け入れられた結果には、すべてのテストの合格、変更が禁止されたファイルなし、および高度な重大度レビュー検出なしが必要になる場合があります。リサーチの場合、それは完全な引用サポートとゼロの製造出典を必要とする可能性があります。レイテンシとスタイルは二次スコアですが、正確さを黙って上書きすべきではありません。
結果はベテランではなくルーターの場合があります。実用的なポリシーは通常のリポジトリ編集をより安い受け入れられたパスに送信でき、非常に長いキャッシュコンテキストを Fable 5.1 に、コンピュータ使用タスクを Astra に送信するものの場合があります。デプロイ時に 現在の Fable 5.1 モデルルートと 現在の Astra モデルルートを再確認します。ゲートウェイ可用性とレート上流リスト価格から推論すべきではありません。
FAQ
コーディング用の GPT-6 Astra は Claude Fable 5.1 より優れていますか?
一般的なルールではありません。Astra の公式結果は困難なコーディングとコンピュータ使用作業をテストすることをサポートしますが、Fable 5.1 は Anthropic ネイティブ、キャッシング集約的、長コンテキストリポジトリエージェントに適している場合があります。複数の代表的なメンテナンスタスクを使用し、プロス好みではなく受け入れられた変更をスコアします。
どちらのモデルがより安いですか?
彼らは同じ標準入力と出力リスト価格を共有しています。Fable 5.1 は、より安い発行キャッシュ読み込みレートを持ち、Astra は 272K 入力トークンを超えるロングコンテキスト乗数を適用します。Astra はまだ、トークン、ツール、再試行、またはレビュー担当者の介入が少ない場合、特定のタスクでコストが低い可能性があります。
両方に同じツール呼び出しコードを使用できますか?
いいえ。Fable 5.1 は強制 tool_choice を拒否し、Astra はツール呼び出しパスに Responses API を必要とします。アプリケーションレベルのツール契約を正規化してから、各 API 用に別のアダプターを作成してテストします。
どちらがより大きなコンテキストウィンドウを持っていますか?
Astra は 1,050,000 トークンをリストし、Fable 5.1 は 1,000,000 をリストします。その 5% の違いは、関連性、キャッシング、履歴処理、および 272,000 入力トークンを超える Astra の価格変更より重要ではありません。
Fable 5.1 は Zero Data Retention をサポートしていますか?
デフォルトではありません。Anthropic はデフォルト 30 日の保持期間を文書化し、ZDR は明示的に認可されました適格エンタープライズケースを除いて利用できないと述べています。正確なアカウントとモデルの契約を確認します。
評価の勝者にすべてのリクエストを切り替えるべきですか?
ワークロードが本当に均一である場合のみ。ほとんどの本番システムはデフォルトに数年の証拠に基づく例外から利益を得ます。ルーティングルールは、各例外が測定可能な制約に名前を付ける場合、監査が容易です: コンテキストサイズ、ツールサーフェス、保持期間、レイテンシ、または受け入れ率。
ルーティング例外、すべてのリクエストではなく
モデルスイッチは狭いルールとして書かれると防衛しやすくなります: 「キャッシュ入力が 200K を超える場合は Fable 5.1 を使用」、または「レビュー担当者ゲートが通った後、コンピュータ使用キューに Astra を使用」。これらのルールは測定、価格付け、および反転可能です。「Astra がベンチマークで勝ったため Astra を使用」および「コードベースで優れていると感じるため Fable を使用」は、それはできません。
1 つの通常のデフォルトを保ち、高価な例外をルーティングし、ベンダーがモデル、価格設定、または API 契約を変更する場合は受け入れセットを再実行します。
参考文献
- Anthropic, Claude Fable 5.1 overview, accessed September 7, 2026.
- Anthropic, API pricing, accessed September 7, 2026.
- Anthropic, Migrating to Claude Fable 5.1, accessed September 7, 2026.
- OpenAI, GPT-6 Astra model documentation, accessed September 7, 2026.
- OpenAI, API pricing, accessed September 7, 2026.
- OpenAI, Introducing GPT-6 Astra, September 3, 2026.
- Anthropic, Introducing Claude Fable 5.1 and Mythos 5.1, September 1, 2026.
著者

カテゴリ
他の記事

Kimi K3完全ガイド:Moonshotの2.8T旗艦モデル
Kimi K3の仕様、構造、料金、APIを解説。1Mコンテキスト、常時推論、固定サンプリング、OpenAI互換APIでの利用方法をまとめます。


Codexで研究からプレゼン資料を生成する方法
Codexでスライド生成:研究からプレゼン資料を作成する7ステップワークフロー、アウトラインによる品質管理、主張を固定するプロンプト、自動化の限界についても。


Dreamina Seedance 2.5ユーザーガイド:30秒と長尺動画モード
Dreamina Seedance 2.5の実践ガイド。30秒生成、動画延長、長尺動画、タイムスタンプ、参照素材、編集、音声整理、絵コンテを例付きで解説します。
