
MiniMax M3 API:100万トークン、料金、Coding入門
MiniMax M3 APIでコーディング、エージェント、マルチモーダル処理に対応します。公式とreAPI料金の比較、100万トークン動作、思考モード、制限事項をまとめます。
MiniMax M3 API は、コード生成エージェント、長実行ツールワークフロー、マルチモーダル分析向けに設計されています。テキスト、画像、ビデオを受け取り、最大100万トークンのコンテキストをサポートし、レイテンシと推論の深さをトレードオフする思考制御を備えています。オープンウェイトも利用可能ですが、800GBクラスのチェックポイントを運用したくないチームにとっては、ホスト型APIが実用的な選択肢です。
本ガイドでは、MiniMaxの直接API動作と現在のreAPIルートを区別します。モデルID、価格帯、リクエストサーフェスが異なるため、この区別は重要です。
TL;DR
- MiniMaxは2026年6月1日にM3をリリースし、MiniMax Community Licenseの下でモデルウェイトを公開しました。[1]
- ホスト型モデルは100万トークンまで対応し、ネイティブなテキスト、画像、ビデオ入力に対応しています。[2]
- MiniMaxは512Kを超えるかどうかで直接API呼び出しの価格が異なります。
- reAPIは現在、統一レート:入力$0.60、出力$2.40、キャッシュ読み取り$0.12(百万トークン単位) を採用しています。
- M3はリポジトリ分析、コード生成エージェント、ドキュメント重視の作業、マルチモーダルタスク向けです。100万トークンウィンドウがリトリーバル、圧縮、プロンプト整理を不要にするとは考えないでください。
MiniMax M3 API仕様
| 仕様 | MiniMax M3 |
|---|---|
| リリース日 | 2026年6月1日 |
| コンテキストウィンドウ | 最大100万トークン |
| 保証されたホスト型コンテキスト | 最小512Kトークン |
| 入力モダリティ | テキスト、画像、ビデオ |
| 出力 | テキスト |
| 推論モード | 有効、適応的、無効 |
| 推奨サンプリング | temperature: 1.0、top_p: 0.95 |
| reAPIモデルID | minimax/minimax-m3 |
| reAPIエンドポイント | /v1/chat/completions |
| ウェイト | Hugging FaceおよびGitHubで公開 |
MiniMaxはM3をMiniMax Sparse Attentionが駆動するコーディング・エージェント向けモデルとしています。このアーキテクチャは、100万トークン注意の計算およびメモリコストを削減するよう設計されています。これはアーキテクチャに関するベンダー主張であり、すべての100万トークンリクエストが高速であるか、全シーケンスにわたって均等に正確であることを保証するものではありません。
公開チェックポイントは約4270億パラメータで、メインのHugging Faceリポジトリはローカルサービングオーバーヘッド前で約854GBです。SGLang、vLLM、Transformers、KTransformersなどのフレームワークを通じてローカル展開は可能ですが、気軽なシングルGPUモデルではありません。[1]
MiniMax M3 API価格の説明
MiniMaxの直接APIは、通常とロングコンテキストの呼び出しを区別します。現在のプロモーション価格表は以下の標準サービス価格を示しています。
| ルート | 入力 / 100万 | 出力 / 100万 | キャッシュ読み取り / 100万 |
|---|---|---|---|
| MiniMax直接、入力 ≤512K | $0.30 | $1.20 | $0.06 |
| MiniMax直接、入力 512K–100万 | $0.60 | $2.40 | $0.12 |
| reAPI現在のレート | $0.60 | $2.40 | $0.12 |
上記の直接価格はMiniMaxが2026年8月1日に表示するディスカウント価格です。ページには更に高い打ち消し価格も表示されるため、本番予算は割引を恒久的なモデル属性として扱うのではなく、取得日を記録する必要があります。[3]
reAPIは512Kの境界で価格を変更する代わりに、統一トークンレートを使用しています。これは見積もりやすいですが、ショートコンテキスト呼び出しはMiniMaxの直接プロモーションレートでより安くなる可能性があります。

現実的なコスト例
リポジトリ分析ジョブが180,000個のキャッシュされていない入力トークンを送信し、reAPI経由で12,000個の出力トークンを返すとします。
input = 180,000 / 1,000,000 × $0.60 = $0.1080
output = 12,000 / 1,000,000 × $2.40 = $0.0288
total = $0.1368同じワークフローは、繰り返されるプリフィックスがキャッシュにヒットするとより安くなります。安定したツール定義、リポジトリ指示、システムコンテキストを最初に配置し、変更されるタスク詳細を最後に保ちます。MiniMaxはプリフィックスマッチングを使用して自動プロンプトキャッシング機能を採用しており、最低512トークンの入力に適用されると述べています。[4]
reAPI経由でMiniMax M3を呼び出す方法
reAPIルートは、おなじみのOpenAI Chat Completions形式を使用します。重要な詳細はネームスペース付きモデルIDです。
curl https://api.reapi.ai/v1/chat/completions \
-H "Authorization: Bearer $REAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "minimax/minimax-m3",
"messages": [
{
"role": "system",
"content": "Review code conservatively. State assumptions before editing."
},
{
"role": "user",
"content": "Find the race condition in this queue worker and propose a minimal patch."
}
],
"temperature": 1,
"top_p": 0.95,
"max_tokens": 8192
}'本番キーと統合する場合は、モデルディスカバリーが返す正確なIDを使用してください。MiniMax M3モデルページおよびAPIドキュメントは、現在のreAPIサーフェスを表示しています。
MiniMaxの直接エンドポイントはreAPIネームスペースIDの代わりにMiniMax-M3を使用しています。あるプロバイダーのモデル文字列を別のプロバイダーのリクエストにコピーして、ゲートウェイがそれを正規化すると想定しないでください。
思考モードとエージェント動作
オープンモデルカードは3つの推論モードを文書化しています。
enabled:常に明示的な推論を使用します。adaptive:追加の推論が有用な場合はM3に決定させます。disabled:レイテンシを最小化し、スループットを最大化します。
コード審査、デバッグ、マルチステップ計画、ツール豊富なエージェントの場合は、適応的または有効な推論から始めてください。自動補完、分類、短い変換の場合、無効化された推論は遅延を低減できます。MiniMaxはオンとオフの思考が同じ直接API トークンレートを共有していると述べており、コスト差はリクエストが最終的に消費するトークン数から生じるもので、別の推論サーチャージではありません。[2]
推論制御はホスト型ルート全体で異なる場合があります。アプリケーションが特定のthinkingフィールドに依存する場合は、すべてのOpenAI互換エンドポイントが転送すると仮定するのではなく、配送前に受け入れられたリクエストスキーマをテストしてください。
100万トークンウィンドウが役立つ場所
長いコンテキストウィンドウは、モデルが複数の関連アーティファクトを同時に必要とする場合に最も役立ちます。
- リポジトリ + イシュー履歴とビルドログ;
- クロスドキュメント参照を含む長いコントラクトセット;
- ビデオトランスクリプト と選択されたフレーム;
- 後の決定のために利用可能であるべき多段階エージェント トレース。
プロンプトがフィルターされていないダンプの場合、あまり有用ではありません。大きな入力はレイテンシを増加させ、関連する証拠を埋める可能性があります。本番エージェントは、依然としてファイルを重複排除し、可能性の高いセクションを最初に取得し、完了したツールトレースを要約し、検証用の正確なソース位置を保持する必要があります。
決定が主にオープンウェイトと管理された信頼性に基づいている場合は、Kimi K3とClaude Opus 5を比較してください。別の低コスト100万トークンコーディングモデルについては、GLM-5.2 APIガイドをご覧ください。
MiniMax M3の制限事項
主な制約は操作スケールです。ウェイトを公開するとチームに展開制御を与えますが、427Bパラメータマルチモーダルモデルは簡単に提供できません。量子化はメモリを削減しますが、長いコンテキストはKVキャッシュとスループットプレッシャーをシステムに戻します。
ベンチマーク主張にはコンテキストも必要です。MiniMaxはSWE-Bench Proで59.0%、Terminal-Bench 2.1で66.0%を報告していますが、リリースノートではさまざまなモデルが異なるスキャフォルディングを使用することもあり、複数の結果は内部インフラストラクチャから得られたことを説明しています。[2]これらのスコアを、独自のエージェントでの成功の予測ではなく、意図された機能の証拠として扱ってください。
最後に、100万トークンの可用性はサービス容量に依存する可能性があります。MiniMaxは512Kを保証され、上限帯は最大100万と説明しています。計画している正確なリージョン、アカウント、並行性、リクエストサイズをテストしてください。
FAQ
MiniMax M3はオープンウェイトですか?
はい。MiniMaxはHugging FaceのM3ウェイトとGitHubのコードをMiniMax Community Licenseの下で公開しています。商用展開前にこのライセンスを確認してください。
MiniMax M3 APIのコンテキストウィンドウは何ですか?
ホスト型APIは最大100万トークンをサポートし、MiniMaxは512Kを保証最小値として説明しています。512Kを超えるコールは、より高い直接価格帯を使用します。
MiniMax M3は画像とビデオに対応していますか?
はい。MiniMaxはM3をテキスト、画像、ビデオ入力を備えたネイティブマルチモーダルとして説明しています。その出力は生成された画像またはビデオではなくテキストです。
reAPIはどのモデルIDを使用していますか?
https://api.reapi.ai/v1/chat/completionsでminimax/minimax-m3を使用してください。
MiniMax M3はGPTやClaudeより安いですか?
そのトークンレートは多くのフロンティア管理モデルより低いですが、トークンあたりのコストは完了したタスクあたりのコストではありません。ツール信頼性、再試行、出力長、レイテンシ、独自のワークロードで検討努力を比較してください。
結論
MiniMax M3 APIは、長いコンテキスト、コード生成エージェント、マルチモーダル入力、および後でセルフホスティングする選択肢が必要なチームに適しています。予測可能な操作が必要な場合は最初にホスト型ルートを使用し、データ制御またはカスタマイズがインフラストラクチャを正当化する場合はオープンウェイトを評価してください。最も重要なのは、正しいコンテキスト帯域を予算化し、モデル名だけでなくエージェント ハーネスをテストすることです。
References
- MiniMax AI. MiniMax M3 official model repository and local deployment guidance. huggingface.co/MiniMaxAI/MiniMax-M3
- MiniMax. MiniMax M3: Frontier Coding, 1M Context, Native Multimodality. minimax.io/blog/minimax-m3
- MiniMax API Platform. MiniMax M3 pay-as-you-go pricing. platform.minimax.io
- MiniMax API Docs. Automatic prompt caching. platform.minimax.io/docs/api-reference/text-prompt-caching
他の記事

Qwen Image 2 API:料金・テキスト・編集
Qwen Image 2 APIで画像生成と編集に対応。現行料金、対応比率、プロンプト上限、reAPIパラメータ、安全性チェック、コード例を解説。


Seedance 2.0の「Not Eligible」エラー:原因と有効な対処法
Seedance 2.0のnot eligibleエラーは、ByteDance APIの顔とIP検出が原因です。発生条件、確認すべきモデルと入力方式、正規の対処法を解説します。


GPT-6 Astraはどこで使える?Chat・Work・Codex・API
2026年9月7日時点のGPT-6 Astraアクセス状況。ChatGPT・Work・Codex・APIそれぞれでの利用可否と確認方法、アクセス不可時の対処法を解説します。
