Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
MiniMax M3 API: 1M Kontext, Preise und Coding-Guide
2026/08/01

MiniMax M3 API: 1M Kontext, Preise und Coding-Guide

Nutzen Sie MiniMax M3 für Code-Agenten und multimodale Analysen. Preisvergleich zwischen MiniMax und reAPI, 1M Context, Denkmodelle und Limits.

Die MiniMax M3 API wurde für Code-Agenten, langwierige Tool-Workflows und multimodale Analyse entwickelt. Sie akzeptiert Text, Bilder und Video, unterstützt bis zu eine Million Token Kontext und offenbart Denksteuerungen, um Latenz gegen tiefere Begründung einzutauschen. Die offenen Gewichte sind ebenfalls verfügbar, aber die gehostete API ist die praktische Route für Teams, die keinen 800-GB-Checkpoint betreiben wollen.

Dieser Leitfaden trennt das direkte API-Verhalten von MiniMax von der aktuellen reAPI-Route. Diese Unterscheidung ist wichtig, da Modell-IDs, Preisbänder und Anfrage-Oberflächen nicht identisch sind.

TL;DR

  • MiniMax veröffentlichte M3 am 1. Juni 2026, dann die Modellgewichte unter der MiniMax Community License.[1]
  • Das gehostete Modell unterstützt bis zu 1M Token, mit nativem Text-, Bild- und Videoinput.[2]
  • MiniMax preist direkte API-Aufrufe unterhalb und oberhalb von 512K Input-Token unterschiedlich.
  • reAPI nutzt derzeit einen einheitlichen Tarif: $0,60 Eingabe, $2,40 Ausgabe und $0,12 Cache-Lesezugriff pro Million Token.
  • Nutzen Sie M3 für Repository-Analysen, Code-Agenten, dokumentenreiche Arbeiten und multimodale Aufgaben. Gehen Sie nicht davon aus, dass ein 1M-Fenster Retrieval, Komprimierung oder Prompt-Organisation überflüssig macht.

MiniMax M3 API-Spezifikationen

SpezifikationMiniMax M3
Veröffentlichungsdatum1. Juni 2026
KontextfensterBis zu 1M Token
Garantierter gehosteter KontextMindestens 512K Token
Eingabe-ModalitätenText, Bild, Video
AusgabeText
BegründungsmodiAktiviert, adaptiv, deaktiviert
Empfohlenes Samplingtemperature: 1.0, top_p: 0.95
reAPI Modell-IDminimax/minimax-m3
reAPI Endpunkt/v1/chat/completions
GewichteVeröffentlicht auf Hugging Face und GitHub

MiniMax beschreibt M3 als ein Code- und Agenten-Modell, das von MiniMax Sparse Attention angetrieben wird. Die Architektur ist darauf ausgelegt, die Rechen- und Speicherkosten der Million-Token-Aufmerksamkeit zu reduzieren. Dies ist eine Vendorangabe über seine Architektur, keine Garantie, dass jede Million-Token-Anfrage schnell oder gleich genau über die gesamte Sequenz hinweg ist.

Der veröffentlichte Checkpoint hat etwa 427 Milliarden Parameter und das Haupt-Hugging-Face-Repository ist grob 854GB vor lokalem Serving-Overhead. Die lokale Bereitstellung ist über Frameworks wie SGLang, vLLM, Transformers und KTransformers möglich, aber es ist kein beiläufiges Single-GPU-Modell.[1]

MiniMax M3 API-Preisgestaltung erklärt

MiniMax separiert bei seiner direkten API gewöhnliche und Long-Context-Aufrufe. Seine aktuelle Promotionalpreisliste zeigt die folgenden Standard-Service-Preise:

RouteEingabe / 1MAusgabe / 1MCache-Lesezugriff / 1M
MiniMax direkt, Eingabe ≤512K$0,30$1,20$0,06
MiniMax direkt, Eingabe 512K–1M$0,60$2,40$0,12
reAPI aktueller Tarif$0,60$2,40$0,12

Die direkten Preise oben sind Rabattsätze, die von MiniMax am 1. August 2026 angezeigt werden. Die Seite zeigt auch höhere durchgestrichene Listenpreise, daher sollten Produktionsbudgets das Abrufdatum speichern, anstatt den Rabatt als dauernde Eigenschaft des Modells zu behandeln.[3]

reAPI nutzt einen einheitlichen Tokentarif, anstatt den Preis an der 512K-Grenze zu ändern. Dies ist einfacher zu schätzen, obwohl Short-Context-Aufrufe durch MiniMax direkten Promotionsebene billiger sein können.

MiniMax M3-Kontext- und Preislandkarte, die die 512K-Grenze, 1M-Fenster und aktuellen reAPI-Flat-Rate zeigen

Ein realistisches Kostenbeispiel

Angenommen, ein Repository-Analysejob sendet 180.000 nicht gecachte Input-Token und gibt 12.000 Output-Token über reAPI zurück:

input  = 180.000 / 1.000.000 × $0,60 = $0,1080
output =  12.000 / 1.000.000 × $2,40 = $0,0288
total  = $0,1368

Der gleiche Workflow wird billiger, wenn wiederholte Präfixe den Cache treffen. Stellen Sie stabile Tool-Definitionen, Repository-Anweisungen und System-Kontext zuerst ein. halten Sie wechselnde Task-Details am Ende. MiniMax sagt, dass das automatische Prompt-Caching Präfixabgleich nutzt und auf Eingaben von mindestens 512 Token angewendet wird.[4]

So rufen Sie MiniMax M3 über reAPI auf

Die reAPI-Route verwendet die vertraute OpenAI Chat Completions Form. Die wichtige Einzelheit ist die Namespaced-Modell-ID.

curl https://api.reapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $REAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "minimax/minimax-m3",
    "messages": [
      {
        "role": "system",
        "content": "Review code conservatively. State assumptions before editing."
      },
      {
        "role": "user",
        "content": "Find the race condition in this queue worker and propose a minimal patch."
      }
    ],
    "temperature": 1,
    "top_p": 0.95,
    "max_tokens": 8192
  }'

Nutzen Sie die exakte ID, die von der Modellermittlung zurückgegeben wird, wenn Sie mit einem Produktionsschlüssel integrieren. Die MiniMax M3 Modellseite und API-Dokumentation zeigen die aktuelle reAPI-Oberfläche.

Der direkte Endpunkt von MiniMax nutzt MiniMax-M3 statt der reAPI Namespaced-ID. Kopieren Sie die Modellzeichenfolge eines Anbieters nicht in die Anfrage eines anderen Anbieters und gehen Sie davon aus, dass das Gateway sie normalisiert.

Denkmodelle und Agenten-Verhalten

Die offene Modellkarte dokumentiert drei Begründungsmodi:

  • enabled: Immer explizite Begründung verwenden.
  • adaptive: Lassen Sie M3 entscheiden, wann zusätzliche Begründung nützlich ist.
  • disabled: Latenz minimieren und Durchsatz maximieren.

Beginnen Sie bei Code-Überprüfung, Debugging, mehrstufiger Planung und Tool-reichen Agenten mit adaptiver oder aktivierter Begründung. Bei Autovervollständigung, Klassifizierung und kurzen Transformationen kann deaktivierte Begründung die Verzögerung reduzieren. MiniMax sagt, dass Denken an und aus die gleichen direkten API-Token-Tarife teilen; der Kostenunterschied ergibt sich daraus, wie viele Token die Anfrage letztendlich verbraucht, nicht aus einem separaten Begründungszuschlag.[2]

Begründungssteuerungen können sich über gehostete Routen unterscheiden. Wenn eine Anwendung von einem bestimmten thinking-Feld abhängt, testen Sie das akzeptierte Anfrage-Schema vor dem Versand, anstatt davon auszugehen, dass alle OpenAI-kompatiblen Endpunkte es weiterleiten.

Wo das Million-Token-Fenster hilft

Ein langer Kontextfenster ist am nützlichsten, wenn das Modell mehrere verwandte Artefakte auf einmal benötigt:

  • ein Repository plus Issue-Verlauf und Build-Protokolle;
  • ein langer Vertragssatz mit Cross-Document-Verweisen;
  • ein Video-Transkript, das mit ausgewählten Frames gepaart ist;
  • mehrstufige Agenten-Spuren, die für spätere Entscheidungen verfügbar bleiben sollten.

Es ist weniger nützlich, wenn die Aufforderung ein ungefilterten Dump ist. Große Eingaben erhöhen die Latenz und können das relevante Beweis begraben. Ein Produktions-Agent sollte immer noch Dateien deduplizieren, wahrscheinliche Abschnitte zuerst abrufen, abgeschlossene Tool-Spuren zusammenfassen und genaue Quellstandorte zur Überprüfung bewahren.

Wenn Ihre Entscheidung hauptsächlich über offene Gewichte und verwaltete Zuverlässigkeit ist, vergleichen Sie Kimi K3 mit Claude Opus 5. Ein weiteres kostengünstiges One-Million-Token-Coding-Modell finden Sie im GLM-5.2 API-Leitfaden.

MiniMax M3-Einschränkungen

Die Hauptbeschränkung ist die operationale Skalierung. Die Veröffentlichung der Gewichte gibt Teams Bereitstellungskontrolle, macht aber ein 427B-Parameter-Multimodal-Modell nicht einfach zu bedienen. Die Quantisierung reduziert den Speicher, während lange Kontexte KV-Cache und Durchsatzbelastung zurück in das System hinzufügen.

Benchmark-Ansprüche benötigen auch Kontext. MiniMax berichtet 59,0% bei SWE-Bench Pro und 66,0% bei Terminal-Bench 2.1, aber die Versionshinweise erklären, dass verschiedene Modelle manchmal unterschiedliche Gerüste nutzten und dass mehrere Ergebnisse von internen Infrastrukturen stammten.[2] Behandeln Sie diese Scores als Beweis beabsichtigter Fähigkeit, nicht als Vorhersage des Erfolgs in Ihrem eigenen Agenten.

Schließlich kann die Ein-Million-Token-Verfügbarkeit von der Service-Kapazität abhängen. MiniMax beschreibt 512K als garantiert und das obere Band als bis zu 1M. Testen Sie die genaue Region, das Konto, die Parallelität und die Anfragegröße, die Sie verwenden möchten.

FAQ

Ist MiniMax M3 offen gewichtet?

Ja. MiniMax veröffentlicht M3-Gewichte auf Hugging Face und Code auf GitHub unter der MiniMax Community License. Überprüfen Sie diese Lizenz vor kommerzieller Bereitstellung.

Wie ist das Kontextfenster der MiniMax M3 API?

Die gehostete API unterstützt bis zu eine Million Token, wobei MiniMax 512K als garantiertes Minimum beschreibt. Aufrufe über 512K verwenden ein höheres direktes Preisband.

Unterstützt MiniMax M3 Bilder und Video?

Ja. MiniMax beschreibt M3 als nativ multimodal mit Text-, Bild- und Video-Input. Die Ausgabe ist Text statt generierte Bilder oder Video.

Welche Modell-ID nutzt reAPI?

Verwenden Sie minimax/minimax-m3 mit https://api.reapi.ai/v1/chat/completions.

Ist MiniMax M3 billiger als GPT oder Claude?

Seine Token-Raten sind niedriger als viele Frontier Managed Models, aber Kosten pro Token ist nicht Kosten pro abgeschlossener Task. Vergleichen Sie Tool-Zuverlässigkeit, Wiederholungen, Ausgabelänge, Latenz und Überprüfungsaufwand in Ihrer eigenen Arbeitslast.

Fazit

Die MiniMax M3 API ist eine starke Wahl für Teams, die langen Kontext, Code-Agenten, multimodale Eingabe und die Möglichkeit benötigen, später selbst zu hosten. Verwenden Sie zuerst die gehostete Route, wenn Sie vorhersehbare Operationen wollen; evaluieren Sie die offenen Gewichte, wenn Datenkontrolle oder Anpassung die Infrastruktur rechtfertigt. Das Wichtigste ist: Budgetieren Sie das richtige Kontextband und testen Sie das Agenten-Harnisch — nicht nur den Modellnamen.

References

  1. MiniMax AI. MiniMax M3 official model repository and local deployment guidance. huggingface.co/MiniMaxAI/MiniMax-M3
  2. MiniMax. MiniMax M3: Frontier Coding, 1M Context, Native Multimodality. minimax.io/blog/minimax-m3
  3. MiniMax API Platform. MiniMax M3 pay-as-you-go pricing. platform.minimax.io
  4. MiniMax API Docs. Automatic prompt caching. platform.minimax.io/docs/api-reference/text-prompt-caching