Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
MiniMax M3 : guide de codage et contexte d'un million
2026/08/01

MiniMax M3 : guide de codage et contexte d'un million

Utilisez l'API MiniMax M3 pour le codage et les agents. Comparez tarifs reAPI et MiniMax, contexte d'un million de tokens, modes de réflexion.

L'API MiniMax M3 est conçue pour les agents de codage, les workflows d'outils de longue durée et l'analyse multimodale. Elle accepte du texte, des images et des vidéos, supporte jusqu'à un million de tokens de contexte, et expose des contrôles de réflexion pour arbitrer entre la latence et le raisonnement plus approfondi. Les poids ouverts sont également disponibles, mais l'API hébergée est la route pratique pour les équipes qui ne veulent pas gérer un checkpoint de classe 800 Go.

Ce guide sépare le comportement de l'API directe de MiniMax de la route reAPI actuelle. Cette distinction importe car les ID de modèles, les bandes tarifaires et les surfaces de requête ne sont pas identiques.

TL;DR

  • MiniMax a lancé M3 le 1er juin 2026, puis publié les poids du modèle sous la licence communautaire MiniMax.[1]
  • Le modèle hébergé supporte jusqu'à un million de tokens, avec entrée texte, image et vidéo native.[2]
  • MiniMax fixe les prix des appels API directs différemment au-dessous et au-dessus de 512K tokens d'entrée.
  • reAPI utilise actuellement un tarif unique : $0,60 entrée, $2,40 sortie et $0,12 lecture du cache par million de tokens.
  • Utilisez M3 pour l'analyse de dépôts, les agents de codage, le travail chargé de documents et les tâches multimodales. Ne supposez pas qu'une fenêtre d'un million de tokens rend inutile la récupération, la compaction ou l'organisation des prompts.

Spécifications de l'API MiniMax M3

SpécificationMiniMax M3
Date de sortie1er juin 2026
Fenêtre de contexteJusqu'à un million de tokens
Contexte hébergé garantiAu moins 512K tokens
Modalités d'entréeTexte, image, vidéo
SortieTexte
Modes de raisonnementActivé, adaptatif, désactivé
Échantillonnage recommandétemperature: 1.0, top_p: 0.95
ID de modèle reAPIminimax/minimax-m3
Point de terminaison reAPI/v1/chat/completions
PoidsPubliés sur Hugging Face et GitHub

MiniMax décrit M3 comme un modèle de codage et d'agent alimenté par l'attention clairsemée de MiniMax. L'architecture est conçue pour réduire le coût informatique et mémoire de l'attention avec un million de tokens. Ceci est une affirmation du vendeur sur son architecture, non une garantie que chaque requête d'un million de tokens sera rapide ou également précise sur toute la séquence.

Le checkpoint publié compte environ 427 milliards de paramètres et le principal dépôt Hugging Face fait approximativement 854 Go avant les frais de service local. Le déploiement local est possible via des frameworks comme SGLang, vLLM, Transformers et KTransformers, mais ce n'est pas un modèle GPU unique désinvolte.[1]

Tarification de l'API MiniMax M3 expliquée

L'API directe de MiniMax sépare les appels ordinaires et ceux à long contexte. Sa grille tarifaire promotionnelle actuelle énumère les prix de service standard suivants :

RouteEntrée / 1MSortie / 1MLecture du cache / 1M
MiniMax direct, entrée ≤512K$0,30$1,20$0,06
MiniMax direct, entrée 512K–1M$0,60$2,40$0,12
Tarif actuel reAPI$0,60$2,40$0,12

Les prix directs ci-dessus sont les tarifs réduits affichés par MiniMax le 1er août 2026. La page affiche également des prix barés plus élevés, donc les budgets de production doivent stocker la date de récupération plutôt que de traiter la réduction comme une propriété permanente du modèle.[3]

reAPI utilise un tarif de token unique au lieu de changer le prix à la limite des 512K. C'est plus facile à estimer, bien que les appels de contexte court puissent être moins chers via le palier promotionnel direct de MiniMax.

Carte du contexte et des tarifs de MiniMax M3 montrant la limite des 512K, la fenêtre d'un million de tokens et le tarif unique actuel de reAPI

Un exemple de coût réaliste

Supposons qu'un travail d'analyse de dépôt envoie 180 000 tokens d'entrée en cache et renvoie 12 000 tokens de sortie via reAPI :

input  = 180,000 / 1,000,000 × $0.60 = $0.1080
output =  12,000 / 1,000,000 × $2.40 = $0.0288
total  = $0.1368

Le même workflow devient moins cher lorsque les préfixes répétés atteignent le cache. Mettez les définitions d'outils stables, les instructions de dépôt et le contexte système en premier ; gardez les détails de tâches changeantes vers la fin. MiniMax dit que la mise en cache automatique des prompts utilise la correspondance de préfixe et s'applique aux entrées d'au moins 512 tokens.[4]

Comment appeler MiniMax M3 via reAPI

La route reAPI utilise la forme familière d'OpenAI Chat Completions. Le détail important est l'ID de modèle avec espace de noms.

curl https://api.reapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $REAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "minimax/minimax-m3",
    "messages": [
      {
        "role": "system",
        "content": "Review code conservatively. State assumptions before editing."
      },
      {
        "role": "user",
        "content": "Find the race condition in this queue worker and propose a minimal patch."
      }
    ],
    "temperature": 1,
    "top_p": 0.95,
    "max_tokens": 8192
  }'

Utilisez l'ID exact renvoyé par la découverte du modèle lors de l'intégration avec une clé de production. La page du modèle MiniMax M3 et la documentation de l'API affichent la surface reAPI actuelle.

Le point de terminaison direct de MiniMax utilise MiniMax-M3 au lieu de l'ID avec espace de noms reAPI. Ne copiez pas la chaîne de modèle d'un fournisseur dans la requête d'un autre fournisseur et ne supposez pas que la passerelle la normalisera.

Modes de réflexion et comportement des agents

La fiche de modèle ouverte documente trois modes de raisonnement :

  • enabled : toujours utiliser le raisonnement explicite.
  • adaptive : laisser M3 décider quand le raisonnement supplémentaire est utile.
  • disabled : minimiser la latence et maximiser le débit.

Pour l'examen de code, le débogage, la planification en plusieurs étapes et les agents à outils lourds, commencez par un raisonnement adaptatif ou activé. Pour l'autocomplétion, la classification et les courtes transformations, le raisonnement désactivé peut réduire le délai. MiniMax dit que penser activé et désactivé partagent les mêmes tarifs de tokens de l'API directe ; la différence de coût provient du nombre de tokens que la requête consomme finalement, et non d'une surcharge de raisonnement séparé.[2]

Les contrôles de raisonnement peuvent différer selon les routes hébergées. Si une application dépend d'un champ thinking particulier, testez le schéma de requête accepté avant de déployer plutôt que de supposer que tous les points de terminaison compatibles OpenAI le transmettent.

Où la fenêtre d'un million de tokens aide

Une fenêtre de contexte long est plus utile lorsque le modèle a besoin de plusieurs artefacts liés à la fois :

  • un dépôt plus l'historique des problèmes et les journaux de construction ;
  • un long ensemble de contrats avec des références entre documents ;
  • une transcription vidéo appairée avec des images sélectionnées ;
  • les traces d'agents en plusieurs étapes qui doivent rester disponibles pour les décisions ultérieures.

C'est moins utile quand le prompt est un vidage non filtré. Les grandes entrées augmentent la latence et peuvent enterrer les preuves pertinentes. Un agent de production devrait toujours dédupliquer les fichiers, récupérer les sections probables en premier, résumer les traces d'outils complétées et conserver les emplacements sources exacts pour la vérification.

Si votre décision porte principalement sur les poids ouverts et la fiabilité gérée, comparez Kimi K3 avec Claude Opus 5. Pour un autre modèle de codage rentable avec un million de tokens, consultez le guide de l'API GLM-5.2.

Limitations de MiniMax M3

La principale contrainte est l'échelle opérationnelle. Publier les poids donne aux équipes le contrôle du déploiement, mais cela ne rend pas facile de servir un modèle multimodal de 427 milliards de paramètres. La quantification réduit la mémoire, tandis que les longs contextes ajoutent à nouveau la pression du cache KV et du débit au système.

Les affirmations de benchmarks ont aussi besoin de contexte. MiniMax rapporte 59,0 % sur SWE-Bench Pro et 66,0 % sur Terminal-Bench 2.1, mais les notes de version expliquent que différents modèles utilisaient parfois des constructions différentes et que plusieurs résultats provenaient d'une infrastructure interne.[2] Traitez ces scores comme une preuve d'aptitude prévue, non une prévision du succès dans votre propre agent.

Enfin, la disponibilité d'un million de tokens peut dépendre de la capacité du service. MiniMax décrit 512K comme garanti et la bande supérieure comme jusqu'à 1M. Testez la région exacte, le compte, la concurrence et la taille de requête que vous prévoyez d'utiliser.

FAQ

MiniMax M3 est-il open source ?

Oui. MiniMax publie les poids M3 sur Hugging Face et le code sur GitHub sous la licence communautaire MiniMax. Examinez cette licence avant le déploiement commercial.

Quelle est la fenêtre de contexte de l'API MiniMax M3 ?

L'API hébergée supporte jusqu'à un million de tokens, MiniMax décrivant 512K comme le minimum garanti. Les appels au-dessus de 512K utilisent une bande tarifaire directe plus élevée.

MiniMax M3 supporte-t-il les images et les vidéos ?

Oui. MiniMax décrit M3 comme nativement multimodal avec entrée texte, image et vidéo. Sa sortie est du texte plutôt que des images ou vidéos générées.

Quel ID de modèle reAPI utilise-t-on ?

Utilisez minimax/minimax-m3 avec https://api.reapi.ai/v1/chat/completions.

MiniMax M3 est-il moins cher que GPT ou Claude ?

Ses tarifs de tokens sont inférieurs à ceux de nombreux modèles gérés de pointe, mais le coût par token n'est pas le coût par tâche complétée. Comparez la fiabilité des outils, les retries, la longueur de sortie, la latence et l'effort de révision sur votre propre charge de travail.

Conclusion

L'API MiniMax M3 est un excellent choix pour les équipes qui ont besoin d'un long contexte, d'agents de codage, d'entrée multimodale et de l'option de s'auto-héberger plus tard. Utilisez d'abord la route hébergée quand vous voulez des opérations prévisibles ; évaluez les poids ouverts quand le contrôle des données ou la personnalisation justifie l'infrastructure. Plus important encore, budgétez la bande de contexte correcte et testez le harnais d'agent—pas seulement le nom du modèle.

Références

  1. MiniMax AI. Dépôt officiel du modèle MiniMax M3 et guide de déploiement local. huggingface.co/MiniMaxAI/MiniMax-M3
  2. MiniMax. MiniMax M3 : codage de pointe, contexte d'un million de tokens, multimodalité native. minimax.io/blog/minimax-m3
  3. MiniMax API Platform. Tarification à l'usage de MiniMax M3. platform.minimax.io
  4. MiniMax API Docs. Mise en cache automatique des prompts. platform.minimax.io/docs/api-reference/text-prompt-caching