Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
API de MiniMax M3: millón de tokens, precios y guía 2026
2026/08/01

API de MiniMax M3: millón de tokens, precios y guía 2026

Usa MiniMax M3 para agentes de codificación y análisis multimodal. Compara precios, contexto, pensamiento y límites entre API oficial y reAPI.

La API de MiniMax M3 está construida para agentes de codificación, flujos de trabajo de herramientas de larga ejecución y análisis multimodal. Acepta texto, imágenes y vídeo, admite hasta un millón de tokens de contexto e expone controles de pensamiento para intercambiar latencia contra razonamiento más profundo. Los pesos abiertos también están disponibles, pero la API hospedada es la ruta práctica para equipos que no quieren operar un punto de control de clase 800GB.

Esta guía separa el comportamiento de API directa de MiniMax de la ruta actual de reAPI. Esta distinción es importante porque los ID de modelo, bandas de precio y superficies de solicitud no son idénticos.

TL;DR

  • MiniMax lanzó M3 el 1 de junio de 2026 y luego publicó los pesos del modelo bajo la Licencia Comunitaria de MiniMax.[1]
  • El modelo hospedado admite hasta un millón de tokens, con entrada de texto, imagen y vídeo nativa.[2]
  • MiniMax fija el precio de las llamadas de API directa de manera diferente por debajo y por encima de 512K tokens de entrada.
  • reAPI actualmente usa una tasa plana: entrada de $0.60 por millón de tokens, salida de $2.40 y lectura de caché de $0.12 por millón de tokens.
  • Usa M3 para análisis de repositorios, agentes de codificación, trabajo pesado de documentos y tareas multimodales. No supongas que una ventana de un millón de tokens hace innecesarios la recuperación, compactación u organización de prompts.

Especificaciones de la API de MiniMax M3

EspecificaciónMiniMax M3
Fecha de lanzamiento1 de junio de 2026
Ventana de contextoHasta un millón de tokens
Contexto hospedado garantizadoAl menos 512K tokens
Modalidades de entradaTexto, imagen, vídeo
SalidaTexto
Modos de razonamientoHabilitado, adaptativo, deshabilitado
Muestreo recomendadotemperature: 1.0, top_p: 0.95
ID de modelo de reAPIminimax/minimax-m3
Punto de entrada de reAPI/v1/chat/completions
PesosPublicados en Hugging Face y GitHub

MiniMax describe M3 como un modelo de codificación y agentes impulsado por Atención Dispersa de MiniMax. La arquitectura está diseñada para reducir el costo de cálculo y memoria de la atención de millones de tokens. Se trata de un reclamo de vendedor sobre su arquitectura, no una garantía de que todas las solicitudes de un millón de tokens serán rápidas o igualmente precisas en toda la secuencia.

El punto de control publicado tiene aproximadamente 427 mil millones de parámetros y el repositorio principal de Hugging Face tiene aproximadamente 854GB antes de la sobrecarga de servicio local. El despliegue local es posible a través de marcos como SGLang, vLLM, Transformers y KTransformers, pero no es un modelo casual de GPU única.[1]

Fijación de precios de la API de MiniMax M3 explicada

La API directa de MiniMax separa llamadas ordinarias y de contexto largo. Su tarjeta de tarifas promocional actual enumera los siguientes precios de servicio estándar:

RutaEntrada / 1MSalida / 1MLectura de caché / 1M
MiniMax directo, entrada ≤512K$0.30$1.20$0.06
MiniMax directo, entrada 512K–1M$0.60$2.40$0.12
Tasa actual de reAPI$0.60$2.40$0.12

Los precios directos anteriores son tarifas con descuento mostradas por MiniMax el 1 de agosto de 2026. La página también muestra precios de lista más altos tachados, por lo que los presupuestos de producción deben almacenar la fecha de recuperación en lugar de tratar el descuento como una propiedad permanente del modelo.[3]

reAPI usa una tasa de token plana en lugar de cambiar el precio en el límite de 512K. Esto es más fácil de estimar, aunque las llamadas de contexto corto pueden ser más baratas a través del nivel promocional directo de MiniMax.

Mapa de contexto y precios de M3 de MiniMax que muestra el límite de 512K, ventana de 1M y tasa plana actual de reAPI

Un ejemplo de costo realista

Supón que un trabajo de análisis de repositorio envía 180.000 tokens de entrada sin caché y devuelve 12.000 tokens de salida a través de reAPI:

entrada  = 180.000 / 1.000.000 × $0.60 = $0.1080
salida   =  12.000 / 1.000.000 × $2.40 = $0.0288
total    = $0.1368

El mismo flujo de trabajo se vuelve más barato cuando los prefijos repetidos alcanzan el caché. Pon definiciones de herramientas estables, instrucciones de repositorio y contexto del sistema primero; mantén detalles de tareas que cambian cerca del final. MiniMax dice que el almacenamiento automático en caché de prompts usa coincidencia de prefijos y se aplica a entradas de al menos 512 tokens.[4]

Cómo llamar a MiniMax M3 a través de reAPI

La ruta de reAPI usa la forma familiar de OpenAI Chat Completions. El detalle importante es el ID de modelo con espacio de nombres.

curl https://api.reapi.ai/v1/chat/completions \
  -H "Authorization: Bearer $REAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "minimax/minimax-m3",
    "messages": [
      {
        "role": "system",
        "content": "Review code conservatively. State assumptions before editing."
      },
      {
        "role": "user",
        "content": "Find the race condition in this queue worker and propose a minimal patch."
      }
    ],
    "temperature": 1,
    "top_p": 0.95,
    "max_tokens": 8192
  }'

Usa el ID exacto devuelto por el descubrimiento de modelos al integrar con una clave de producción. La página de modelo de MiniMax M3 y la documentación de API muestran la superficie actual de reAPI.

El punto de entrada directo de MiniMax usa MiniMax-M3 en lugar del ID con espacio de nombres de reAPI. No copies la cadena de modelo de un proveedor a la solicitud de otro proveedor y asumas que el gateway lo normalizará.

Modos de pensamiento y comportamiento de agentes

La tarjeta de modelo abierto documenta tres modos de razonamiento:

  • enabled: siempre usa razonamiento explícito.
  • adaptive: deja que M3 decida cuándo el razonamiento adicional es útil.
  • disabled: minimiza latencia y maximiza rendimiento.

Para revisión de código, depuración, planificación de múltiples pasos y agentes con muchas herramientas, comienza con razonamiento adaptativo o habilitado. Para autocompletado, clasificación y transformaciones cortas, el razonamiento deshabilitado puede reducir la demora. MiniMax dice que el pensamiento encendido y apagado comparten las mismas tarifas de tokens de API directa; la diferencia de costo proviene de cuántos tokens consume finalmente la solicitud, no de un cargo de razonamiento separado.[2]

Los controles de razonamiento pueden diferir entre rutas hospedadas. Si una aplicación depende de un campo de thinking particular, prueba el esquema de solicitud aceptado antes de enviar en lugar de asumir que todos los puntos de entrada compatibles con OpenAI lo reenvíen.

Dónde la ventana de un millón de tokens ayuda

Una ventana de contexto largo es más útil cuando el modelo necesita varios artefactos relacionados a la vez:

  • un repositorio más historial de problemas y registros de compilación;
  • un conjunto de contratos largo con referencias entre documentos;
  • una transcripción de vídeo emparejada con fotogramas seleccionados;
  • rastros de agentes de múltiples pasos que deben permanecer disponibles para decisiones posteriores.

Es menos útil cuando el prompt es un volcado sin filtrar. Las entradas grandes aumentan la latencia y pueden enterrar la evidencia relevante. Un agente de producción aún debe deduplicar archivos, recuperar secciones probables primero, resumir rastros de herramientas completadas y preservar ubicaciones de fuente exactas para verificación.

Si la decisión se trata principalmente de pesos abiertos y confiabilidad gestionada, compara Kimi K3 con Claude Opus 5. Para otro modelo de codificación de contexto de un millón de tokens de menor costo, consulta la guía de API de GLM-5.2.

Limitaciones de MiniMax M3

La restricción principal es la escala operativa. Publicar los pesos da a los equipos control de despliegue, pero no hace que un modelo multimodal de 427 mil millones de parámetros sea fácil de servir. La cuantización reduce la memoria, mientras que los contextos largos agregan presión de caché KV y rendimiento de nuevo al sistema.

Las afirmaciones de referencia también necesitan contexto. MiniMax informa 59,0% en SWE-Bench Pro y 66,0% en Terminal-Bench 2.1, pero las notas de lanzamiento explican que diferentes modelos a veces usaban andamios diferentes y que varios resultados provinieron de la infraestructura interna.[2] Trata esas puntuaciones como evidencia de capacidad prevista, no como un pronóstico de éxito en tu propio agente.

Finalmente, la disponibilidad de un millón de tokens puede depender de la capacidad del servicio. MiniMax describe 512K como garantizado y la banda superior como hasta 1M. Prueba la región exacta, cuenta, concurrencia y tamaño de solicitud que planees usar.

Preguntas frecuentes

¿Es MiniMax M3 de pesos abiertos?

Sí. MiniMax publica pesos de M3 en Hugging Face y código en GitHub bajo la Licencia Comunitaria de MiniMax. Revisa esa licencia antes del despliegue comercial.

¿Cuál es la ventana de contexto de la API de MiniMax M3?

La API hospedada admite hasta un millón de tokens, con MiniMax describiendo 512K como el mínimo garantizado. Las llamadas por encima de 512K usan una banda de precios directa más alta.

¿Admite MiniMax M3 imágenes y vídeos?

Sí. MiniMax describe M3 como multimodal nativo con entrada de texto, imagen y vídeo. Su salida es texto en lugar de imágenes o vídeos generados.

¿Qué ID de modelo usa reAPI?

Usa minimax/minimax-m3 con https://api.reapi.ai/v1/chat/completions.

¿Es MiniMax M3 más barato que GPT o Claude?

Sus tarifas de tokens son inferiores a muchos modelos gestionados de frontera, pero el costo por token no es costo por tarea completada. Compara confiabilidad de herramientas, reintentos, longitud de salida, latencia y esfuerzo de revisión en tu propia carga de trabajo.

Conclusión

La API de MiniMax M3 es una excelente opción para equipos que necesitan contexto largo, agentes de codificación, entrada multimodal y la opción de auto-hospedar más adelante. Usa la ruta hospedada primero cuando quieras operaciones predecibles; evalúa los pesos abiertos cuando el control de datos o la personalización justifique la infraestructura. Lo más importante es presupuestar la banda de contexto correcta y probar el arnés de agente, no solo el nombre del modelo.

Referencias

  1. MiniMax AI. Repositorio de modelo oficial de MiniMax M3 y orientación para despliegue local. huggingface.co/MiniMaxAI/MiniMax-M3
  2. MiniMax. MiniMax M3: Codificación de frontera, contexto de un millón, multimodalidad nativa. minimax.io/blog/minimax-m3
  3. MiniMax API Platform. Precios de pago por uso de MiniMax M3. platform.minimax.io
  4. MiniMax API Docs. Almacenamiento automático en caché de prompts. platform.minimax.io/docs/api-reference/text-prompt-caching