Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Hailuo H3: especificaciones MiniMax H3, precios y API (2026)
2026/08/01

Hailuo H3: especificaciones MiniMax H3, precios y API (2026)

Conoce cómo se relacionan Hailuo H3, MiniMax H3 y Hailuo 03, con especificaciones 2K verificadas, audio nativo, precios, límites API y código de integración.

Hailuo H3 es el nombre de búsqueda que la gente usa para MiniMax H3, el modelo de vídeo que MiniMax lanzó el 31 de julio de 2026. Su documentación de API también llama a este lanzamiento Hailuo 03. Esos nombres se refieren al mismo modelo: un sistema multimodal que acepta texto, imágenes, vídeo y audio, y luego genera un vídeo de 4 a 15 segundos con sonido estéreo nativo a hasta 2K.[1][2]

La nomenclatura es la parte fácil. La distinción útil está entre los tres flujos de trabajo del modelo: generación de texto a vídeo solo con texto, animación de imagen inicial/final, y vídeo con referencias que mezcla entradas de imagen, vídeo y audio. Esta guía mapea esos modos a las reglas exactas de la API, separa el precio directo de MiniMax del precio de reAPI, y muestra la forma de solicitud que funciona en reAPI hoy.

Especificaciones de Hailuo H3 de un vistazo

ElementoMiniMax H3 / Hailuo 03
Fecha de lanzamiento31 de julio de 2026
EntradaTexto, imágenes, vídeo y audio
SalidaVídeo MP4 con audio estéreo nativo
ResoluciónHasta 2K
Duración4 a 15 segundos, en incrementos de segundo completo
Modos de generaciónTexto a vídeo, imagen a vídeo, referencia a vídeo
Capacidad de referenciaHasta 9 imágenes, 3 vídeos y 3 clips de audio
Relaciones de aspecto21:9, 16:9, 4:3, 1:1, 3:4 y 9:16
Precio directo de MiniMax$0,13/s a 2K; $0,09/s a 768p
ID del modelo reAPIminimax-h3

MiniMax describe H3 como un modelo general de generación omnimodal en lugar de solo un procesador de vídeo. El comunicado de lanzamiento dice que puede entender el contexto en los cuatro modos de entrada y generar vídeo, audio, imágenes y texto, aunque la API de vídeo pública es la superficie del producto documentada en detalle en el lanzamiento.[1]

MiniMax también llama a H3 un modelo abierto. Su artículo de lanzamiento dice que los pesos del modelo se lanzarán «en los próximos días», sujeto a las leyes y regulaciones aplicables. Hasta que los pesos y la licencia se publiquen realmente, trata el auto-alojamiento como un siguiente paso anunciado en lugar de una ruta de implementación disponible.

Por qué Hailuo H3 y Hailuo 03 son el mismo modelo

El lanzamiento oficial usa dos capas de nomenclatura. MiniMax H3 es el nombre del modelo en el artículo de lanzamiento de MiniMax y el valor de model en su API de generación V2. Hailuo 03 aparece en las descripciones de producto y API del mismo lanzamiento. «Hailuo H3» combina el nombre de la familia de productos con la versión del modelo, por lo que se ha convertido en un término de búsqueda natural aunque no sea el identificador exacto de la API.

Usa el nombre que coincida con el contexto:

  • La copia de búsqueda y editorial puede mencionar juntos Hailuo H3, MiniMax H3 y Hailuo 03 una vez, luego establecerse en MiniMax H3.
  • El punto de conexión V2 directo de MiniMax espera MiniMax-H3.
  • reAPI espera el ID de modelo en minúsculas minimax-h3.

Esa última diferencia a nivel de carácter importa. Los IDs de modelo son valores de contrato, no marca, así que copiar el nombre de visualización en el código producirá una solicitud no válida.

Un modelo encamina tres flujos de trabajo de vídeo diferentes

Hailuo H3 texto a vídeo, imagen a vídeo, y rutas de entrada referencia a vídeo de MiniMax H3

MiniMax H3 selecciona su modo de generación de los medios adjuntos a la solicitud. Los tres encaminamientos comparten el mismo modelo subyacente, pero sus reglas de validación no son intercambiables.[3]

Texto a vídeo: indicación más una relación de aspecto explícita

Texto a vídeo es la ruta más simple. Envía una indicación sin referencias de medios y elige una de seis relaciones de aspecto. La indicación puede describir los elementos visuales, el movimiento de cámara, el diálogo, la música, la ambientación y efectos de sonido en el mismo breve.

En reAPI, aspect_ratio es requerido para texto a vídeo y no puede ser adaptive. Usa 16:9 para apaisado, 9:16 para vídeo social vertical, u uno de los cuatro formatos intermedios cuando la superficie de entrega lo necesita.

Imagen a vídeo: primer fotograma, último fotograma, o ambos

Imagen a vídeo acepta un fotograma inicial, un fotograma final, o ambos. Suministrar dos fotogramas da al modelo un inicio visual y un destino, lo que hace que sea útil para una transición planificada, una revelación de producto, o una toma que debe aterrizarse en una composición específica.

El control de imagen controla la orientación de salida, así que reAPI rechaza aspect_ratio en este modo. Recorta los fotogramas de origen al formato de entrega previsto antes de enviarlos. Las entradas de fotograma inicial/final tampoco pueden mezclarse con los arreglos de referencia separados en una solicitud.

Referencia a vídeo: asigna identidad, movimiento y sonido por separado

Referencia a vídeo es la ruta más flexible. Una solicitud puede llevar hasta nueve imágenes, tres clips de vídeo y tres clips de audio. Esto hace que sea posible usar una imagen para la identidad de un personaje o producto, un vídeo para el movimiento y el lenguaje de cámara, y audio para la voz o dirección de sonido.

Hay límites duros detrás de esos números generales:

  • cada vídeo de referencia debe tener 2 a 15 segundos, con todas las referencias de vídeo sumando no más de 15 segundos;
  • cada archivo de audio de referencia debe tener 2 a 15 segundos, con todas las referencias de audio sumando no más de 15 segundos;
  • el audio no puede ser la única referencia; debe acompañar al menos a una imagen o vídeo;
  • el modo referencia puede usar una relación de aspecto explícita o por defecto a adaptive.

No envíes referencias como una pila indiferenciada. Indica el trabajo de cada activo en la indicación: identidad del retrato, movimiento del clip, voz del audio, e iluminación del fotograma de producto. La API acepta muchas entradas, pero una clara división de responsabilidad da al modelo menos señales conflictivas.

El audio estéreo nativo cambia cómo se escribe la indicación

MiniMax H3 genera audio estéreo con el vídeo en lugar de añadir una pista de audio separada después del paso visual.[1] Por lo tanto, la indicación necesita dirigir el sonido tan deliberadamente como la cámara.

Una indicación H3 útil tiene cuatro capas:

  1. Tema y acción: qué es visible y qué cambia durante la toma.
  2. Cámara y tiempo: encuadre, movimiento, enfoque, cortes y ritmo.
  3. Contenido hablado: diálogo exacto e intérprete previsto.
  4. Cama de sonido: música, ambientación, Foley, relaciones de volumen y silencio.

Por ejemplo:

Un primer plano de 6 segundos de una máquina de espresso de metal cepillado al amanecer. Dolly lento de izquierda a derecha, reflejos de ventanas cálidas, profundidad de campo superficial. Un suave clic de interruptor, vapor ascendente, ambientación tranquila de café, y un acorde de piano contenido. Sin diálogo.

El audio nativo elimina un paso de sincronización inicial; no garantiza una mezcla final. La claridad del diálogo, la sincronización de labios, la continuidad de la música y los efectos no deseados aún necesitan revisión en cada clip aceptado. Para presupuestar la producción, la métrica relevante es el costo por resultado utilizable, no el costo por segundo generado.

Precios de MiniMax H3: API directo versus reAPI

La tabla de pago según se use de MiniMax enumera salida 2K a $0,13 por segundo y 768p a $0,09 por segundo.[4] Una salida 2K de 10 segundos comienza, por lo tanto, a $1,30 antes de medios de entrada facturables.

La facturación directa de MiniMax añade tres reglas:

  • la entrada de audio es gratis;
  • los primeros cinco fotogramas de entrada son gratuitos, luego cada fotograma adicional es $0,04;
  • el vídeo de entrada se factura por duración a la tarifa de resolución de salida elegida.

reAPI tiene su propio contrato de producto. La página del modelo MiniMax H3 enumera $0.183 por segundo para salida 2K y $0.113 por segundo a 768p. Los segundos de referencia a vídeo se añaden a los segundos de vídeo generado, los primeros cinco fotogramas de referencia son gratis, y los fotogramas seis al nueve cuestan $0.055 cada uno.[5][6]

La fórmula de reAPI es:

costo = tarifa-por-segundo × (segundos-de-salida + segundos-de-vídeo-referencia)
       + tarifa-de-imagen-extra × máx(0, imágenes-de-referencia - 5)

Las cantidades facturables importan más que la aritmética: una salida de 10 segundos usando una referencia de movimiento de 6 segundos factura 16 segundos, no 10. Siete fotogramas de referencia añaden dos cargos de imagen extra en la parte superior, porque cinco son gratis. Las referencias de audio no añaden cargo.

Estas son dos hojas de precios diferentes para dos integraciones diferentes. No presentes la tarifa directa de MiniMax de $0,13 como la tarifa de reAPI, o la tarifa de reAPI como el precio de lista oficial de MiniMax. Ambos pueden cambiar después del lanzamiento, así que el código de producción debe leer la página del modelo actual en lugar de codificar un número del artículo en la interfaz de usuario.

Cómo llamar a la API de MiniMax H3 en reAPI

reAPI expone los tres modos H3 a través de su punto de conexión de vídeo asincrónico estándar. Una solicitud mínima de texto a vídeo es:

curl https://reapi.ai/api/v1/videos/generations \
  -H "Authorization: Bearer $REAPI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "minimax-h3",
    "prompt": "Un mercado nocturno mojado de lluvia, impulso de mano lenta hacia adelante, vendedores llamando suavemente, trueno distante y ambiente natural de la calle",
    "aspect_ratio": "16:9",
    "duration": 6
  }'

La presentación devuelve un ID de tarea. Sondea el punto de conexión de tarea compartido hasta que el resultado esté completo:

curl https://reapi.ai/api/v1/tasks/TASK_ID \
  -H "Authorization: Bearer $REAPI_API_KEY"

La respuesta completada contiene output.video_urls. El sondeo no consume créditos, y las generaciones fallidas se reembolsan automáticamente.[5]

Cambia la forma de la solicitud para seleccionar otro modo:

{
  "model": "minimax-h3",
  "prompt": "El personaje se gira naturalmente y sonríe mientras la cámara se acerca",
  "first_frame_url": "https://example.com/first-frame.jpg",
  "last_frame_url": "https://example.com/last-frame.jpg",
  "duration": 6
}

Para referencia a vídeo, reemplaza los campos de fotograma con reference_image_urls, reference_video_urls y reference_audio_urls. Todas las entradas de medios deben ser URLs HTTP(S) públicas; los URLs de base64 y data: se rechazan.

La referencia de la API de MiniMax H3 completa documenta los formatos de medios, límites de tamaño de archivo, respuesta de tarea, errores y comportamiento de facturación.

Dónde encaja Hailuo H3 y qué todavía necesita pruebas

H3 es mejor evaluado como un generador de tomas, no como un estudio de vídeo de forma larga de un clic. Quince segundos pueden cubrir un golpe de producto, un intercambio de diálogo, un clip social, o una sección de un comercial. Una pieza de 60 segundos todavía necesita múltiples generaciones, planificación de continuidad, edición y un pase de sonido final.

La ruta de referencia mixta es la razón por la que los equipos de marca, personaje y previsualización deben probarla. La ruta de fotograma inicial/final es la razón por la que los diseñadores de movimiento deben preocuparse. El audio estéreo nativo es la razón por la que los equipos de formato corto pueden eliminar un paso de corte aproximado. Ninguna de esas capacidades prueba que H3 mantendrá una cara, logo, etiqueta, o voz en cada breve.

MiniMax llama al modelo listo para producción y publica ejemplos pulidos para películas de marca, contenido narrativo, vídeo social, publicidad, UI/UX y juegos. Esas son demostraciones de proveedores, no puntos de referencia independientes. Una evaluación seria debe incluir manos tocando productos, texto pequeño impreso, dos oradores en un fotograma, movimiento rápido, diálogo largo, y consistencia entre tomas generadas por separado.

El modelo se lanzó un día antes de este artículo, así que aún no hay suficientes pruebas públicas creíbles para una clasificación de calidad. Esa limitación es más útil que un veredicto inventado: ejecuta un conjunto de indicación fija, registra las salidas aceptadas por diez intentos, y compara el costo total de las tomas aprobadas contra el modelo que ya está en tu flujo de trabajo.

Preguntas frecuentes

¿Son Hailuo H3, MiniMax H3 y Hailuo 03 el mismo modelo?

Sí. MiniMax H3 es el lanzamiento oficial y el nombre del modelo de API; Hailuo 03 es la descripción de producto/API para el mismo lanzamiento. Hailuo H3 es el término de búsqueda híbrido común. En reAPI, usa el ID del modelo minimax-h3.

¿Cuánto tiempo puede tener un vídeo de MiniMax H3?

Cada generación puede tener 4 a 15 segundos en incrementos de segundo completo. Los vídeos más largos deben dividirse en tomas y ensamblarse en un editor.

¿Genera Hailuo H3 audio?

Sí. Genera audio estéreo nativo con la imagen y puede dirigir diálogo, música, ambientación y efectos en la misma indicación.

¿Puede MiniMax H3 usar una referencia de audio por sí sola?

No. El audio de referencia debe estar emparejado con al menos una imagen o vídeo de referencia. El total de referencia de audio no puede exceder 15 segundos.

¿Cuánto cuesta MiniMax H3?

La API directa de MiniMax enumera $0,13/s a 2K y $0,09/s a 768p. reAPI enumera $0.183/s a 2K y $0.113/s a 768p, con segundos de vídeo de entrada facturados a la misma tarifa y cargos de imagen adicional después de los primeros cinco.

¿Es MiniMax H3 de código abierto?

MiniMax anunció H3 como un modelo abierto, pero el comunicado de lanzamiento del 31 de julio dijo que los pesos se lanzarían en los próximos días. Verifica los pesos actuales y la licencia antes de planificar una implementación auto-alojada.

La lectura práctica de MiniMax H3

Hailuo H3 es un problema de nomenclatura envuelto alrededor de un diseño de modelo útil: un punto de conexión MiniMax H3 cubre generación solo de indicación, animación de fotograma inicial/final, y vídeo de referencia mixta con sonido estéreo nativo. Su techo de 15 segundos lo mantiene en el nivel de toma, mientras que los límites de referencia hacen que esas tomas sean más dirigibles que un flujo de trabajo solo de indicación.

Comienza con el defecto de seis segundos, asigna a cada referencia un rol claro, y juzga H3 por clips aceptados en lugar de demostraciones de lanzamiento. Los desarrolladores pueden probar las mismas formas de solicitud en el reproductor de MiniMax H3 o pasar directamente a la documentación de la API.

Divulgación: reAPI publica este artículo y opera el punto de conexión MiniMax H3 encaminado descrito anteriormente. Las especificaciones de MiniMax y los precios directos provienen de los materiales y documentación de lanzamiento públicos de MiniMax; los detalles del contrato de reAPI provienen de nuestra página de modelo publicada y referencia de API.

Referencias

  1. MiniMax. MiniMax H3: An Open Model Breaking the Boundaries Between Tasks and Modalities. Published July 31, 2026. minimax.io/blog/minimax-h3
  2. MiniMax API. Video Generation Guide — MiniMax H3 capabilities, duration, resolution, and media inputs. Retrieved August 1, 2026. platform.minimax.io/docs/guides/video-generation
  3. MiniMax API. Create a Video Generation Task V2 — request modes and validation rules. Retrieved August 1, 2026. platform.minimax.io/docs/api-reference/video-generation-v2-create
  4. MiniMax API. Pay as You Go Pricing — MiniMax H3 output and input-media rates. Retrieved August 1, 2026. platform.minimax.io/docs/guides/pricing-paygo
  5. reAPI. MiniMax H3 API reference — modes, parameters, billing, output, and errors. Retrieved August 1, 2026. reapi.ai/docs/minimax-h3
  6. reAPI. MiniMax H3 model page and live pricing. Retrieved August 1, 2026. reapi.ai/models/minimax-h3

Lectura adicional