
Guía de prompts MiniMax H3: movimiento, cámara y sonido
Escribe mejores prompts MiniMax H3 para video generativo, animación de fotogramas, referencias mezcladas, audio nativo, dirección de cámara y flujos API.
Un buen prompt de MiniMax H3 no describe un póster. Dirige una toma. Nombra el sujeto, el cambio visible, la cámara, el tiempo y el sonido. Si adjuntas referencias, asigna a cada una un único trabajo. H3 genera imagen y audio estéreo nativo juntos, así que el silencio, la ambientación, el diálogo, la música y los efectos pertenecen al mismo brief que el movimiento.[1]
El modelo acepta prompts de hasta 7.000 caracteres, pero la longitud no es el objetivo. Seis líneas precisas suelen superar una página de adjetivos. Esta guía de prompts de MiniMax H3 muestra cómo escribir esas líneas para video generativo, animación de fotogramas iniciales y finales, y video con referencias mezcladas en reAPI.
TL;DR
- Escribe el cambio en el tiempo, no un inventario estático del fotograma.
- Separa la acción del sujeto, la acción de cámara y el sonido para que no compitan en una oración.
- Para video de fotograma inicial y final, describe la transición; las imágenes ya describen los puntos finales.
- Para video de referencia, etiqueta el rol de cada entrada de imagen, video y audio.
- Comienza con seis segundos. Añade duración solo cuando la acción lo requiere.
- Los bloques de tiempo como
[0–2 segundos]son una técnica de escritura, no una garantía de parseo. Úsalos para aclarar la progresión prevista.
La estructura del prompt de MiniMax H3
H3 soporta tres formas de solicitud: video generativo solo con prompt, imagen a video con fotograma inicial o final, y video de referencia con imágenes, videos y audio. La API selecciona el modo según el contenido adjunto; el prompt debe cambiar con él. La referencia de API de MiniMax H3 documenta las reglas de validación exactas.[2]
Para una toma solo con prompt, usa este orden:
SUJETO — quién o qué sigue la toma
ACCIÓN — una progresión visible, con un final claro
ESCENARIO — solo detalles que afecten la toma
CÁMARA — encuadre, movimiento, enfoque y ritmo
LUZ — dirección, hora del día y respuesta del material
SONIDO — diálogo, ambientación, Foley, música o silencio deliberadoEsto no es sintaxis mágica. Es una forma de separar tres acciones diferentes y cuatro movimientos de cámara diferentes de un párrafo decorativo.

Comienza con un cambio, no con un mood board
"Café cinematográfico, luz hermosa, premium, sombrío" nombra una estética pero no le da al video hacia dónde ir. Añade un evento físico y un punto final:
Plano de seis segundos de una máquina de espresso de acero cepillado al amanecer. Un barista asegura el portafiltro, presiona el interruptor y el primer flujo oscuro de café alcanza la taza en el último segundo. Dolly lento de izquierda a derecha, enfoque superficial, reflejos cálidos de la ventana. Un clic de interruptor, vapor que sube, tono ambiental silencioso. Sin diálogo ni música.
Ahora la toma tiene un comienzo, un medio y un final revisable. La cámara tiene un movimiento. El bed de sonido es lo suficientemente pequeño para mezclar. "Premium" se fue porque los materiales, la luz, el ritmo y la contención ya hacen ese trabajo.
Mantén una acción dominante
Los clips cortos castigan la coreografía sobrecargada. Si un prompt de seis segundos le pide a una persona entrar, sentarse, abrir un paquete, hablar, beber, mirar por la ventana e irse, el modelo debe comprimir u omitir algo. Elige la acción de la que se trata el clip. Mueve el resto a otra toma.
Dale a la cámara un verbo
Pan, tilt, dolly, crane, orbit, handheld track y rack focus no son sinónimos. Elige un movimiento de cámara principal. Una segunda instrucción puede describir enfoque o un pequeño remate, pero una toma de "dolly dentro mientras orbita, grúa arriba y panorámica rápida" suele ser una solicitud de conflicto.
Describe la respuesta del material en lugar de la calidad
Palabras como "impresionante", "épico" y "alta calidad" no le dan nada que verificar a un revisor. Describe qué hace la luz: un reflejo estrecho deslizándose sobre metal cepillado, luz de ventana suave envolviendo una cara, o lluvia rompiendo un reflejo de neón en asfalto mojado.
Una plantilla de prompt de MiniMax H3 text-to-video
El video generativo no tiene fotograma de origen, así que el prompt debe establecer tanto la imagen como el movimiento. La solicitud también necesita una relación de aspecto explícita en reAPI.
[Duración y encuadre]
Un [tamaño de plano] de [sujeto] en [escenario].
[Acción]
El sujeto [acción única], terminando con [golpe final visible].
[Cámara y luz]
[Un movimiento de cámara], [comportamiento de enfoque]. [Luz específica y respuesta del material].
[Audio]
[Diálogo si hay]. [Ambientación]. [Foley]. [Música o sin música].
[Guardrails]
Una toma continua. Sin cortes. Sin texto añadido ni logos.Ejemplo rellenado:
Plano medio-ancho de ocho segundos de un ciclista esperando bajo un paso elevado bajo lluvia ligera. Ella aprieta un guante, mira hacia la carretera, luego se impulsa y sale del fotograma por la derecha. Track handheld lento hacia adelante; el enfoque permanece en su cara hasta que la bicicleta se mueve. Luz diurna fría, hormigón mojado, pequeños reflejos ámbar de autos que pasan. Lluvia en hormigón, un clic de rueda libre, un autobús distante, sin música, sin diálogo. Una toma continua, sin cortes, sin texto en pantalla.
La solicitud correspondiente es pequeña:
curl https://reapi.ai/api/v1/videos/generations \
-H "Authorization: Bearer $REAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "minimax-h3",
"prompt": "Plano medio-ancho de ocho segundos de un ciclista esperando bajo un paso elevado bajo lluvia ligera. Ella aprieta un guante, mira hacia la carretera, luego se impulsa y sale del fotograma por la derecha. Track handheld lento hacia adelante; el enfoque permanece en su cara hasta que la bicicleta se mueve. Luz diurna fría, hormigón mojado, pequeños reflejos ámbar de autos que pasan. Lluvia en hormigón, un clic de rueda libre, un autobús distante, sin música, sin diálogo. Una toma continua, sin cortes, sin texto en pantalla.",
"aspect_ratio": "16:9",
"duration": 8
}'El envío devuelve un ID de tarea. Consulta el endpoint de tarea compartida hasta que el resultado esté completo. El MP4 terminado incluye la pista de audio generada.
Escribe prompts de fotograma inicial/final como transiciones
En modo imagen a video, un fotograma inicial, final o ambos ya establecen apariencia y orientación. Repetir cada detalle visual desperdicia espacio de prompt y puede alejar la generación de las imágenes suministradas.
Dile a H3 qué debe suceder entre ellos:
Muévete continuamente desde el fotograma inicial al fotograma final.
El paquete de papel se desplega a lo largo de sus pliegues existentes; no aparecen nuevos paneles.
La cámara permanece bloqueada. El producto no rota.
Suave susurro de papel, un pequeño golpe de mesa, tono ambiental silencioso de estudio, sin música.
Termina en la composición exacta del fotograma final.En reAPI, la imagen a video deriva la orientación del fotograma. No envíes un campo aspect_ratio
en este modo. Recorta las imágenes de origen a la relación de entrega prevista antes del envío.[2]
Si los fotogramas de inicio y fin no están de acuerdo en la escala del sujeto, altura de cámara o iluminación, el prompt no puede reparar completamente la contradicción. Arregla los puntos finales primero. El modelo debe gastar su esfuerzo en movimiento, no en conciliar dos tomas diferentes.
Asigna a cada referencia un único trabajo
Video de referencia es el flujo de trabajo más distintivo de H3. Una solicitud puede incluir hasta nueve imágenes, tres videos y tres clips de audio. Más entradas no crean automáticamente mejor continuidad. Una pila de referencias sin etiquetar le pide al modelo que adivine qué copiar de cada archivo.
Usa un mapa de referencia explícito:
Imagen de referencia 1: preserva el rostro, cabello, abrigo y proporciones de esta persona.
Imagen de referencia 2: usa solo el interior del vagón de tren y los materiales de los asientos.
Video de referencia 1: usa su ritmo de caminata y movimiento de hombros, no su cámara.
Audio de referencia 1: usa esta identidad de voz y cadencia para la línea citada.
Crea una toma de siete segundos. El personaje camina por el pasillo hacia la cámara, toca la
parte superior de un asiento y dice: "Casi llegamos." Dolly estabilizado lento hacia atrás a
nivel de los ojos. La luz de la tarde se mueve a través de las ventanas. Mantén la voz clara
sobre bajo ruido de rieles; sin música ni altavoces adicionales.Esto separa identidad, entorno, movimiento y voz. También le dice a un revisor humano dónde buscar cuando falla un resultado.
Los videos de referencia no son contexto gratuito. En la ruta de reAPI, su duración se añade a la duración generada facturable. Las primeras cinco imágenes de referencia se incluyen, mientras que las imágenes seis a nueve añaden un cargo por imagen. Usa la página del modelo MiniMax H3 para tarifas actuales en lugar de rellenar una solicitud con referencias sin usar.[3]
Dirige el sonido como parte de la toma
MiniMax H3 genera audio estéreo nativo con la imagen. Un brief de sonido útil responde cinco preguntas:
| Pregunta | Ejemplo de respuesta |
|---|---|
| ¿Quién habla? | La mujer en el abrigo azul, y nadie más |
| ¿Qué es exacto? | "Casi llegamos." |
| ¿Qué establece el lugar? | Bajo ruido de rieles y dos suaves traqueteos de vagón |
| ¿Qué debe estar en primer plano? | Voz clara y centrada sobre la ambientación |
| ¿Qué debe estar ausente? | Sin música, charla de multitud, anuncio o subtítulos |
"Audio cinematográfico" no responde ninguno de ellos.
Cuando hay diálogo, mantén la línea lo suficientemente corta para el clip. Léela en voz alta al ritmo previsto. Una línea de doce palabras que toma cinco segundos deja poco espacio para la acción, reacción y silencio natural alrededor.
El silencio debe ser declarado. Sin "sin música" o "sin diálogo", el modelo puede llenar un bed de sonido vacío porque el prompt lo dejó abierto. Lo mismo se aplica a subtítulos y texto en pantalla.
Los bloques de tiempo ayudan cuando el orden importa
Para una toma con varios golpes, el tiempo aproximado puede aclarar la secuencia:
[0–2 segundos] Plano cerrado bloqueado. El fósforo toca la mecha; solo tono ambiental.
[2–5 segundos] La llama se enciende y crece. Dolly muy lento hacia adentro; ignición suave.
[5–7 segundos] Una mano protege la llama, luego sale del fotograma. Una respiración tranquila.
Sin corte, sin diálogo, sin música.Trata esos corchetes como un esquema editorial. MiniMax no promete obediencia exacta en fotogramas a los tiempos en prosa, y el video generado no debe usarse para trabajo que requiera temporización de fotogramas determinística. Los bloques aún reducen la ambigüedad sobre orden y énfasis.
Cinco fallos de prompt y sus arreglos más pequeños
| Fallo | Por qué sucede | Arreglo más pequeño |
|---|---|---|
| La toma se siente estática | El prompt describe apariencia, no cambio | Añade una acción física y un golpe final |
| La cámara se sacude | Varios movimientos de cámara compiten | Mantén un movimiento; haz el resto restricciones de encuadre |
| La identidad se desplaza | Las referencias no tienen roles asignados | Nombra una fuente de identidad y protege sus invariantes |
| El audio está desordenado | "Sonido cinematográfico" deja todo abierto | Lista sonido en primer plano, ambientación y ausencias explícitas |
| El fotograma final se pierde | Los puntos finales contradicen o la acción se sobrecarga | Alinea los fotogramas de origen y simplifica la transición |
Las instrucciones negativas funcionan mejor cuando protegen un requisito. "Sin cortes" es útil para una revelación de producto continua. Veinte prohibiciones genéricas usualmente ocultan la única restricción que importaba.
Una revisión de prompt compacta antes de gastar una generación
Lee el prompt una vez y subraya las respuestas:
- ¿Qué cambia durante el clip?
- ¿Qué debe ser verdad en el último segundo?
- ¿Qué está haciendo la cámara?
- ¿Qué detalles visuales están protegidos?
- ¿Quién habla y qué palabras exactas dice?
- ¿Qué ambientación y efectos deben escucharse?
- ¿Qué sonidos, cortes, texto o logos no deben aparecer?
- Si hay referencias adjuntas, ¿qué rol único sirve cada una?
Si dos respuestas se contradicen, arregla el brief antes de aumentar la duración o añadir otra referencia.
FAQ
¿Cuán largo debe ser un prompt de MiniMax H3?
El campo de reAPI acepta 1–7.000 caracteres, pero la mayoría de tomas individuales no necesitan el techo. Usa suficiente detalle para especificar acción, cámara, luz, sonido y restricciones protegidas. Elimina adjetivos que no cambien una decisión de revisión.
¿Puede MiniMax H3 generar diálogo y efectos de sonido?
Sí. H3 genera audio estéreo nativo y acepta diálogo, música, ambientación y efectos en el mismo prompt que la dirección visual.
¿Entiende MiniMax H3 comandos de cámara?
La documentación de video de MiniMax da directivas de movimiento de cámara para sus modelos de video, y los prompts de H3 pueden describir encuadre, movimiento y enfoque. Trátalos como dirección en lugar de datos de control de movimiento determinístico.[1]
¿Debo usar fotogramas iniciales/finales o imágenes de referencia?
Usa fotogramas iniciales/finales cuando la toma debe comenzar o terminar en una composición específica. Usa modo de referencia cuando activos separados definen identidad, entorno, movimiento o voz. Las dos familias de entrada no pueden mezclarse en una solicitud de reAPI.
¿Cuántas referencias puede usar MiniMax H3?
La ruta de reAPI actual acepta hasta nueve imágenes, tres clips de video y tres clips de audio. El audio no puede ser la única referencia. También se aplican límites de duración de video de referencia y audio de referencia.
¿Son los corchetes de tiempo sintaxis oficial de MiniMax?
No. Son una forma legible de comunicar orden y énfasis aproximado. No los presentes como controles precisos en fotogramas o comandos de parseo garantizados.
El prompt es una nota de producción
El mejor prompt de MiniMax H3 se parece a una nota corta de un director a un pequeño equipo. Dice qué sucede, hacia dónde va la cámara, qué escucha el micrófono y qué detalles no pueden desviarse. No le pide al modelo que descubra la toma dentro de una nube de palabras de estilo.
Comienza con una acción y seis segundos. Revisa el movimiento y sonido por separado. Solo entonces añade referencias, bloques de tiempo o una duración más larga. El playground de MiniMax H3 y la guía de API usan los mismos modos de solicitud, así que un prompt puede pasar de una prueba manual a código sin cambiar su función.
Divulgación: reAPI publica esta guía y opera el endpoint de MiniMax H3 enrutado descrito aquí. Los límites de API y el comportamiento de facturación se refieren al contrato actual de reAPI; las descripciones de capacidad de MiniMax provienen de la documentación oficial de MiniMax. Los prompts de muestra son patrones de escritura, no resultados de benchmark.
References
- MiniMax API. Video Generation Guide — MiniMax H3 inputs, output, audio, and camera direction. Retrieved August 13, 2026. platform.minimax.io/docs/guides/video-generation
- reAPI. MiniMax H3 API reference — request modes, limits, and billing. Retrieved August 13, 2026. reapi.ai/docs/minimax-h3
- reAPI. MiniMax H3 model page and live pricing. Retrieved August 13, 2026. reapi.ai/models/minimax-h3
Further reading
Autor

Categorías
Más publicaciones

Agente de vídeo de IA: bucle crítico para control de calidad
Construye un bucle crítico para agentes de vídeo con reglas de aceptación, alcances de reparación, límites de reintentos y revisión humana antes de finalizar.


Alternativas a Venice AI para Seedance 2.0 flexible
Compara siete plataformas que ofrecen Seedance 2.0, referencias multimodales, entrada de personas reales y moderación flexible para flujos de imagen y vídeo.


Precio Seedream 5.0 Pro: la línea de píxeles que lo decide
Seedream 5.0 Pro divide precios en 2,36 millones de píxeles, no por etiqueta. Cómo dimensionar 16:9 para mantenerse en la tarifa más barata.
