
Rédiger des prompts MiniMax H3 pour vidéo et son
Meilleurs prompts MiniMax H3 pour texte-vidéo, première/dernière image, références mixtes, audio natif, direction de caméra, et intégration API reAPI.
Un bon prompt MiniMax H3 ne décrit pas une affiche. Il dirige un plan. Nommez le sujet, le changement visible, la caméra, le timing et le son. Si vous joignez des références, attribuez à chacune un rôle unique. H3 génère l'image et l'audio stéréo natif ensemble, donc le silence, l'ambiance, le dialogue, la musique et les effets appartiennent au même descriptif que le mouvement.[1]
Le modèle accepte des prompts jusqu'à 7 000 caractères, mais la longueur n'est pas l'objectif. Six lignes précises dépassent généralement une page d'adjectifs. Ce guide du prompt MiniMax H3 montre comment écrire ces lignes pour la vidéo texte-vidéo, l'animation première/dernière image et la vidéo à références mixtes sur reAPI.
TL;DR
- Écrivez le changement au fil du temps, non un inventaire statique du plan.
- Séparez l'action du sujet, l'action de la caméra et le son pour qu'ils ne se concurrencent pas dans une phrase.
- Pour la vidéo première/dernière image, décrivez la transition ; les images décrivent déjà les extrémités.
- Pour la vidéo référence-vers-vidéo, étiquetez le rôle de chaque entrée d'image, vidéo et audio.
- Commencez par six secondes. N'ajoutez de durée que si l'action l'exige vraiment.
- Les blocs de timing comme
[0–2 seconds]sont une technique d'écriture, non une commande analyseur garantie. Utilisez-les pour rendre la progression prévue non ambiguë.
La structure du prompt MiniMax H3
H3 supporte trois formes de requête : vidéo texte-vers-texte avec prompt uniquement, image-vers-vidéo première/dernière image et vidéo référence avec images, vidéos et audio. L'API sélectionne le mode à partir du média joint ; le prompt devrait changer en conséquence. La référence API MiniMax H3 documente les règles de validation exactes.[2]
Pour un plan avec prompt uniquement, utilisez cet ordre :
SUBJECT — qui ou quoi le plan suit
ACTION — une progression visible unique, avec une fin claire
SETTING — uniquement les détails qui affectent le plan
CAMERA — cadrage, mouvement, mise au point et rythme
LIGHT — direction, heure de la journée et réponse du matériau
SOUND — dialogue, ambiance, Foley, musique ou silence volontaireCe n'est pas une syntaxe magique. C'est un moyen d'empêcher trois actions différentes et quatre mouvements de caméra différents d'être enterrés dans un paragraphe décoratif.

Commencez par un changement, pas un mood board
« Café cinématographique, belle lumière, premium, moody » nomme une esthétique mais n'offre nulle part où aller à la vidéo. Ajoutez un événement physique et un point final :
Gros plan de six secondes sur une machine à espresso en acier brossé au lever du soleil. Un barista verrouille le porte-filtre, appuie sur le commutateur, et le premier flux de café noir atteint la tasse à la dernière seconde. Dolly lent de gauche à droite, mise au point superficielle, reflets chauds des fenêtres. Un clic de commutateur, vapeur montante, son ambiant calme. Pas de dialogue ou de musique.
Le plan a maintenant un début, un milieu et une fin vérifiable. La caméra effectue un mouvement. La bande sonore est assez petite pour être mixée. « Premium » disparaît car les matériaux, la lumière, le rythme et la retenue font déjà ce travail.
Gardez une action dominante
Les courts métrages punissent la chorégraphie surchargée. Si un prompt de six secondes demande à une personne d'entrer, s'asseoir, ouvrir un colis, parler, boire, regarder dehors et partir, le modèle doit compresser ou omettre quelque chose. Choisissez l'action dont parle le clip. Déplacez le reste vers un autre plan.
Donnez à la caméra un verbe
Panoramique, inclinaison, dolly, grue, orbite, suivi portatif et mise au point sélective ne sont pas des synonymes. Choisissez un mouvement de caméra principal. Une deuxième instruction peut décrire la mise au point ou une petite finition, mais un plan « dolly in while orbiting, craning up, and whip-panning » est généralement une demande de conflit.
Décrivez la réponse du matériau au lieu de la qualité
Les mots comme « superbe », « épique » et « haute qualité » ne donnent rien au critiqueur à vérifier. Décrivez ce que la lumière fait : un reflet étroit glissant sur le métal brossé, une lumière de fenêtre douce enveloppant un visage, ou la pluie brisant un reflet de néon sur l'asphalte mouillé.
Un modèle de prompt MiniMax H3 texte-vers-vidéo
La vidéo texte-vers-texte n'a pas de frame source, donc le prompt doit établir à la fois l'image et le mouvement. La requête nécessite également un rapport d'aspect explicite sur reAPI.
[Durée et cadrage]
A [taille du plan] of [sujet] in [décor].
[Action]
Le sujet [action unique], se terminant par [dernier plan visible].
[Caméra et lumière]
[Un mouvement de caméra], [comportement de mise au point]. [Lumière spécifique et réponse du matériau].
[Audio]
[Dialogue s'il y en a]. [Ambiance]. [Foley]. [Musique ou pas de musique].
[Garde-fous]
Un plan continu. Pas de coupes. Pas de texte ou logos ajoutés.Exemple rempli :
Plan moyen-large de huit secondes d'un cycliste qui attend sous un viaduc sous une pluie légère. Elle serre un gant, regarde vers la route, puis s'élance et sort du cadre à droite. Suivi portatif lent en avant ; la mise au point reste sur son visage jusqu'à ce que la bicyclette bouge. Lumière diurne fraîche, béton mouillé, petits reflets ambre des voitures qui passent. Pluie sur béton, un clic de roue libre, un bus lointain, pas de musique, pas de dialogue. Un plan continu, pas de coupes, pas de texte à l'écran.
La requête correspondante est petite :
curl https://reapi.ai/api/v1/videos/generations \
-H "Authorization: Bearer $REAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "minimax-h3",
"prompt": "Eight-second medium-wide shot of a cyclist waiting beneath an overpass in light rain. She tightens one glove, looks toward the road, then pushes off and exits frame right. Slow handheld track forward; focus stays on her face until the bicycle moves. Cool daylight, wet concrete, small amber reflections from passing cars. Rain on concrete, a freewheel click, one distant bus, no music, no dialogue. One continuous shot, no cuts, no on-screen text.",
"aspect_ratio": "16:9",
"duration": 8
}'La soumission retourne un ID de tâche. Sondez le point de terminaison de tâche partagée jusqu'à ce que le résultat soit complet. Le MP4 terminé inclut la piste audio générée.
Écrivez les prompts première/dernière image comme des transitions
En mode image-vers-vidéo, une première image, une dernière image ou les deux établissent déjà l'apparence et l'orientation. Répéter chaque détail visuel gaspille l'espace du prompt et peut éloigner la génération des images fournies.
Dites à H3 ce qui doit arriver entre elles :
Passez continuellement de la première image à la dernière image.
L'emballage en papier se déplie le long de ses plis existants ; aucun nouveau panneau n'apparaît.
La caméra reste verrouillée. Le produit ne tourne pas.
Léger bruissement de papier, un petit coup de table, son ambiant calme du studio, pas de musique.
Terminez sur la composition exacte de la dernière image.Sur reAPI, l'image-vers-vidéo dérive l'orientation de la frame. N'envoyez pas de champ aspect_ratio dans ce mode. Recadrez les images sources au rapport de livraison prévu avant la soumission.[2]
Si les images de début et de fin ne s'accordent pas sur l'échelle du sujet, la hauteur de la caméra ou l'éclairage, le prompt ne peut pas réparer complètement la contradiction. Corrigez d'abord les extrémités. Le modèle doit consacrer ses efforts au mouvement, pas à la réconciliation de deux prises différentes.
Attribuez à chaque référence un rôle unique
La vidéo référence-vers-vidéo est le workflow le plus distinctif de H3. Une requête peut inclure jusqu'à neuf images, trois vidéos et trois clips audio. Plus d'entrées ne créent pas automatiquement une meilleure continuité. Une pile de référence sans étiquette demande au modèle de deviner quoi copier de chaque fichier.
Utilisez une carte de référence explicite :
Image de référence 1 : préserver le visage, les cheveux, le manteau et les proportions de cette personne.
Image de référence 2 : utiliser uniquement l'intérieur de la voiture et les matériaux des sièges.
Vidéo de référence 1 : utiliser son rythme de marche et mouvement des épaules, pas sa caméra.
Audio de référence 1 : utiliser cette identité vocale et cette cadence pour la ligne citée.
Créez un plan de sept secondes. Le personnage marche dans l'allée vers la caméra, touche le haut d'un siège et dit : « Nous sommes presque arrivés. » Dolly stabilisé lent en arrière au niveau des yeux. La lumière de fin d'après-midi traverse les fenêtres. Gardez la voix claire sur le bruit de rail faible ; pas de musique et pas de hauts-parleurs supplémentaires.Cela sépare l'identité, l'environnement, le mouvement et la voix. Cela dit aussi à un critiqueur humain où regarder quand un résultat échoue.
Les vidéos de référence ne sont pas du contexte libre. Sur la route reAPI, leur durée est ajoutée à la durée de génération facturée. Les cinq premières images de référence sont incluses, tandis que les images six à neuf ajoutent un coût par image. Utilisez la page modèle MiniMax H3 pour les tarifs actuels plutôt que de remplir une requête de références inutilisées.[3]
Dirigez le son comme une partie du plan
MiniMax H3 génère l'audio stéréo natif avec l'image. Un bon descriptif sonore répond à cinq questions :
| Question | Exemple de réponse |
|---|---|
| Qui parle ? | La femme au manteau bleu, et personne d'autre |
| Qu'est-ce qui est exact ? | « Nous sommes presque arrivés. » |
| Qu'est-ce qui établit le lieu ? | Bruit de rail bas et deux petits cliquetis doux de voiture |
| Qu'est-ce qui devrait être au premier plan ? | Voix claire et centrée au-dessus de l'ambiance |
| Qu'est-ce qui doit être absent ? | Pas de musique, bavardage de foule, annonce ou sous-titres |
« L'audio cinématographique » ne répond à aucun d'entre eux.
Quand il y a du dialogue, gardez la ligne assez courte pour le clip. Lisez-la à haute voix au rythme prévu. Une ligne de douze mots qui prend cinq secondes laisse peu de place pour l'action, la réaction et le silence naturel autour.
Le silence devrait être énoncé. Sans « pas de musique » ou « pas de dialogue », le modèle peut remplir une bande sonore vide parce que le prompt l'a laissée ouverte. La même chose s'applique aux sous-titres et au texte à l'écran.
Les blocs de timing aident quand l'ordre importe
Pour un plan avec plusieurs coups, le timing approximatif peut clarifier la séquence :
[0–2 seconds] Gros plan verrouillé. L'allumette touche la mèche ; son ambiant uniquement.
[2–5 seconds] La flamme s'allume et grandit. Dolly très lent en avant ; allumage doux.
[5–7 seconds] Une main protège la flamme, puis sort du cadre. Un souffle calme.
Pas de coup, pas de dialogue, pas de musique.Traitez ces crochets comme un brouillon éditorial. MiniMax ne promet pas l'obéissance cadre-exacte au timing en prose, et la vidéo générée ne doit pas être utilisée pour le travail qui nécessite un timing de cadre déterministe. Les blocs réduisent toujours l'ambiguïté sur l'ordre et l'emphase.
Cinq échecs de prompt et leurs corrections plus petites
| Échec | Pourquoi cela arrive | Correction plus petite |
|---|---|---|
| Le plan semble statique | Le prompt décrit l'apparence, pas le changement | Ajouter une action physique et un dernier coup |
| La caméra s'ébranle | Plusieurs mouvements de caméra en concurrence | Garder un mouvement ; faire du reste des contraintes de cadrage |
| L'identité dérive | Les références n'ont pas de rôles assignés | Nommer une source d'identité et protéger ses invariants |
| L'audio est encombré | « Le son cinématographique » laisse tout ouvert | Lister le son au premier plan, l'ambiance et les absences explicites |
| La dernière image est manquée | Les extrémités se contredisent ou l'action est surchargée | Aligner les images sources et simplifier la transition |
Les instructions négatives fonctionnent mieux quand elles protègent une exigence. « Pas de coupes » est utile pour une révélation continue de produit. Vingt interdictions génériques cachent généralement l'une des contrainte qui importait.
Un examen rapide du prompt avant de dépenser une génération
Lisez le prompt une fois et soulignez les réponses :
- Qu'est-ce qui change pendant le clip ?
- Qu'est-ce qui doit être vrai à la dernière seconde ?
- Que fait la caméra ?
- Quels détails visuels sont protégés ?
- Qui parle, et quels mots exacts dit-on ?
- Quelle ambiance et quels effets doivent être entendus ?
- Quels sons, coupes, textes ou logos ne doivent pas apparaître ?
- Si des références sont jointes, quel rôle unique chacune remplit-elle ?
Si deux réponses se contredisent, corrigez le descriptif avant d'augmenter la durée ou d'ajouter une autre référence.
FAQ
Quelle longueur devrait avoir un prompt MiniMax H3 ?
Le champ reAPI accepte 1–7 000 caractères, mais la plupart des plans isolés n'ont pas besoin du plafond. Utilisez assez de détails pour spécifier l'action, la caméra, la lumière, le son et les contraintes protégées. Supprimez les adjectifs qui ne changent pas une décision d'examen.
MiniMax H3 peut-il générer du dialogue et des effets sonores ?
Oui. H3 génère l'audio stéréo natif et accepte le dialogue, la musique, l'ambiance et les effets dans le même prompt que la direction visuelle.
MiniMax H3 comprend-il les commandes de caméra ?
La documentation vidéo de MiniMax donne des directives de mouvement de caméra pour ses modèles vidéo, et les prompts H3 peuvent décrire le cadrage, le mouvement et la mise au point. Traitez-les comme une direction plutôt que comme des données déterministes de contrôle de mouvement.[1]
Dois-je utiliser des première/dernière images ou des images de référence ?
Utilisez les première/dernière images quand le plan doit commencer ou se terminer sur une composition spécifique. Utilisez le mode référence quand des actifs séparés définissent l'identité, l'environnement, le mouvement ou la voix. Les deux familles d'entrée ne peuvent pas être mélangées dans une seule requête reAPI.
Combien de références MiniMax H3 peut-il utiliser ?
La route reAPI actuelle accepte jusqu'à neuf images, trois clips vidéo et trois clips audio. L'audio ne peut pas être la seule référence. Les limites de durée totale de vidéo de référence et audio de référence s'appliquent également.
Les crochets de timing sont-ils une syntaxe officielle MiniMax ?
Non. C'est un moyen lisible de communiquer l'ordre et l'emphase approximative. Ne les présentez pas comme des contrôles cadre-exacts ou des commandes analyseur garanties.
Le prompt est une note de production
Le meilleur prompt MiniMax H3 ressemble à une courte note d'un réalisateur à une petite équipe. Elle dit ce qui se passe, où va la caméra, ce que le microphone entend et quels détails ne peuvent pas dériver. Elle ne demande pas au modèle de découvrir le plan à l'intérieur d'un nuage de mots de style.
Commencez par une action et six secondes. Révisez le mouvement et le son séparément. Ce n'est qu'ensuite que vous ajoutez des références, des blocs de timing ou une durée plus longue. Le playground MiniMax H3 et le guide API utilisent les mêmes modes de requête, donc un prompt peut passer d'un test manuel au code sans changer son rôle.
Divulgation : reAPI publie ce guide et exploite le point de terminaison MiniMax H3 routé décrit ici. Les limites API et le comportement de facturation se rapportent au contrat actuel de reAPI ; les descriptions de capacité MiniMax proviennent de la documentation officielle de MiniMax. Les prompts d'exemple sont des modèles d'écriture, pas des résultats de benchmark.
References
- MiniMax API. Video Generation Guide — MiniMax H3 inputs, output, audio, and camera direction. Retrieved August 13, 2026. platform.minimax.io/docs/guides/video-generation
- reAPI. MiniMax H3 API reference — request modes, limits, and billing. Retrieved August 13, 2026. reapi.ai/docs/minimax-h3
- reAPI. MiniMax H3 model page and live pricing. Retrieved August 13, 2026. reapi.ai/models/minimax-h3
Further reading
Auteur

Catégories
Plus d'articles

Guide Gemini 3.6 Flash : performance, prix et limites
Gemini 3.6 Flash : résultats officiels, où il perd face à GPT-5.6 Luna et Claude Sonnet 5, quatre changements API cassants, et Flash-Lite et Cyber.


Vidéo musicale depuis audio et images: API complète
Convertissez une chanson MP3 (10 s à 5 min) et 1-7 images en vidéo musicale complète en une seule requête API, avec sous-titres, exemples et tarification.


Wan 3.0 : poids open source, API et déploiement local
Wan 3.0 propose une API, mais aucun poids open source officiel au 23 août 2026. Découvrez ce qui existe, ce qui manque, et quand préférer Wan 2.2 en local.
