
Hailuo H3 : API, spécifications, tarification et limites 2026
Découvrez les spécifications Hailuo H3, l'audio natif stéréo, la tarification API, les limites et le code d'intégration pour MiniMax H3 en 2026.
Hailuo H3 est le nom de recherche qu'utilisent les gens pour MiniMax H3, le modèle vidéo lancé par MiniMax le 31 juillet 2026. Sa documentation d'API appelle aussi cette version Hailuo 03. Ces noms désignent le même modèle : un système multimodal qui accepte du texte, des images, de la vidéo et de l'audio, puis génère une vidéo de 4–15 secondes avec audio stéréo natif jusqu'à la 2K.[1][2]
La distinction utile porte sur les trois workflows du modèle : la génération vidéo à partir du texte seul, la génération vidéo à partir de première/dernière image, et la génération vidéo avec références mélangées (image, vidéo et audio combinés). Ce guide mappe ces modes aux règles API exactes, sépare le prix direct de MiniMax de la tarification reAPI, et montre la forme de requête qui fonctionne sur reAPI dès aujourd'hui.
Spécifications de Hailuo H3 en un coup d'œil
| Élément | MiniMax H3 / Hailuo 03 |
|---|---|
| Date de lancement | 31 juillet 2026 |
| Entrée | Texte, images, vidéo et audio |
| Sortie | Vidéo MP4 avec audio stéréo natif |
| Résolution | Jusqu'à 2K |
| Durée | 4–15 secondes, par incrément d'une seconde entière |
| Modes de génération | Texte vers vidéo, image vers vidéo, référence vers vidéo |
| Capacité de références | Jusqu'à 9 images, 3 vidéos et 3 clips audio |
| Rapports d'aspect | 21:9, 16:9, 4:3, 1:1, 3:4 et 9:16 |
| Prix MiniMax direct | $0,13/s en 2K ; $0,09/s en 768p |
| ID du modèle reAPI | minimax-h3 |
MiniMax décrit H3 comme un modèle de génération omni-modal à usage général plutôt que simplement un moteur de rendu vidéo. L'article de lancement dit qu'il peut comprendre le contexte dans les quatre modalités d'entrée et générer de la vidéo, de l'audio, des images et du texte, bien que l'API vidéo publique soit la surface de produit documentée en détail au lancement.[1]
MiniMax appelle aussi H3 un modèle ouvert. Son article de lancement dit que les poids du modèle seront publiés « dans les prochains jours », sous réserve des lois et règlements applicables. Tant que les poids et la licence ne sont pas réellement publiés, traitez l'auto-hébergement comme une étape annoncée suivante plutôt que comme un chemin de déploiement disponible.
Pourquoi Hailuo H3 et Hailuo 03 sont le même modèle
La version officielle utilise deux couches de nommage. MiniMax H3 est le nom du modèle dans l'article de lancement de MiniMax et la valeur model dans son API de génération V2. Hailuo 03 apparaît dans les descriptions de produit et d'API pour la même version. « Hailuo H3 » combine le nom de la famille de produits avec la version du modèle, c'est pourquoi c'est devenu un terme de recherche naturel même si ce n'est pas l'identifiant API exact.
Utilisez le nom qui correspond au contexte :
- La copie d'édition et de recherche peut mentionner Hailuo H3, MiniMax H3 et Hailuo 03 ensemble une fois, puis s'en tenir à MiniMax H3.
- Le point de terminaison V2 direct de MiniMax attend
MiniMax-H3. - reAPI attend l'ID de modèle en minuscules
minimax-h3.
Cette dernière différence au niveau des caractères importe. Les ID de modèle sont des valeurs contractuelles, pas de la marque, donc copier le nom d'affichage dans le code produira une requête invalide.
Un modèle route trois workflows vidéo différents

MiniMax H3 sélectionne son mode de génération à partir des médias joints à la requête. Les trois routes partagent le même modèle sous-jacent, mais leurs règles de validation ne sont pas interchangeables.[3]
Texte vers vidéo : prompt plus un rapport d'aspect explicite
Texte vers vidéo est la route la plus simple. Envoyez un prompt sans références de média et choisissez l'un des six rapports d'aspect. Le prompt peut décrire les visuels, les mouvements de caméra, le dialogue, la musique, l'ambiance et les effets sonores dans le même brief.
Sur reAPI, aspect_ratio est obligatoire pour texte vers vidéo et ne peut pas être adaptive. Utilisez 16:9 pour le paysage, 9:16 pour la vidéo social verticale, ou l'un des quatre formats intermédiaires quand la surface de livraison l'exige.
Image vers vidéo : première image, dernière image ou les deux
Image vers vidéo accepte une première image, une dernière image, ou les deux. Fournir deux images donne au modèle un point de départ visuel et une destination, ce qui le rend utile pour une transition planifiée, une révélation de produit ou un plan qui doit atterrir sur une composition spécifique.
L'image contrôle l'orientation de sortie, donc reAPI rejette aspect_ratio dans ce mode. Recadrez les images source au format de livraison prévu avant de les soumettre. Les entrées première/dernière image ne peuvent pas être mélangées avec les tableaux de références séparés dans une seule requête.
Référence vers vidéo : assigner identité, mouvement et son séparément
Référence vers vidéo est la route la plus flexible. Une requête peut porter jusqu'à neuf images, trois clips vidéo et trois clips audio. Cela permet d'utiliser une image pour l'identité du personnage ou du produit, une vidéo pour le mouvement et le langage caméra, et l'audio pour la voix ou la direction sonore.
Il y a des limites dures derrière ces comptes de titre :
- chaque vidéo de référence doit durer 2–15 secondes, tous les références vidéo totalisant au maximum 15 secondes ;
- chaque fichier audio de référence doit durer 2–15 secondes, tous les références audio totalisant au maximum 15 secondes ;
- l'audio ne peut pas être la seule référence—il doit accompagner au moins une image ou une vidéo ;
- le mode référence peut utiliser un rapport d'aspect explicite ou par défaut à
adaptive.
N'envoyez pas les références comme un tas indifférencié. Indiquez le rôle de chaque ressource dans le prompt : identité du portrait, mouvement du clip, voix de l'audio et éclairage du cadre du produit. L'API accepte de nombreuses entrées, mais une division claire des responsabilités donne au modèle moins de signaux contradictoires.
L'audio stéréo natif change la façon d'écrire le prompt
MiniMax H3 génère l'audio stéréo avec la vidéo au lieu d'ajouter une piste audio séparée après le passage visuel.[1] Le prompt doit donc diriger le son aussi délibérément que la caméra.
Un prompt H3 utile a quatre couches :
- Sujet et action : ce qui est visible et ce qui change pendant le plan.
- Caméra et timing : cadrage, mouvement, mise au point, coupes et rythme.
- Contenu parlé : dialogue exact et locuteur prévu.
- Lit sonore : musique, ambiance, effets sonores, relations de volume et silence.
Par exemple :
Un gros plan de 6 secondes sur une machine à espresso en métal brossé au lever du soleil. Dolly lent de gauche à droite, reflets de fenêtre chauds, faible profondeur de champ. Un léger clic de commutateur, vapeur montante, ambiance de café tranquille et un accord de piano sobre. Pas de dialogue.
L'audio natif supprime une étape de synchronisation initiale ; il ne garantit pas un mélange final. La clarté du dialogue, la synchronisation labiale, la continuité musicale et les effets non désirés nécessitent toujours un examen sur chaque clip accepté. Pour les budgets de production, la métrique pertinente est le coût par résultat utilisable, pas le coût par seconde générée.
Tarification MiniMax H3 : API direct par rapport à reAPI
Le tableau de paiement à l'usage direct de MiniMax liste sortie 2K à $0,13 par seconde et 768p à $0,09 par seconde.[4] Une sortie 2K de 10 secondes coûte donc au minimum $1,30 avant les médias d'entrée facturables.
La facturation MiniMax directe ajoute trois règles :
- l'entrée audio est gratuite ;
- les cinq premières images d'entrée sont gratuites, puis chaque image supplémentaire coûte $0,04 ;
- la vidéo d'entrée est facturée par durée au taux de résolution de sortie sélectionné.
reAPI a son propre contrat de produit. La page du modèle MiniMax H3 liste $0.183 par seconde pour la sortie 2K et $0.113 par seconde en 768P. Les secondes vidéo de référence s'ajoutent aux secondes vidéo générées, les cinq premières images de référence sont gratuites, et les images 6 à 9 coûtent $0.055 chacune.[5][6]
La formule reAPI est :
cost = per-second rate × (output seconds + reference-video seconds)
+ extra-image rate × max(0, reference images - 5)Les quantités facturables importent plus que l'arithmétique : une sortie de 10 secondes utilisant une référence de mouvement de 6 secondes facture 16 secondes, pas 10. Sept images de référence ajoutent deux frais d'image supplémentaire en haut, car cinq sont gratuites. Les références audio n'ajoutent aucun frais.
Ce sont deux feuilles tarifaires différentes pour deux intégrations différentes. Ne présentez pas le taux direct de MiniMax de $0,13 comme le taux reAPI, ou le taux reAPI comme le prix catalogue officiel de MiniMax. Tous deux peuvent changer après le lancement, donc le code de production devrait lire la page du modèle actuelle plutôt que de coder en dur le numéro de l'article dans l'interface utilisateur.
Comment appeler l'API MiniMax H3 sur reAPI
reAPI expose les trois modes H3 via son point de terminaison vidéo asynchrone standard. Une requête texte vers vidéo minimale est :
curl https://reapi.ai/api/v1/videos/generations \
-H "Authorization: Bearer $REAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "minimax-h3",
"prompt": "A rain-soaked night market, slow handheld push forward, vendors calling softly, distant thunder and natural street ambience",
"aspect_ratio": "16:9",
"duration": 6
}'La soumission retourne un ID de tâche. Interrogez le point de terminaison de tâche partagé jusqu'à ce que le résultat soit complet :
curl https://reapi.ai/api/v1/tasks/TASK_ID \
-H "Authorization: Bearer $REAPI_API_KEY"La réponse complétée contient output.video_urls. L'interrogation ne consomme pas de crédits, et les générations échouées sont remboursées automatiquement.[5]
Changez la forme de la requête pour sélectionner un autre mode :
{
"model": "minimax-h3",
"prompt": "The character turns naturally and smiles as the camera pushes in",
"first_frame_url": "https://example.com/first-frame.jpg",
"last_frame_url": "https://example.com/last-frame.jpg",
"duration": 6
}Pour référence vers vidéo, remplacez les champs de cadre par reference_image_urls, reference_video_urls et reference_audio_urls. Toutes les entrées multimédias doivent être des URL HTTP(S) publiques ; les URL base64 et data: sont rejetées.
La référence API MiniMax H3 complète documente les formats médias, les limites de taille de fichier, la réponse de tâche, les erreurs et le comportement de facturation.
Où Hailuo H3 s'inscrit—et ce qui reste à tester
H3 s'évalue mieux comme un générateur de plans, pas comme un studio vidéo long format en un clic. Quinze secondes peuvent couvrir un beat de produit, un échange de dialogue, un clip social ou une section d'une publicité. Un élément de 60 secondes nécessite toujours plusieurs générations, une planification de continuité, un montage et une passe sonore finale.
La route de références mixtes est la raison pour laquelle les équipes de marque, de personnage et de pré-visualisation devraient la tester. La route première/dernière image est la raison pour laquelle les animateurs devraient s'y intéresser. L'audio stéréo natif est la raison pour laquelle les équipes de contenu court peuvent supprimer une étape de montage brut. Aucune de ces capacités ne prouve que H3 maintiendra un visage, un logo, une étiquette ou une voix dans chaque brief.
MiniMax appelle le modèle prêt pour la production et publie des exemples soignés pour les films de marque, le contenu narratif, la vidéo social, la publicité, l'UI/UX et les jeux. Ce sont des démonstrations du fournisseur, pas des repères indépendants. Une évaluation sérieuse devrait inclure des mains touchant des produits, du petit texte imprimé, deux orateurs dans un cadre, un mouvement rapide, un long dialogue et une cohérence entre les plans générés séparément.
Le modèle a été lancé un jour avant cet article, il n'y a donc pas encore assez de tests publics crédibles pour un classement de qualité. Cette limitation est plus utile qu'un verdict inventé : exécutez un ensemble de prompts fixes, enregistrez les sorties acceptées par dix tentatives, et comparez le coût total des plans approuvés au modèle déjà dans votre workflow.
Questions fréquemment posées
Hailuo H3, MiniMax H3 et Hailuo 03 sont-ils le même modèle ?
Oui. MiniMax H3 est le nom officiel du lancement et du modèle API ; Hailuo 03 est la description du produit/API pour la même version. Hailuo H3 est le terme de recherche hybride courant. Sur reAPI, utilisez l'ID de modèle minimax-h3.
Quelle est la durée maximale d'une vidéo MiniMax H3 ?
Chaque génération peut être de 4–15 secondes par incrément d'une seconde entière. Les vidéos plus longues doivent être divisées en plans et assemblées dans un éditeur.
Hailuo H3 génère-t-il de l'audio ?
Oui. Il génère de l'audio stéréo natif avec l'image et peut diriger le dialogue, la musique, l'ambiance et les effets dans le même prompt.
MiniMax H3 peut-il utiliser une référence audio seule ?
Non. L'audio de référence doit être associé à au moins une image ou une vidéo de référence. Le total des références audio ne peut pas dépasser 15 secondes.
Combien coûte MiniMax H3 ?
L'API direct de MiniMax liste $0,13/s en 2K et $0,09/s en 768p. reAPI liste $0.183/s en 2K et $0.113/s en 768P, avec les secondes vidéo d'entrée facturées au même taux et les frais d'image supplémentaire après les cinq premières.
MiniMax H3 est-il open source ?
MiniMax a annoncé H3 comme un modèle ouvert, mais l'article de lancement du 31 juillet a dit que les poids seraient publiés dans les jours à venir. Vérifiez les poids actuels et la licence avant de planifier un déploiement auto-hébergé.
La lecture pratique de MiniMax H3
Hailuo H3 est un problème de nommage enveloppé autour d'une conception de modèle utile : un seul point de terminaison MiniMax H3 couvre la génération prompt uniquement, l'animation première/dernière image et la vidéo avec références mixtes avec audio stéréo natif. Son plafond de 15 secondes le maintient au niveau des plans, tandis que les limites de références rendent ces plans plus contrôlables qu'un workflow prompt uniquement.
Commencez par la durée par défaut de six secondes, attribuez à chaque référence un rôle clair, et jugez H3 par les clips acceptés plutôt que par les démos de lancement. Les développeurs peuvent tester les mêmes formes de requête dans le playground MiniMax H3 ou passer directement à la documentation API.
Divulgation : reAPI publie cet article et exploite le point de terminaison MiniMax H3 routé décrit ci-dessus. Les spécifications MiniMax et les prix directs proviennent des matériaux de lancement publics et de la documentation de MiniMax ; les détails du contrat reAPI proviennent de notre page de modèle publiée et de notre référence API.
Références
- MiniMax. MiniMax H3: An Open Model Breaking the Boundaries Between Tasks and Modalities. Published July 31, 2026. minimax.io/blog/minimax-h3
- MiniMax API. Video Generation Guide — MiniMax H3 capabilities, duration, resolution, and media inputs. Retrieved August 1, 2026. platform.minimax.io/docs/guides/video-generation
- MiniMax API. Create a Video Generation Task V2 — request modes and validation rules. Retrieved August 1, 2026. platform.minimax.io/docs/api-reference/video-generation-v2-create
- MiniMax API. Pay as You Go Pricing — MiniMax H3 output and input-media rates. Retrieved August 1, 2026. platform.minimax.io/docs/guides/pricing-paygo
- reAPI. MiniMax H3 API reference — modes, parameters, billing, output, and errors. Retrieved August 1, 2026. reapi.ai/docs/minimax-h3
- reAPI. MiniMax H3 model page and live pricing. Retrieved August 1, 2026. reapi.ai/models/minimax-h3
Lectures supplémentaires
- reAPI. MiniMax H3 vs Seedance 2.5. reapi.ai/blog/minimax-h3-vs-seedance-2-5
- reAPI. AI Video Generation API Pricing: Cost per Second Compared. reapi.ai/blog/ai-video-generation-api-pricing
- reAPI. Gemini Omni API: Preview Specs, Pricing, and Limits. reapi.ai/blog/gemini-omni-api-preview-specs-pricing-2026
- reAPI. Best Open-Source AI Video Models for Local GPUs. reapi.ai/blog/best-open-source-ai-video-models-local-gpu-2026
Auteur

Catégories
Plus d'articles

DeepSeek Harness vs OpenCode vs Claude Code : guide
Comparez DeepSeek Harness, OpenCode et Claude Code selon le runtime, le choix du modèle, les permissions, la configuration et les coûts de boucles.


Rédiger des prompts MiniMax H3 pour vidéo et son
Meilleurs prompts MiniMax H3 pour texte-vidéo, première/dernière image, références mixtes, audio natif, direction de caméra, et intégration API reAPI.


Kimi K3 : guide complet du modèle phare 2.8T de Moonshot
Architecture, tarifs et API de Kimi K3 : contexte 1M, raisonnement permanent, échantillonnage fixe et appel via une API compatible OpenAI.
