
MiniMax H3 local vs API : VRAM, vitesse, licence et coût
Que permettent d’établir les documents officiels de MiniMax et ComfyUI sur le matériel local H3 ? Comparez le workflow documenté aux coûts API 768P et 2K.
Exécutez MiniMax H3 en local lorsque le workflow officiel optimisé convient à votre matériel et que vous avez besoin d’itérations répétées ou d’entrées privées ; utilisez une API pour des clips finis occasionnels, une sortie 2K hébergée, de la concurrence ou aucune configuration. Le guide officiel de ComfyUI indique que le déchargement dynamique peut lancer le workflow sur une RTX 3060, mais un lancement n’est ni un benchmark de vitesse ni la preuve que plusieurs niveaux de VRAM donnent des résultats équivalents.[1]
L’expression « tourne en local » doit être accompagnée de trois chiffres : résolution, durée et temps d’exécution. Sans eux, un lancement à faible mémoire et un déploiement serveur semblent identiques.
Ce que signifie actuellement H3 en local
| Configuration | Résultat officiellement documenté | Réserve importante |
|---|---|---|
| Paquet ComfyUI officiel optimisé | Empreinte totale de 42,5 Go ; le déchargement dynamique peut démarrer sur RTX 3060 | Un démarrage n’est pas un benchmark de vitesse |
| Exemple SGLang officiel | Déploiement complet sur quatre GPU | Voie serveur, pas une recette mono-GPU grand public |
Le guide officiel H3 de ComfyUI fixe le canevas natif 16:9 à 1344×768 et regroupe des poids INT8 élagués, un encodeur de texte NVFP4, des VAE vidéo et audio séparés et des Turbo LoRA facultatifs.[1] L’optimisation publiée a réduit l’empreinte en pleine précision de 123,6 Go à 42,5 Go. Le déchargement permet à une carte plus petite de lancer le workflow en déplaçant des composants dans la mémoire système ; il ne les fait pas disparaître.
La capacité VRAM seule ne suffit donc pas à dire si un workflow local est utile. La résolution, la durée, le temps d’exécution et le niveau de déchargement doivent figurer dans le même résultat de test.
Ce que les documents officiels établissent sur le matériel local
Les sources officielles citées établissent deux voies de déploiement concrètes : un workflow ComfyUI optimisé avec déchargement dynamique et un exemple SGLang multi-GPU. Elles ne publient pas de grille de performances comparable pour les systèmes grand public de 8, 12 et 24 Go.
Avant de transformer un résultat local en recommandation d’achat, posez trois questions directes :
- Le workflow exact peut-il se charger sans erreur de mémoire insuffisante ?
- Quelle résolution et quelle durée produit-il, et combien de temps prend une tentative ?
- La sortie demandée utilise-t-elle uniquement le workflow local natif, ou un service officiel hébergé de contexte ou de régénération ?
La fiche modèle de MiniMax distingue également le workflow local natif de la voie 2K complète. Le workflow 2K publié associe le déploiement local aux API officielles Context-IR ou de régénération.[2] Le 768p local et le 2K hébergé sont donc deux produits de sortie différents, pas deux prix pour un travail identique.
Coût de l'API MiniMax H3
Prix vérifiés le 23 août 2026 :
| Voie hébergée | Par seconde | 5 secondes | 15 secondes |
|---|---|---|---|
| MiniMax direct, 768P | $0.080 | $0.400 | $1.200 |
| reAPI, 768P | $0.074 | $0.370 | $1.110 |
| MiniMax direct, 2K | $0.130 | $0.650 | $1.950 |
| reAPI, 2K | $0.119 | $0.595 | $1.785 |
Le tarif officiel de MiniMax facture par durée de sortie. La durée de la vidéo d'entrée est aussi facturée à la résolution sélectionnée, les cinq premières images de référence sont gratuites, les images ultérieures ajoutent des frais et les références audio sont gratuites.[3]
La page modèle reAPI MiniMax H3 publie des tarifs 768P et 2K séparés.[4] Ce sont des chiffres datés, pas des promesses permanentes ; utilisez la page en direct pour un budget.
Le seuil de rentabilité du matériel se mesure en tentatives
Supposons que H3 nécessite une mise à niveau matérielle de 500 $. Ignorez l'électricité et le temps de configuration pour l'instant.
- À 1,11 $ pour un clip 768P API de 15 secondes, 500 $ achètent environ 450 tentatives.
- À 1,785 $ pour un clip 2K de 15 secondes, cela achète environ 280 tentatives.
- Un budget machine de 1 000 $ fait passer ces chiffres à environ 900 tentatives en 768P ou 560 en 2K.
L'unité correcte est tentatives, pas vidéos livrées. Si un seul shot accepté nécessite cinq générations, 450 tentatives peuvent devenir 90 clips finis. La génération locale en bénéficie le plus quand les brouillons rejetés dominent la charge de travail.
L'arithmétique change aussi quand la GPU est déjà sur le bureau. Son coût d'achat est englouti, et H3 local devient rapidement attrayant pour l'itération illimitée basse résolution, le matériel de référence hors ligne, les nœuds personnalisés et le contrôle complet du workflow.
L'accès à l'API gagne son coût quand le volume est irrégulier, qu'une livrable 2K est requise, que plusieurs travaux doivent s'exécuter sans occuper un poste de travail, ou que l'équipe préférerait passer 0,37 $ à tester une invite plutôt que de passer un week-end à ajuster les paramètres de mémoire.
Vérifiez la licence avant d'acheter la GPU
MiniMax H3 est open-weight, pas sous licence Apache ou MIT. La licence communautaire actuelle exclut les États-Unis, l'Union européenne, le Royaume-Uni et la Corée du Sud de son territoire applicable et ordonne aux utilisateurs là-bas d'obtenir une autorisation écrite séparée.[5]
Le téléchargement public et la permission pour un déploiement sont des questions distinctes. La licence contient aussi des conditions de revenus commerciaux et d'attribution. Notre guide de licence MiniMax H3 explique les clauses sans essayer de donner des conseils juridiques.
Cette distinction importe surtout pour l'auto-hébergement parce que l'équipe prend et opère les poids directement. Une API hébergée est une voie contractuelle différente et doit être évaluée selon ses conditions de service.
Foire aux questions
Le H3 de MiniMax peut-il tourner sur 8 Go de VRAM ?
Les sources officielles citées n’établissent aucun résultat pour une configuration de 8 Go. Le guide officiel de ComfyUI documente un lancement par déchargement dynamique sur RTX 3060, sans établir les performances d’une configuration 8 Go.
12 Go de VRAM suffisent-ils pour H3 ?
Les preuves officielles citées ne suffisent pas à déclarer toutes les configurations de 12 Go adaptées. Elles démontrent une voie précise, optimisée et déchargée, pas une garantie générale de performances avec 12 Go.
Le H3 local est-il gratuit ?
Il n'y a pas de facturation par génération API, mais le matériel, l'électricité, le stockage, le temps de configuration et les tentatives locales échouées ont toujours des coûts. La licence communautaire peut aussi déterminer si le déploiement prévu est autorisé.
Quand l'API est-elle moins chère que H3 local ?
Pour une nouvelle dépense matérielle de 500 $, le seuil de rentabilité actuel est approximativement 450 tentatives 768P quinze secondes ou 280 tentatives 2K quinze secondes sur reAPI, avant électricité et temps de configuration.
Le H3 local produit-il la même sortie 2K que l'API hébergée ?
Pas via le workflow native ComfyUI basique. MiniMax décrit le workflow 2K complet comme une combinaison du déploiement local et des services officiels context ou régénération.
References
- ComfyUI. Tutoriel officiel MiniMax H3. Récupéré le 23 août 2026 de docs.comfy.org
- MiniMaxAI. Fiche de modèle MiniMax H3 et exemples de déploiement. Récupéré le 23 août 2026 de huggingface.co
- MiniMax API. Tarification à l'usage. Récupéré le 23 août 2026 de platform.minimax.io
- reAPI. Page modèle MiniMax H3 et tarification en direct. Récupéré le 23 août 2026 de reapi.ai
- MiniMaxAI. Licence communautaire MiniMax H3. Récupéré le 23 août 2026 de huggingface.co
Auteur

Catégories
Plus d'articles

Seedance 2.0 vs Kling 3.0 : benchmarks, prix et verdict
Seedance 2.0 face à Kling 3.0 selon l’Elo des tests aveugles, les fonctions et le prix à la seconde : qualité de Seedance, 4K et audio de Kling.


Alternatives API Sora 2 : longueur, audio, coûts
Comparer les alternatives API Sora 2 par critère décisif : longueur du clip, tarification audio et coûts réels par seconde, vérifiés en août 2026.


Forfaits illimités Seedance 2.5 : audit mathématique
Auditez un forfait Seedance 2.5 illimité à partir de son modèle publié, fenêtre, queue, concurrence, durée et conditions d'accès, puis comparez le coût facturé.
