
Meilleurs modèles vidéo IA open-source pour GPU local (2026)
Comparez Wan 2.2, HunyuanVideo-1.5, CogVideoX1.5 et Mochi 1 sur VRAM local, résolution, licence, vitesse, déploiement et cas d'usage pratiques.
Wan 2.2 TI2V-5B est le meilleur modèle vidéo IA local tout usage pour un GPU de 24GB. HunyuanVideo-1.5 est le point de départ le plus robuste à 14–16GB, tandis que CogVideoX1.5-5B offre l'expérience la plus réaliste en dessous. Mochi 1 reste intéressant pour sa licence Apache-2.0 et son pipeline modifiable, mais son utilisation VRAM et sa sortie 480p en font un choix spécialisé plutôt que la par défaut.
Cette réponse s'accompagne d'une mise en garde importante : un nombre VRAM minimum publié suppose généralement le déchargement CPU, le pavage, la précision inférieure ou les trois. Il vous dit qu'un workflow peut tenir. Il ne vous dit pas que le workflow sera assez rapide pour être utilisé tous les jours.
Cette comparaison utilise les fiches modèle officielles des projets et les dépôts, vérifiés le 30 juillet 2026. Le terme « modèle vidéo IA open-source » est utilisé parce que c'est comme cela que les gens cherchent ces modèles. « Open-weight » est souvent plus précis, surtout quand un modèle utilise une licence communautaire personnalisée.
Meilleurs modèles vidéo IA locaux en un coup d'œil
| Modèle | Chemin VRAM local publié | Sortie vidéo | Licence | Meilleur pour |
|---|---|---|---|---|
| Wan 2.2 TI2V-5B | Au moins 24GB avec déchargement CPU[1] | 720p, 24fps; text-to-video et image-to-video | Apache-2.0 | Meilleur équilibre pour une station de travail 24GB unique |
| HunyuanVideo-1.5 | 14GB minimum avec déchargement de modèle[2] | T2V et I2V 480p/720p, plus un chemin de super-résolution | Licence Communautaire Hunyuan Tencent | Meilleure option documentée pour un GPU CUDA 14–16GB |
| CogVideoX1.5-5B | BF16 Diffusers à partir de 10GB; INT8 à partir de 7GB[3] | 1360×768, 5 ou 10 secondes | Licence CogVideoX | Test basse-VRAM quand la génération lente est acceptable |
| Mochi 1 preview | 22GB pour l'exemple Diffusers précision inférieure; environ 60GB pour le dépôt référence GPU unique[4] | La version initiale cible text-to-video 480p | Apache-2.0 | Recherche, travail LoRA et licensing permissif |
Ces lignes ne sont pas équivalentes en benchmarks. La plus petite figure de CogVideoX utilise une précision et une stratégie VRAM différentes de celle documentée 24GB de Wan. L'exemple Mochi 22GB accepte explicitement une léger baisse de qualité. Traitez les nombres comme des routes de déploiement, pas comme un classement de qualité.
Ce que votre GPU peut réellement exécuter
8GB VRAM : un test technique, pas une station de travail confortable
CogVideoX1.5-5B est le seul modèle dans ce groupe dont l'éditeur documente un chemin INT8 Diffusers commençant autour de 7GB. La même fiche modèle avertit que la quantification et le déchargement CPU séquentiel réduisent la vitesse. Son test basse-mémoire a été réalisé sur du matériel A100/H100, bien que les auteurs disent que l'approche devrait généralement fonctionner sur les cartes NVIDIA Ampere ou plus récentes[3].
Une carte 8GB peut donc prouver que le modèle s'exécute, mais elle ne laisse guère de place pour l'écran, le décodeur, les clips plus longs ou un autre processus. Attendez-vous à du réglage de dépendances et une empreinte RAM système importante. Pour la production régulière, un travail hébergé ou un GPU plus grand est généralement moins frustrant.
10–12GB VRAM : CogVideoX devient utilisable pour les expériences patientes
Le chemin Diffusers BF16 optimisé de CogVideoX1.5-5B commence autour de 10GB. C'est un meilleur premier test qu'INT8 si la carte peut le supporter. Le compromis est le temps : les résultats du propre éditeur à 50 étapes pour un clip de cinq secondes sont mesurés en centaines de secondes même sur un H100, et plus long sur un A100[3]. Ce ne sont pas les prédictions pour GPU consommateur, mais elles rendent le goulot d'étranglement clair.
CogVideoX s'attend aussi à des invites en anglais. Les équipes acceptant des invites dans d'autres langues ont besoin d'une étape de traduction ou de réécriture d'invite avant l'inférence.
14–16GB VRAM : HunyuanVideo-1.5 est l'étape pratique suivante
Tencent publie un minimum de 14GB avec déchargement de modèle activé. Le chemin source officiel cible Linux, Python 3.10 ou plus récent, et un GPU CUDA NVIDIA[2]. C'est un point de départ beaucoup plus solide qu'une affirmation non officielle de la communauté selon laquelle un grand modèle vidéo « fonctionne sur 12GB ».
HunyuanVideo-1.5 supporte les points de contrôle text-to-video et image-to-video à 480p et 720p. Son modèle super-résolution séparé peut mettre à l'échelle la vidéo à 1080p. Cette dernière étape est du travail supplémentaire; elle ne devrait pas être décrite comme génération native 1080p.
La contrainte principale est légale plutôt que technique. La Licence Communautaire Hunyuan de Tencent exclut l'utilisation dans l'Union Européenne, le Royaume-Uni et la Corée du Sud, comprend des restrictions d'utilisation et exige une licence distincte pour certains produits au-dessus de son seuil d'utilisateurs spécifié[5]. Lisez la licence actuelle avant de la choisir pour un service commercial.
24GB VRAM : le niveau vidéo local utile
C'est là que la génération locale cesse de ressembler à un exploit de mémoire. Wan 2.2 TI2V-5B a une commande GPU unique officielle pour une carte RTX 4090 de classe 24GB. Elle supporte text-to-video et image-to-video dans un pipeline 5B unique et produit une vidéo 720p à 24fps[1].
La fiche modèle de Wan dit que le modèle 5B peut générer une vidéo 720p de cinq secondes en moins de neuf minutes sur un seul GPU consommateur sans optimisation spéciale. C'est utile pour les aperçus et le travail par lots, mais ce n'est pas l'édition interactive. La conception de la file d'attente compte toujours.
Mochi 1 peut aussi entrer dans cette couche via son exemple BF16 Diffusers 22GB. Genmo note une légère réduction de qualité pour ce chemin. Avec seulement une petite quantité de VRAM supplémentaire, une autre application ou un nombre de cadres différent peut faire sortir la tâche de la mémoire[4]. Choisissez Mochi ici pour sa valeur de recherche et sa licence, non pas parce que c'est le déploiement 24GB le plus sûr.
48–80GB VRAM : moins de compromis, pas de débit automatique
L'exemple Diffusers de qualité supérieure de Mochi nécessite 42GB, tandis que son dépôt référence décrit environ 60GB pour une opération GPU unique et recommande un H100[4]. Plus de mémoire peut aussi réduire le déchargement pour les autres modèles ou supporter plus d'un travailleur.
Il n'enlève pas le coût informatique de la diffusion. Avant d'acheter une carte plus grande, mesurez le nombre de clips acceptés par heure, pas le nombre de demandes soumises.
Wan 2.2 : meilleur choix global pour un GPU 24GB
Wan 2.2 TI2V-5B a la combinaison la plus claire de praticabilité locale et de capacité de sortie dans ce groupe :
- poids officiels et code d'inférence;
- un chemin documenté sur GPU unique 24GB;
- text-to-video et image-to-video dans le même modèle;
- sortie 720p à 24fps;
- licence Apache-2.0.
Soyez précis sur le nom du modèle. Wan 2.2 a aussi des points de contrôle A14B plus grands. Un tutoriel montrant TI2V-5B sur un 4090 ne prouve pas que les variantes plus grandes tiennent sur le même matériel. La taille du téléchargement, les arguments d'inférence et les besoins en mémoire diffèrent.
Wan est la première valeur de référence raisonnable pour un créateur indépendant, une équipe de recherche ou un studio avec un 4090. Sa faiblesse est la latence. Une machine unique peut restituer un lot utile pendant la nuit; elle est moins convaincante en tant que backend pour un produit qui promet des résultats immédiats.
HunyuanVideo-1.5 : meilleur à 14–16GB
HunyuanVideo-1.5 empaquette un modèle vidéo 8.3B autour d'un minimum officiel étonnamment accessible. C'est le candidat le plus solide ici quand la machine ne peut pas atteindre 24GB mais a toujours besoin de text-to-video et image-to-video.
Sa famille de modèles est plus compliquée qu'un simple téléchargement. Tencent énumère les points de contrôle 480p et 720p séparés, les variantes distillées et les poids super-résolution. Décidez quel chemin le produit a réellement besoin avant de configurer le stockage ou construire un conteneur.
Ce modèle est aussi l'exemple le plus clair de pourquoi « ouvert » et « permissif » sont des questions différentes. Les poids et le code d'entraînement sont disponibles, mais la licence communautaire a des conditions de territoire, d'attribution, de distribution et d'usage acceptable. Les hypothèses Apache-2.0 ne s'appliquent pas.
CogVideoX1.5-5B : meilleure expérience basse-VRAM
CogVideoX1.5-5B gagne le concours d'ajustement. Le tableau officiel documente les configurations BF16 de 10GB et INT8 de 7GB Diffusers, comparées à 76GB pour sa route SAT BF16[3]. Cet écart montre à quel point le chemin logiciel change la réponse matérielle.
Choisissez CogVideoX quand :
- le GPU disponible a 8–12GB;
- la génération peut s'exécuter en arrière-plan;
- les invites peuvent être normalisées à l'anglais;
- l'équipe est à l'aise d'épingler les dépendances CUDA, PyTorch, Diffusers et quantification.
Ne le choisissez pas uniquement parce que « 7GB » semble efficace. Le chemin INT8 échange la vitesse pour la mémoire, et la sortie 5 ou 10 secondes du modèle reste chère à échantillonner à plusieurs reprises. Une installation 12GB qui se complète fiablement peut être plus utile qu'une configuration 8GB fonctionnant à sa limite.
CogVideoX utilise sa propre licence. Examinez ce texte pour la distribution planifiée et l'usage commercial au lieu de traiter « téléchargeable sur Hugging Face » comme une conclusion juridique[6].
Mochi 1 : meilleur pour le travail de recherche permissif
Mochi 1 est une aperçu de recherche text-to-video 10B publié sous Apache-2.0. Genmo publie les poids, le code d'inférence, un pipeline programmable et un entraîneur LoRA. Cela en fait une bonne base pour les équipes qui se soucient de modifier la pile plutôt que simplement produire le clip la plus haute résolution.
Ses limitations sont inhabituellement bien documentées. Le point de contrôle initial cible 480p, est accordé vers le photoréalisme, peut montrer de la distorsion sous mouvement extrême et fonctionne moins bien sur les styles animés[7]. L'implémentation référence veut aussi environ 60GB de VRAM sur un GPU. Diffusers abaisse cela à 22GB en BF16, mais avec un compromis de qualité spécifié.
Mochi a du sens sur une station de travail de recherche ou un serveur multi-GPU. C'est plus difficile à justifier pour un créateur achetant une carte unique spécifiquement pour une sortie 720p finie.
« S'exécute localement » a quatre significations différentes
Les comparaisons de modèles effondrent souvent quatre jalons en un :
- Le processus démarre. Les poids se chargent avec quantification et déchargement.
- Un échantillon se termine. Un travail court, basse-lot évite une erreur mémoire insuffisante.
- Le workflow est répétable. Dix travaux se terminent sans fragmentation mémoire, pannes de pilote ou nettoyage manuel.
- Le système est utile. Le débit, le taux de sortie accepté et l'effort opérationnel surpassent l'alternative disponible.
Seul le quatrième jalon soutient une décision de production. Le déchargement CPU déplace la pression vers RAM système et transferts PCIe. La quantification peut réduire la mémoire en ralentissant l'inférence. Le pavage VAE économise la mémoire mais change le profil d'exécution. Un GPU de bureau perd aussi une partie de sa capacité à l'écran et à d'autres applications.
Les modèles hébergés fermés sont une catégorie distincte : une API ou un nœud ComfyUI peuvent exposer un nom de modèle familier tandis que toute l'inférence se produit à distance. Pour un exemple concret de cette distinction, voir l'explication de si Seedance peut s'exécuter localement.
Un benchmark local juste prend un après-midi
Ne commencez pas par une grande bibliothèque d'invites. Utilisez cinq invites qui exposent différents modes d'échec :
- une caméra verrouillée avec un sujet en mouvement;
- deux personnes interagissant;
- mouvement latéral rapide;
- image-to-video avec un visage ou un produit qui doit rester cohérent;
- une scène contenant du texte, des mains ou de la géométrie répétée.
Exécutez chaque modèle à la résolution, durée et paramètres VRAM que vous expédieriez réellement. Enregistrez :
| Métrique | Pourquoi c'est important |
|---|---|
| VRAM de pointe | Révèle si le workflow survit à côté des vrais services |
| RAM système de pointe | Montre le coût caché du déchargement CPU |
| Temps de démarrage à froid | Important pour les travailleurs sans serveur et les files d'attente redémarrées |
| Secondes par clip | Détermine la capacité, mais pas la qualité |
| Clips acceptés sur dix tentatives | Capture les échecs de mouvement, identité et invite |
| Watt-heures par clip accepté | Rend le coût d'exploitation local comparable |
| Interventions manuelles | Expose une pipeline fragile avant la production |
Gardez les graines et les invites fixes. Si un modèle a besoin d'une réécriture d'invite, enregistrez cette réécriture comme partie de sa pipeline plutôt que de lui donner silencieusement une meilleure invite lors de l'évaluation.
Avant de déployer un modèle vidéo open-weight
Le point de contrôle n'est qu'un composant. Un service local fiable a aussi besoin de :
- assez d'espace NVMe pour les poids, caches, entrées et cadres rendus;
- versions épinglées pour le pilote NVIDIA, CUDA, PyTorch et les bibliothèques d'attention;
- un travailleur qui libère la mémoire GPU après les travaux échoués;
- des limites de demande pour la durée, la résolution, le nombre de cadres et la taille du lot;
- la modération de sortie et une politique pour les visages téléchargés ou les actifs protégeables par le droit d'auteur;
- les avis de modèle et de licence reportés au produit selon les besoins;
- les invites de benchmark reproductibles pour les mises à jour.
Les défaillances de diffusion vidéo sont chères parce qu'elles arrivent tard. Un travailleur peut passer des minutes avant de retourner une erreur mémoire insuffisante ou un clip inutilisable. Validez les entrées et réservez la mémoire avant que le travail n'entre dans la file d'attente de génération.
FAQ
Quel est le meilleur modèle vidéo IA open-source pour 12GB VRAM?
CogVideoX1.5-5B est le choix documenté le plus clair. Sa fiche modèle officielle énumère un chemin Diffusers BF16 optimisé à partir de 10GB et un chemin INT8 à partir de 7GB. Les deux s'appuient sur des techniques d'économie de mémoire et peuvent être lents.
Quel est le meilleur modèle vidéo local pour une RTX 4090 ?
Wan 2.2 TI2V-5B est le meilleur point de départ dans cette comparaison. L'éditeur documente une configuration GPU unique 24GB, sortie 720p à 24fps, et supporte text-to-video et image-to-video.
HunyuanVideo-1.5 peut-il s'exécuter sur 16GB VRAM ?
Oui, selon le minimum publié de 14GB de Tencent avec déchargement de modèle. La configuration officielle cible Linux et un GPU CUDA NVIDIA. La RAM système disponible et la vitesse de stockage affectent toujours l'expérience.
Mochi 1 est-il pratique sur un GPU 24GB ?
Il peut tenir en utilisant l'exemple BF16 Diffusers officiel 22GB, qui note une légère baisse de qualité. Son implémentation référence a besoin de beaucoup plus de mémoire, et le modèle initial cible 480p, donc Wan 2.2 est généralement le choix 24GB plus pratique.
Puis-je utiliser ces modèles commercialement ?
La réponse dépend du modèle. Wan 2.2 TI2V-5B et Mochi 1 utilisent Apache-2.0. HunyuanVideo-1.5 utilise la licence communautaire de Tencent, et CogVideoX1.5 utilise la Licence CogVideoX. Examinez la licence actuelle, les règles d'utilisation acceptable, le territoire et les conditions de distribution pour le point de contrôle exact. Cet article est une comparaison technique, pas un conseil juridique.
Le minimum VRAM prédit-il la vitesse de génération ?
Non. Les configurations les plus petites économisent généralement de la mémoire via le déchargement CPU, le pavage ou la quantification, tous pouvant réduire la vitesse. Mesurez le temps mural et les sorties acceptées sur la machine cible.
References
- Wan-AI. Fiche modèle Wan2.2-TI2V-5B et dépôt officiel. Poids, licence Apache-2.0, sortie 720p, commande 24GB et conseils de performance. Rétrévé le 30 juillet 2026 de huggingface.co/Wan-AI/Wan2.2-TI2V-5B et github.com/Wan-Video/Wan2.2
- Tencent. Fiche modèle HunyuanVideo-1.5. Minimum officiel 14GB, besoins système, points de contrôle et chemins de sortie. Rétrévé le 30 juillet 2026 de huggingface.co/tencent/HunyuanVideo-1.5
- Z.ai. Fiche modèle CogVideoX1.5-5B. Figures VRAM Diffusers et SAT, compromis de quantification, durée et résolution. Rétrévé le 30 juillet 2026 de huggingface.co/zai-org/CogVideoX1.5-5B
- Genmo. Fiche modèle Mochi 1 preview. Exemples VRAM Diffusers et compromis précision inférieure. Rétrévé le 30 juillet 2026 de huggingface.co/genmo/mochi-1-preview
- Tencent. Accord Licence Communautaire Tencent Hunyuan. Territoire, distribution, termes commerciaux et d'usage. Rétrévé le 30 juillet 2026 de HunyuanVideo-1.5 LICENSE
- Z.ai. Licence CogVideoX. Licence liée depuis la fiche modèle officielle. Rétrévé le 30 juillet 2026 de CogVideoX1.5-5B LICENSE
- Genmo. Dépôt Mochi. Conseils matériel, licence Apache-2.0, architecture et limitations documentées. Rétrévé le 30 juillet 2026 de github.com/genmoai/mochi
Auteur

Catégories
Plus d'articles

Kimi K3 sur 4GB : démêler 2,8 trillions de paramètres
Kimi K3 tient-il réellement sur 4GB ? Comprenez les calculs de 1,4TB, le déchargement par couche, le support logiciel et la route API pratique.


Générer une vidéo d'un document PDF, PPT, Excel ou web
Créer une vidéo de 2 à 30 secondes à partir d'un PDF, présentation, tableur ou page web avec Wan 3.0. Limites d'entrée, calculs de coûts et exemples de requête.


Meilleures alternatives à CometAPI en 2026 : 5 options comparées
Vous cherchez une alternative à CometAPI en 2026 ? Comparez OpenRouter, WaveSpeed, Together AI, Replicate et reAPI sur les modèles, les prix, la vitesse et l’API.
