
Mejores modelos de vídeo open-source para GPU locales (2026)
Compara Wan 2.2, HunyuanVideo-1.5, CogVideoX1.5 y Mochi 1 por memoria de GPU local, salida, licencia, velocidad y límites de implementación.
Wan 2.2 TI2V-5B es el mejor modelo local de IA de vídeo de propósito general para una GPU de 24GB. HunyuanVideo-1.5 es el punto de partida más sólido en 14–16GB, mientras que CogVideoX1.5-5B es el experimento más realista por debajo. Mochi 1 sigue siendo interesante por su licencia Apache-2.0 y su pipeline modificable, pero su consumo de memoria y salida a 480p lo hacen una opción especializada más que la predeterminada.
Esa respuesta viene con una importante salvedad: un número VRAM mínimo publicado normalmente asume offloading de CPU, tiling, precisión reducida, o las tres cosas. Te dice que un flujo de trabajo puede caber. No te dice que sea lo bastante rápido para usar cada día.
Esta comparación utiliza las tarjetas de modelo y repositorios oficiales de los proyectos, comprobados el 30 de julio de 2026. Se usa el término "modelo de IA de vídeo de código abierto" porque así es como la gente busca estos modelos. "Open-weight" suele ser más preciso, sobre todo cuando el modelo usa una licencia personalizada comunitaria.
Mejores modelos locales de IA de vídeo de un vistazo
| Modelo | Ruta VRAM local publicada | Salida de vídeo | Licencia | Mejor para |
|---|---|---|---|---|
| Wan 2.2 TI2V-5B | Al menos 24GB con offloading de CPU[1] | 720p, 24fps; text-to-video e image-to-video | Apache-2.0 | Mejor equilibrio para una estación de trabajo de 24GB |
| HunyuanVideo-1.5 | 14GB mínimo con offloading de modelo[2] | 480p/720p T2V e I2V, más una ruta de superresolución | Tencent Hunyuan Community License | Mejor documentado para una GPU CUDA de 14–16GB |
| CogVideoX1.5-5B | Diffusers BF16 desde 10GB; INT8 desde 7GB[3] | 1360×768, 5 o 10 segundos | CogVideoX License | Pruebas de bajo VRAM cuando la generación lenta es aceptable |
| Mochi 1 preview | 22GB para el ejemplo Diffusers de precisión reducida; unos 60GB para el repositorio de referencia de GPU única[4] | La versión inicial apunta a text-to-video de 480p | Apache-2.0 | Investigación, trabajo con LoRA y licencia permisiva |
Estas filas no son equivalentes en benchmarks. La cifra más pequeña de CogVideoX usa una precisión y estrategia de memoria diferentes de la línea de comando de 24GB documentada de Wan. El ejemplo de Mochi de 22GB acepta explícitamente una pequeña caída de calidad. Trata los números como rutas de implementación, no como clasificación de calidad.
Qué puede ejecutar realísticamente tu GPU
8GB VRAM: una prueba técnica, no una estación de trabajo cómoda
CogVideoX1.5-5B es el único modelo en este grupo cuyo editor documenta una ruta Diffusers INT8 comenzando alrededor de 7GB. La misma tarjeta del modelo advierte que la cuantización y el offload secuencial de CPU reducen la velocidad. Su prueba de bajo nivel de memoria se realizó en hardware A100/H100, aunque los autores dicen que el enfoque debería funcionar generalmente en tarjetas NVIDIA Ampere o más nuevas[3].
Una tarjeta de 8GB puede demostrar que el modelo se ejecuta, pero deja poco margen para la pantalla, el decodificador, clips más largos u otro proceso. Espera sintonización de dependencias y una gran huella de RAM del sistema. Para producción regular, un trabajo alojado o una GPU más grande suele ser menos frustrante.
10–12GB VRAM: CogVideoX se vuelve usable para experimentos pacientes
La ruta Diffusers BF16 optimizada de CogVideoX1.5-5B comienza alrededor de 10GB. Esta es una mejor primera prueba que INT8 si la tarjeta puede mantenerlo. El tradeoff es el tiempo: los resultados de 50 pasos del editor para un clip de cinco segundos se miden en cientos de segundos incluso en una H100, y más en una A100[3]. Esas no son predicciones de GPU de consumidor, pero dejan clara la limitación.
CogVideoX también espera prompts en inglés. Los equipos que aceptan prompts en otros idiomas necesitan un paso de traducción o reescritura de prompts antes de la inferencia.
14–16GB VRAM: HunyuanVideo-1.5 es el paso práctico hacia arriba
Tencent publica un mínimo de 14GB con offloading de modelo habilitado. La ruta de fuente oficial apunta a Linux, Python 3.10 o más nuevo, y una GPU NVIDIA CUDA[2]. Ese es un punto de partida mucho más firme que una afirmación comunitaria no oficial de que un gran modelo de vídeo "funciona en 12GB."
HunyuanVideo-1.5 admite checkpoints de text-to-video e image-to-video en 480p y 720p. Su modelo separado de superresolución puede aumentar el vídeo a 1080p. Ese último paso es trabajo extra; no debería describirse como generación nativa de 1080p.
La restricción principal es legal más que técnica. La licencia Tencent Hunyuan Community License excluye el uso en la Unión Europea, el Reino Unido y Corea del Sur, incluye restricciones de uso, y requiere una licencia separada para ciertos productos por encima de su umbral de usuario establecido[5]. Lee la licencia actual antes de elegirla para un servicio comercial.
24GB VRAM: el nivel útil de vídeo local
Aquí es donde la generación local deja de parecer un truco de memoria. Wan 2.2 TI2V-5B tiene un comando oficial de GPU única para una tarjeta RTX 4090 de clase 24GB. Admite text-to-video e image-to-video en un pipeline de 5B y produce vídeo de clase 720p a 24fps[1].
La tarjeta del modelo Wan dice que el modelo de 5B puede generar un vídeo 720p de cinco segundos en menos de nueve minutos en una GPU de consumidor único sin optimización especial. Eso es útil para previsualizaciones y trabajo por lotes, pero no es edición interactiva. El diseño de cola sigue siendo importante.
Mochi 1 también puede caber en este nivel a través de su ejemplo Diffusers BF16 de 22GB. Genmo señala una ligera reducción de calidad para esa ruta. Con solo una pequeña cantidad de VRAM de sobra, otra aplicación o un recuento de fotogramas diferente puede sacar el trabajo de la memoria[4]. Elige Mochi aquí por su valor de investigación y licencia, no porque sea la implementación más segura en 24GB.
48–80GB VRAM: menos compromisos, no throughput automático
El ejemplo Diffusers de calidad superior de Mochi requiere 42GB, mientras que su repositorio de referencia describe unos 60GB para operación de GPU única y recomienda una H100[4]. Más memoria también puede reducir el offloading de los otros modelos o permitir más de un worker.
No elimina el costo computacional de la difusión. Antes de comprar una tarjeta más grande, haz benchmark del número de clips aceptados por hora, no del número de prompts enviados.
Wan 2.2: mejor en general para una GPU de 24GB
Wan 2.2 TI2V-5B tiene la combinación más clara de practicidad local y capacidad de salida en este grupo:
- pesos oficiales y código de inferencia;
- una ruta documentada de GPU única de 24GB;
- text-to-video e image-to-video en el mismo modelo;
- salida de clase 720p a 24fps;
- una licencia Apache-2.0.
Sé preciso sobre el nombre del modelo. Wan 2.2 también tiene checkpoints más grandes de A14B. Un tutorial que muestre TI2V-5B en una 4090 no prueba que las variantes más grandes quepan en el mismo hardware. El tamaño de descarga, los argumentos de inferencia y los requisitos de memoria difieren.
Wan es el benchmark sensato para un creador independiente, equipo de investigación o estudio con una 4090. Su debilidad es la latencia. Una sola máquina puede renderizar un lote útil durante la noche; es menos convincente como backend para un producto que promete resultados inmediatos.
HunyuanVideo-1.5: mejor en 14–16GB
HunyuanVideo-1.5 empaqueta un modelo de vídeo de 8.3B alrededor de un mínimo oficial sorprendentemente accesible. Es el candidato más fuerte aquí cuando la máquina no puede alcanzar 24GB pero aún necesita text-to-video e image-to-video.
Su familia de modelos es más complicada que una descarga. Tencent lista checkpoints separados de 480p y 720p, variantes destiladas y pesos de superresolución. Decide qué ruta el producto realmente necesita antes de provisionar almacenamiento o construir un contenedor.
Este modelo también es el ejemplo más claro de por qué "abierto" y "permisivo" son preguntas diferentes. Los pesos y el código de entrenamiento están disponibles, pero la licencia comunitaria tiene territorio, atribución, distribución y condiciones de uso aceptable. Los supuestos de Apache-2.0 no se trasladan.
CogVideoX1.5-5B: mejor experimento de bajo VRAM
CogVideoX1.5-5B gana el concurso de ajuste. La tarjeta del modelo oficial documenta configuraciones Diffusers BF16 de 10GB e INT8 de 7GB, comparadas con 76GB para su ruta BF16 SAT[3]. Ese margen muestra cuánto la ruta de software cambia la respuesta del hardware.
Elige CogVideoX cuando:
- la GPU disponible tiene 8–12GB;
- la generación puede ejecutarse en segundo plano;
- los prompts pueden normalizarse al inglés;
- el equipo se siente cómodo fijando las dependencias de CUDA, PyTorch, Diffusers y cuantización.
No lo elijas solamente porque "7GB" se vea eficiente. La ruta INT8 intercambia velocidad por memoria, y la salida de 5 o 10 segundos del modelo sigue siendo cara de muestrear repetidamente. Una instalación de 12GB que se completa confiablemente puede ser más útil que una configuración de 8GB operando en su límite.
CogVideoX usa su propia licencia. Revisa ese texto para la distribución planeada y el uso comercial en lugar de tratar "descargable en Hugging Face" como conclusión legal[6].
Mochi 1: mejor para trabajo de investigación permisivo
Mochi 1 es una vista previa de investigación de text-to-video de 10B lanzada bajo Apache-2.0. Genmo publica los pesos, código de inferencia, un pipeline programable y un entrenador LoRA. Eso lo hace una buena base para equipos que se preocupan por modificar la pila en lugar de simplemente producir el clip de resolución más alta.
Sus limitaciones están documentadas inusualmente bien. El checkpoint inicial apunta a 480p, está sintonizado hacia fotorrealismo, puede mostrar distorsión bajo movimiento extremo y funciona menos bien en estilos animados[7]. La implementación de referencia también quiere unos 60GB de VRAM en una GPU. Diffusers reduce eso a 22GB en BF16, pero con un tradeoff de calidad establecido.
Mochi tiene sentido en una estación de trabajo de investigación o servidor multi-GPU. Es más difícil de justificar para un creador comprando una sola tarjeta específicamente para salida de 720p acabada.
"Se ejecuta localmente" tiene cuatro significados diferentes
Las comparaciones de modelos a menudo colapsan cuatro hitos en uno:
- El proceso comienza. Los pesos se cargan con cuantización y offloading.
- Una muestra se completa. Un trabajo corto y de bajo lote evita un error de falta de memoria.
- El flujo de trabajo es repetible. Diez trabajos terminan sin fragmentación de memoria, caídas del driver o limpieza manual.
- El sistema es útil. La capacidad, la tasa de salida aceptada y el esfuerzo operativo superan la alternativa disponible.
Solo el cuarto hito respalda una decisión de producción. El offloading de CPU cambia la presión a RAM del sistema y transferencias PCIe. La cuantización puede reducir la memoria mientras hace la inferencia más lenta. El tiling VAE ahorra memoria pero cambia el perfil de ejecución. Una GPU de escritorio también pierde parte de su capacidad a la pantalla y otras aplicaciones.
Los modelos hospedados cerrados son una categoría separada: una API o nodo ComfyUI puede exponer un nombre de modelo familiar mientras toda la inferencia sucede remotamente. Para un ejemplo concreto de esa distinción, ve la explicación de si Seedance puede ejecutarse localmente.
Un benchmark local justo toma una tarde
No comiences con una gran biblioteca de prompts. Usa cinco prompts que expongan modos de falla diferentes:
- una cámara fija con un sujeto que se mueve;
- dos personas interactuando;
- movimiento lateral rápido;
- image-to-video con un rostro o producto que debe mantenerse consistente;
- una escena que contiene texto, manos o geometría repetida.
Ejecuta cada modelo en la resolución, duración y configuración de memoria que realmente enviarías. Registra:
| Métrica | Por qué importa |
|---|---|
| VRAM pico | Revela si el flujo de trabajo sobrevive junto con servicios reales |
| RAM del sistema pico | Muestra el costo oculto del offloading de CPU |
| Tiempo de arranque en frío | Importa para workers sin servidor y colas reiniciadas |
| Segundos por clip | Determina la capacidad, pero no la calidad |
| Clips aceptados por diez intentos | Captura movimiento, identidad y fallos de prompts |
| Vatios-hora por clip aceptado | Hace el costo operativo local comparable |
| Intervenciones manuales | Expone una pipeline frágil antes de producción |
Mantén las semillas y prompts fijos. Si un modelo necesita una reescritura de prompt, guarda esa reescritura como parte de su pipeline en lugar de darle silenciosamente un prompt mejor durante la evaluación.
Antes de implementar un modelo de vídeo open-weight
El checkpoint es solo un componente. Un servicio local de confianza también necesita:
- suficiente espacio NVMe para pesos, cachés, entradas y fotogramas renderizados;
- versiones fijadas para el driver NVIDIA, CUDA, PyTorch y librerías de atención;
- un worker que libere memoria GPU después de trabajos fallidos;
- límites de solicitud para duración, resolución, recuento de fotogramas y tamaño de lote;
- moderación de salida y política para rostros cargados o activos con derechos de autor;
- notificaciones de modelo y licencia llevadas al producto donde sea requerido;
- prompts de benchmark reproducibles para upgrades.
Los fallos de difusión de vídeo son caros porque llegan tarde. Un worker puede pasar minutos antes de devolver un error de falta de memoria o un clip inutilizable. Valida entradas y reserva memoria antes de que el trabajo entre en la cola de generación.
Preguntas frecuentes
¿Cuál es el mejor modelo de IA de vídeo de código abierto para 12GB VRAM?
CogVideoX1.5-5B es la opción documentada más clara. Su tarjeta de modelo oficial lista una ruta Diffusers BF16 optimizada desde 10GB y una ruta INT8 desde 7GB. Ambas se basan en técnicas de ahorro de memoria y pueden ser lentas.
¿Cuál es el mejor modelo de vídeo local para una RTX 4090?
Wan 2.2 TI2V-5B es el mejor punto de partida en esta comparación. El editor documenta una configuración de GPU única de 24GB, salida de clase 720p a 24fps y soporte tanto para text-to-video como para image-to-video.
¿Puede HunyuanVideo-1.5 ejecutarse en 16GB VRAM?
Sí, según el mínimo de 14GB publicado de Tencent con offloading de modelo. La configuración oficial apunta a Linux y una GPU NVIDIA CUDA. La RAM disponible del sistema y la velocidad de almacenamiento aún afectan la experiencia.
¿Es Mochi 1 práctico en una GPU de 24GB?
Puede caber usando el ejemplo oficial Diffusers de 22GB BF16, que señala una ligera caída de calidad. Su implementación de referencia necesita mucha más memoria, y el modelo inicial apunta a 480p, así que Wan 2.2 es generalmente la opción más práctica para 24GB.
¿Puedo usar estos modelos comercialmente?
La respuesta depende del modelo. Wan 2.2 TI2V-5B y Mochi 1 usan Apache-2.0. HunyuanVideo-1.5 usa la licencia comunitaria de Tencent, y CogVideoX1.5 usa la licencia CogVideoX. Revisa la licencia actual, reglas de uso aceptable, territorio y términos de distribución para el checkpoint exacto. Este artículo es una comparación técnica, no asesoramiento legal.
¿El VRAM mínimo predice la velocidad de generación?
No. Las configuraciones más pequeñas generalmente ahorran memoria a través de offloading de CPU, tiling o cuantización, todo lo cual puede reducir la velocidad. Mide el tiempo de reloj real y salidas aceptadas en la máquina de destino.
Referencias
- Wan-AI. Tarjeta de modelo y repositorio oficial de Wan2.2-TI2V-5B. Pesos, licencia Apache-2.0, salida de 720p, comando de 24GB y orientación de rendimiento. Recuperado el 30 de julio de 2026 de huggingface.co/Wan-AI/Wan2.2-TI2V-5B y github.com/Wan-Video/Wan2.2
- Tencent. Tarjeta de modelo de HunyuanVideo-1.5. Mínimo oficial de 14GB, requisitos del sistema, checkpoints y rutas de salida. Recuperado el 30 de julio de 2026 de huggingface.co/tencent/HunyuanVideo-1.5
- Z.ai. Tarjeta de modelo de CogVideoX1.5-5B. Figuras de memoria Diffusers y SAT, tradeoffs de cuantización, duración y resolución. Recuperado el 30 de julio de 2026 de huggingface.co/zai-org/CogVideoX1.5-5B
- Genmo. Tarjeta de modelo de Mochi 1 preview. Ejemplos de memoria Diffusers y tradeoff de precisión inferior. Recuperado el 30 de julio de 2026 de huggingface.co/genmo/mochi-1-preview
- Tencent. Acuerdo de licencia Tencent Hunyuan Community. Territorio, distribución, comercial y términos de uso. Recuperado el 30 de julio de 2026 de HunyuanVideo-1.5 LICENSE
- Z.ai. Licencia CogVideoX. Licencia vinculada de la tarjeta de modelo oficial. Recuperado el 30 de julio de 2026 de CogVideoX1.5-5B LICENSE
- Genmo. Repositorio Mochi. Orientación de hardware, licencia Apache-2.0, arquitectura y limitaciones documentadas. Recuperado el 30 de julio de 2026 de github.com/genmoai/mochi
Autor

Categorías
Más publicaciones

MiniMax H3 local versus API: VRAM, velocidad, licencia y coste
¿Qué dicen los documentos oficiales de MiniMax y ComfyUI sobre el hardware local para H3? Compara con los costes de la API alojada en 768P y 2K.


Filtros de API de imágenes: cómo funcionan los rechazos
Filtros en API de imágenes funcionan en capas. Una solicitud puede pasar en un servidor y fallar en otro, pero ciertos límites nunca cambian.


Atlas Cloud vs Higgsfield: plataforma API o estudio
Compara Atlas Cloud, Higgsfield y reAPI para Seedance: acceso API, flujos de trabajo, precios, variedad de modelos y cuál opción se ajusta a tu equipo.
