
¿Qué modelos Wan funcionan en local? Descargas y GPU
Elige modelos Wan locales con descargas oficiales de 2.1 y 2.2, requisitos de VRAM según el entorno, archivos de ComfyUI y un método para medir el coste real.
Para ejecutar Wan localmente, empieza por pesos descargables de Wan 2.1 o Wan 2.2. Wan 2.2 TI2V-5B permite trabajar con texto e imagen; Wan 2.1 T2V-1.3B ofrece una ruta de texto a vídeo más pequeña. Los índices oficiales revisados el 14 de septiembre de 2026 no confirmaban una publicación descargable de Wan 2.7 o Wan 3.0.[1][2][3][4]
La memoria depende tanto del modelo como del entorno. El comando de referencia Wan 2.2 5B exige al menos 24GB de VRAM; ComfyUI indica que el 5B debería caber en 8GB con descarga nativa de memoria. Son configuraciones distintas. Una búsqueda wan 3.0 system requirements debe llevar primero a un modelo que realmente puedas ejecutar.[5][6]
TL;DR
- Wan 2.1 y 2.2 tienen repositorios y fichas oficiales descargables. Elige un modelo concreto.[2][1]
- Wan 2.1 T2V-1.3B apunta a 480P y publica 8.19GB de VRAM; no garantiza todos los ajustes en cualquier tarjeta 8GB.[7]
- Wan 2.2 TI2V-5B admite texto e imagen en su nivel 720P documentado. La implementación de referencia y Comfy tienen condiciones de memoria diferentes.[5][6]
- Una plantilla API Wan 3.0 en ComfyUI utiliza inferencia alojada y no instala un checkpoint local.[8][9]
- Calcula costes con hardware, entorno, ajustes y resultados aceptados reales. Este artículo no inventa tiempos de GPU.[1][6]
Qué modelos Wan pueden ejecutarse de verdad en local
Un repositorio y sus archivos prueban la disponibilidad de pesos; un ID de API alojada no. Wan 2.1 y 2.2 cumplen ese criterio, pero contienen variantes para tareas diferentes. Decide la tarea antes de descargar.[2][1]
| Generación o modelo | Ruta local comprobada | Licencia oficial indicada | Punto de partida |
|---|---|---|---|
| Wan 2.1 T2V-1.3B | Repositorio y ficha Wan-AI | Apache-2.0 | Texto 480P con modelo menor |
| Wan 2.1 14B | Publicaciones T2V/I2V oficiales | Apache-2.0 | Flujos 2.1 existentes |
| Wan 2.2 TI2V-5B | Repositorio y ficha Wan-AI | Apache-2.0 | Texto e imagen en un modelo |
| Wan 2.2 T2V/I2V-A14B | Descargas enlazadas oficialmente | Apache-2.0 | Modelos mayores por tarea |
| Wan 2.7 | Sin pesos oficiales encontrados en los índices revisados | Sin licencia local establecida aquí | API alojada documentada |
| Wan 3.0 | Sin pesos oficiales encontrados en los índices revisados | Sin licencia local establecida aquí | Modelo o API alojados |
Las últimas filas describen la evidencia de esa fecha, no futuras publicaciones. Un repositorio de otro autor con una versión familiar no demuestra un lanzamiento oficial.[3][4]
Las licencias corresponden a los paquetes indicados. Revisa la de los archivos que descargues, especialmente conversiones comunitarias. Para disponibilidad solamente, consulta si Wan 3.0 es open source. Aquí la decisión continúa con modelo y hardware.
Vincula cada cifra de VRAM a un entorno concreto
Las fuentes oficiales proporcionan estas indicaciones para configuraciones diferentes.[7][5][1][6]
| Modelo y ejecución | Memoria publicada | Lo que no demuestra |
|---|---|---|
| Wan 2.1 T2V-1.3B, descripción oficial | 8.19GB de VRAM | Todos los ajustes en toda tarjeta 8GB |
| Wan 2.2 TI2V-5B, comando de referencia | Al menos 24GB | Mínimo universal |
| Wan 2.2 TI2V-5B, descarga nativa Comfy | Debería caber en 8GB | Éxito garantizado o tiempo de ejecución |
| Wan 2.2 T2V/I2V-A14B, comandos oficiales de una GPU | Al menos 80GB | Igual exigencia con otros empaquetados o descarga |
El comando 5B usa --offload_model True, --convert_model_dtype y --t5_cpu. Comfy organiza la carga y descarga de otra manera y usa archivos separados. Compara la ruta completa, no solo la etiqueta del checkpoint.[5][6]
Descargar componentes de la GPU desplaza parte del trabajo; no elimina memoria ni transferencias. Antes de elegir 8GB, comprueba RAM libre, almacenamiento y comportamiento del grafo. El apartado Comfy consultado no publica un mínimo universal de RAM del sistema; no se añade uno supuesto.
La precisión también depende del componente. El ejemplo 5B de Comfy emplea difusión FP16 y codificador de texto FP8. Llamarlo simplemente «modelo FP8» pierde esa distinción. El T2V mayor requiere además archivos separados para ruido alto y bajo.[6]
Descarga del editor correcto y conserva la identidad
Busca el código en Wan-Video GitHub y la ficha en Wan-AI Hugging Face. Sigue los enlaces oficiales y comprueba tarea, versión y formato antes de bajar archivos grandes.[3][4]
Para empezar:
- Wan 2.1 T2V-1.3B ofrece la ruta de texto menor.[7]
- Wan 2.2 TI2V-5B combina texto e imagen.[5]
- El tutorial oficial Comfy proporciona sus archivos reorganizados y grafo nativo.[6]
Hugging Face alberga muchos autores. Un resultado huggingface no es automáticamente una publicación Wan-AI. Un GGUF comunitario puede ser útil, pero debe coincidir con su checkpoint original, nivel de cuantización y cargador. Cambiar la extensión no crea una nueva generación Wan.
Guarda URL de la ficha, nombres de archivos y versión del flujo. Facilita investigar problemas de memoria o carga. Si dos instrucciones usan VAE o codificadores diferentes, verifica sus requisitos antes de mezclar archivos.
Monta el flujo nativo Wan 2.2 5B
Sigue el tutorial Comfy como una receta completa. Los tres archivos necesarios se distribuyen así:[6]
| Componente | Archivo | Carpeta bajo ComfyUI |
|---|---|---|
| Difusión | wan2.2_ti2v_5B_fp16.safetensors | models/diffusion_models/ |
| Codificador de texto | umt5_xxl_fp8_e4m3fn_scaled.safetensors | models/text_encoders/ |
| VAE | wan2.2_vae.safetensors | models/vae/ |
No renombres archivos de otra familia para que aparezcan en un selector. El nombre corresponde a dependencias que deben ser compatibles.
- Actualiza ComfyUI y busca Wan2.2 5B. Si falta, revisa versión e importaciones al arrancar.[6]
- Descarga los tres archivos enlazados y colócalos en las carpetas indicadas.[6]
- Verifica los cargadores de difusión, CLIP/texto y VAE.[6]
- Empieza con los ajustes de la plantilla y un prompt sencillo. Para imagen a vídeo, activa el cargador opcional descrito.[6]
- Genera una prueba pequeña, inspecciona la salida y registra memoria máxima y duración antes de aumentar tamaño o fotogramas.
Si falta memoria, vuelve a la base y cambia un ajuste cada vez. Descargar correctamente no demuestra que la mayor salida posible vaya a caber. Distingue un error al cargar del que aparece al decodificar.
La implementación 5B independiente documenta 1280*704 o 704*1280 para su categoría 720P. No significa una salida universal de 1280×720. Respeta las dimensiones del entorno elegido.[5]
Mide el coste local frente a una tarea API comparable
No existe un precio local universal por vídeo. Una GPU que ya tienes, una máquina alquilada y un ordenador comprado para generar tienen costes distintos. Cargar, preparar, descartar intentos y exportar también consume tiempo.
Registra modelo, versión, GPU, precisión, descarga de memoria, dimensiones, fotogramas y prompt. Separa la carga inicial de las siguientes generaciones. Mide tiempo total, máximos de VRAM y RAM, energía o alquiler, y aceptación de la salida. Compara coste por clip utilizable.
Como ejemplo alojado, Wan 3.0 en reAPI mostraba $0.068/s para 720P el 14 de septiembre de 2026. Diez segundos estiman $0.680 antes de referencias y redondeo. Es un ejemplo de otro modelo: no implica igualdad de calidad o tiempo con Wan 2.2 local.[10][11]
La API encaja si necesitas una capacidad alojada que tu configuración no ofrece o si mantener hardware no compensa. Wan 3.0 documenta hasta treinta segundos y audio nativo; referencia de vídeo más salida siguen limitadas a treinta segundos.[11]
La ejecución local sigue siendo útil para conservar material en el dispositivo, reproducir experimentos o reutilizar un checkpoint. Wan 2.2 incluye modelos especializados de voz y animación, así que no toda tarea con audio o mayor duración queda excluida. Los lotes también pueden ser locales si hardware y espera resultan aceptables.[1]
Preguntas frecuentes
wan 3.0 github
Wan-Video ofrece repositorios 2.1 y 2.2; la revisión no confirmó pesos 3.0. Escoge un modelo descargable específico.[3]
wan 3.0 huggingface
La organización oficial es Wan-AI. Comprueba ficha y autor; los índices revisados no confirmaron descargas oficiales Wan 3.0.[4]
wan 3.0 open weights
No se encontraron pesos 3.0 oficiales en las fuentes revisadas el 14 de septiembre de 2026. Las alternativas locales aquí son Wan 2.1 y 2.2.[3][4][1]
wan 3.0 system requirements
Esas fuentes no dan una especificación local verificada de Wan 3.0. Usa la tabla 2.1/2.2 separada por entorno.[3][6]
wan 3.0 gguf
Las fuentes oficiales comprobadas no identifican un GGUF Wan 3.0. En conversiones de otros modelos, verifica base y cargador compatible.[3][4]
wan 3.0 local download
Descarga un modelo Wan 2.1 o 2.2 concreto. La plantilla API Wan 3.0 ComfyUI usa generación alojada y no instala un checkpoint.[2][1][8]
Escoge los pesos antes que el hardware
Para ejecutar Wan localmente, elige primero una ficha real y después una receta completa. Prueba Wan 2.2 5B para texto e imagen o Wan 2.1 1.3B para una ruta de texto menor. Para servicios alojados, sigue el flujo Wan 3.0 ComfyUI, el comparativo local, la guía API Wan 2.7 y su página. Disponibilidad, memoria y coste deben evaluarse por separado.
Fuentes
- Wan-Video. Wan-Video/Wan2.2: Wan: Open and Advanced Large-Scale Video Generative Models. Consultado el 14 de septiembre de 2026: github.com/Wan-Video/Wan2.2
- Wan-Video. Wan-Video/Wan2.1: Wan: Open and Advanced Large-Scale Video Generative Models. Consultado el 14 de septiembre de 2026: github.com/Wan-Video/Wan2.1
- Wan-Video. Wan. Consultado el 14 de septiembre de 2026: github.com/Wan-Video
- Wan-AI. Wan-AI (Wan-AI). Consultado el 14 de septiembre de 2026: huggingface.co/Wan-AI/models
- Wan-AI. Wan-AI/Wan2.2-TI2V-5B · Hugging Face. Consultado el 14 de septiembre de 2026: huggingface.co/Wan-AI/Wan2.2-TI2V-5B
- Comfy. Wan2.2 Video Generation ComfyUI Official Native Workflow Example - ComfyUI. Consultado el 14 de septiembre de 2026: docs.comfy.org/tutorials/video/wan/wan2_2
- Wan-AI. Wan-AI/Wan2.1-T2V-1.3B · Hugging Face. Consultado el 14 de septiembre de 2026: huggingface.co/Wan-AI/Wan2.1-T2V-1.3B
- Comfy. Wan 3.0 in ComfyUI: Native 30-Second Video with Omni-Reference Control. Consultado el 14 de septiembre de 2026: blog.comfy.org/p/wan-30-in-comfyui-native-30-second
- Comfy. FAQs about Partner Nodes - ComfyUI. Consultado el 14 de septiembre de 2026: docs.comfy.org/tutorials/partner-nodes/faq
- reAPI. Wan 3.0 — 30-Second Omni-Modal Video Generation. Consultado el 14 de septiembre de 2026: reapi.ai/models/wan-3-0
- reAPI. Wan 3.0 | reAPI. Consultado el 14 de septiembre de 2026: reapi.ai/docs/wan-3-0
Autor

Categorías
Más publicaciones

Guía de API de GLM-5.2: contexto de 1M, precios y codificación
Usa la API de GLM-5.2 con código compatible con OpenAI. Aprende su contexto de 1M, precios oficiales $1.40/$4.40, tarifas de reAPI y razonamiento


Estado de Seedance 2.5: acceso API, precios y límites
Seedance 2.5 ya está disponible: ID del modelo, precios a 480p y 720p, vídeos de 30 segundos, más referencias y sin ruta 4K.


Comparar DeepSeek Harness, OpenCode y Claude Code
Compara DeepSeek Harness, OpenCode y Claude Code según control de entorno, modelos, plugins, permisos, complejidad de instalación y costo de agentes.
