
Welche Wan-Modelle laufen lokal? Downloads und VRAM
Wan lokal ausführen: Wählen Sie offizielle 2.1- oder 2.2-Modelle, prüfen Sie VRAM je Laufzeit und richten Sie ComfyUI mit nötigen Dateien und Kostenmessung ein.
Um Wan-Modelle lokal auszuführen, beginne mit herunterladbaren Wan-2.1- oder Wan-2.2-Gewichten. Wan 2.2 TI2V-5B ist ein sinnvoller Einstieg für Text- und Bildeingaben; Wan 2.1 T2V-1.3B bietet einen kleineren Text-to-Video-Pfad. Die am 14. September 2026 geprüften offiziellen Verzeichnisse bestätigten keine herunterladbare Wan-2.7- oder Wan-3.0-Veröffentlichung.[1][2][3][4]
Der Speicherbedarf hängt vom Modell und von der Laufzeitumgebung ab. Wans 2.2-5B-Referenzbefehl nennt mindestens 24GB VRAM. ComfyUI schreibt, das Modell sollte mit nativem Offloading auf 8GB passen. Beides kann stimmen. Eine Suche nach wan 3.0 system requirements sollte deshalb zuerst zu einer tatsächlich ausführbaren Modellkonfiguration führen.[5][6]
TL;DR
- Wan 2.1 und 2.2 haben offizielle Repositories und herunterladbare Modellkarten. Wähle ein konkretes Modell statt eines allgemeinen „Wan-Downloads“.[2][1]
- Wan 2.1 T2V-1.3B ist für 480P vorgesehen; die Modellkarte nennt 8.19GB VRAM. Das garantiert keinen Betrieb auf jeder 8GB-Karte.[7]
- Wan 2.2 TI2V-5B unterstützt Text und Bild auf der dokumentierten 720P-Stufe. Referenzbefehl und Comfy-Offloading haben unterschiedliche Speicherhinweise.[5][6]
- Ein Wan-3.0-API-Workflow in ComfyUI führt gehostete Inferenz aus und installiert keine lokalen 3.0-Gewichte.[8][9]
- Lokale Kosten müssen mit Hardware, Laufzeit, Einstellungen und akzeptierten Ergebnissen gemessen werden. Dieser Leitfaden erfindet keine GPU-Laufzeiten.[1][6]
Welche Wan-Modelle laufen tatsächlich lokal?
Ein Repository und die zugehörigen Modelldateien belegen einen Download. Eine Modell-ID in einer gehosteten API tut das nicht. Wan 2.1 und 2.2 erfüllen diese Voraussetzung, enthalten aber mehrere Checkpoints für unterschiedliche Aufgaben.[2][1]
| Generation oder Modell | Geprüfter lokaler Weg | Offizielles Lizenzlabel | Sinnvoller Einstieg |
|---|---|---|---|
| Wan 2.1 T2V-1.3B | Repository und Wan-AI-Modellkarte | Apache-2.0 | Kleineres 480P-Textmodell |
| Wan 2.1 14B | Offizielle T2V-/I2V-Veröffentlichungen | Apache-2.0 | Vorhandene 2.1-Workflows |
| Wan 2.2 TI2V-5B | Repository und Wan-AI-Modellkarte | Apache-2.0 | Text und Bild in einem Modell |
| Wan 2.2 T2V/I2V-A14B | Offiziell verlinkte Downloads | Apache-2.0 | Größere aufgabenspezifische Workflows |
| Wan 2.7 | Keine offiziellen Gewichte in den geprüften Verzeichnissen gefunden | Hier keine lokale Gewichtelizenz bestätigt | Bei Bedarf dokumentierte gehostete API |
| Wan 3.0 | Keine offiziellen Gewichte in den geprüften Verzeichnissen gefunden | Hier keine lokale Gewichtelizenz bestätigt | Gehosteter Modell-/API-Workflow |
Die letzten Zeilen beschreiben den Prüfstand, nicht zukünftige Veröffentlichungen. Ein fremdes Repository mit vertrauter Versionsnummer ist kein Beleg für einen offiziellen Release.[3][4]
Die Lizenzlabels gelten für die genannten Pakete. Lies die Lizenz der tatsächlich geladenen Dateien, besonders bei Community-Ableitungen. Für die reine Verfügbarkeitsfrage gibt es den Wan-3.0-Open-Source-Status. Hier geht es anschließend um die Auswahl des Modells und der Hardware.
GPU-Speicher immer mit der Laufzeitumgebung vergleichen
Ein nützlicher VRAM-Wert gehört zu einer nachvollziehbaren Konfiguration. Die offiziellen Quellen enthalten diese unterschiedlichen Angaben:[7][5][1][6]
| Modell und Ausführung | Veröffentlichte Angabe | Keine Aussage darüber |
|---|---|---|
| Wan 2.1 T2V-1.3B, Modellbeschreibung | 8.19GB VRAM | Ob jede 8GB-Karte alle Einstellungen schafft |
| Wan 2.2 TI2V-5B, Referenzbefehl | Mindestens 24GB VRAM | Universelles Minimum aller Laufzeiten |
| Wan 2.2 TI2V-5B, Comfy-Offloading | Sollte auf 8GB passen | Garantierte Konfiguration oder Geschwindigkeit |
| Wan 2.2 T2V/I2V-A14B, offizielle Einzel-GPU-Befehle | Mindestens 80GB VRAM | Identische Anforderungen bei Repackaging oder Offloading |
Der 5B-Referenzbefehl verwendet --offload_model True, --convert_model_dtype und --t5_cpu. Comfy organisiert Laden und Offloading selbst und verwendet getrennte Modelldateien. Vergleiche daher den gesamten Ausführungspfad.[5][6]
Offloading verschiebt Teile der Arbeit, beseitigt aber weder Speicherbedarf noch Datentransfer. Prüfe für eine 8GB-Konfiguration auch freien Arbeitsspeicher, Speicherplatz und das Verhalten des konkreten Graphen. Der zitierte Comfy-Abschnitt liefert kein allgemeines RAM-Minimum; hier wird keines ergänzt.
Auch die Präzision muss pro Komponente betrachtet werden. Comfys 5B-Beispiel lädt eine FP16-Diffusionsdatei und einen FP8-Textencoder. Das gesamte System als „FP8-Modell“ zu bezeichnen wäre ungenau. Das größere T2V-Beispiel benötigt außerdem getrennte High-Noise- und Low-Noise-Dateien.[6]
Beim tatsächlichen Herausgeber herunterladen
Suche das Inferenz-Repository bei Wan-Video auf GitHub und die Modellkarte bei Wan-AI auf Hugging Face. Prüfe Aufgabenname, Version und Format, bevor du große Dateien herunterlädst.[3][4]
Konkrete Einstiegspunkte sind:
- Wan 2.1 T2V-1.3B für das kleinere Textmodell.[7]
- Wan 2.2 TI2V-5B für Text und Bild.[5]
- Die offizielle Comfy-Anleitung für ihre neu verpackten Dateien und den nativen Graphen.[6]
Auf Hugging Face veröffentlichen viele Organisationen. Ein Treffer für huggingface ist nicht automatisch eine Wan-AI-Veröffentlichung. Community-GGUF-Dateien können nützlich sein, benötigen aber den passenden Loader, Quantisierungsgrad und Ausgangscheckpoint. Eine andere Dateiendung schafft keine neue Modellgeneration.
Bewahre Modellkarten-URL, Dateinamen und Workflow-Version auf. Damit lassen sich Ladefehler und Speichermeldungen besser untersuchen. Mischen zwei Anleitungen unterschiedliche VAEs oder Textencoder, vergleiche erst ihre Voraussetzungen.
Den nativen Wan-2.2-5B-Workflow aufbauen
Nutze Comfys 5B-Anleitung als zusammengehörige Konfiguration. Sie verlangt drei Dateien an unterschiedlichen Orten:[6]
| Komponente | Datei | Ziel unter ComfyUI |
|---|---|---|
| Diffusionsmodell | wan2.2_ti2v_5B_fp16.safetensors | models/diffusion_models/ |
| Textencoder | umt5_xxl_fp8_e4m3fn_scaled.safetensors | models/text_encoders/ |
| VAE | wan2.2_vae.safetensors | models/vae/ |
Folge den Downloadlinks der Anleitung. Eine Datei eines anderen Modells umzubenennen macht sie nicht kompatibel, auch wenn sie danach im Auswahlfeld erscheint.
- Aktualisiere ComfyUI und suche die Wan2.2-5B-Vorlage. Bei Problemen prüfe Version und Importfehler beim Start.[6]
- Lade die drei verlinkten Dateien in die vorgesehenen Ordner.[6]
- Kontrolliere die Auswahl im Diffusions-, CLIP/Textencoder- und VAE-Loader.[6]
- Beginne mit den Vorlageneinstellungen und einem einfachen Prompt. Für Image-to-Video aktiviere den optionalen Bild-Loader.[6]
- Erzeuge einen kleinen Versuch, prüfe die Datei und notiere Spitzenverbrauch und Dauer, bevor du Abmessungen oder Framezahl erhöhst.
Gehe bei Speichermangel zur Basiskonfiguration zurück und ändere jeweils nur eine Einstellung. Ein erfolgreicher Download beweist nicht, dass die größtmögliche Ausgabe passt. Unterscheide außerdem einen Fehler beim Laden vom Fehler beim späteren Decodieren.
Die eigenständige 5B-Referenzimplementierung verwendet für ihre 720P-Stufe 1280*704 oder 704*1280. Daraus folgt keine pauschale Ausgabe von 1280×720. Halte dich an die Abmessungsregeln des gewählten Laufzeitwegs.[5]
Lokale Kosten gegen einen passenden API-Auftrag messen
Einen universellen lokalen Preis pro Video gibt es nicht. Eine vorhandene GPU, eine gemietete Maschine und eine eigens gekaufte Workstation verursachen unterschiedliche Kosten. Auch Laden, Vorbereitung, verworfene Versuche und Export brauchen Zeit.
Protokolliere Modell, Laufzeitversion, GPU, Präzision, Offloading, Abmessungen, Framezahl und Prompt. Trenne den ersten Ladevorgang von wiederholter Generierung. Miss Dauer, VRAM-Spitze, Arbeitsspeicher, Strom- oder Mietkosten und die Zahl akzeptierter Ergebnisse. Vergleiche Kosten pro brauchbarem Clip.
Als gehostetes Preisbeispiel zeigte Wan 3.0 bei reAPI am 14. September 2026 $0.068/s für 720P. Zehn Sekunden ergeben mit dem angezeigten Tarif $0.680 vor Referenzvideo und Credit-Rundung. Das ist ein Budgetbeispiel für ein anderes Modell, kein Gleichheitsbeleg für Qualität oder Laufzeit lokaler Wan-2.2-Ergebnisse.[10][11]
Eine API passt, wenn eine benötigte gehostete Fähigkeit im lokalen Aufbau fehlt oder Hardwarepflege den Aufwand nicht rechtfertigt. Wan 3.0 dokumentiert bis zu dreißig Sekunden mit nativem Ton; Referenzvideo und Ausgabe teilen sich weiterhin die Dreißig-Sekunden-Grenze.[11]
Lokal kann sinnvoll sein, wenn Material auf dem Gerät bleiben muss, reproduzierbare Experimente gefragt sind oder ein bestimmter Checkpoint wiederholt genutzt wird. Wan 2.2 enthält zudem spezialisierte Sprach- und Animationsmodelle. Audiogesteuerte oder längere Aufgaben sind daher nicht grundsätzlich ausgeschlossen. Auch Stapelverarbeitung ist lokal möglich, wenn Hardware und akzeptable Wartezeit dazu passen.[1]
Häufige Fragen
wan 3.0 github
Wan-Video stellt 2.1- und 2.2-Repositories bereit; die Prüfung bestätigte keine 3.0-Gewichte. Wähle für lokale Inferenz ein konkret herunterladbares Modell.[3]
wan 3.0 huggingface
Der offizielle Herausgeber heißt Wan-AI. Prüfe Modellkarte und Organisation; die geprüften Verzeichnisse bestätigten keine offiziellen Wan-3.0-Downloads.[4]
wan 3.0 open weights
In den am 14. September 2026 geprüften Quellen wurden keine offiziellen 3.0-Gewichte gefunden. Die lokalen Alternativen dieses Leitfadens sind Wan 2.1 und 2.2.[3][4][1]
wan 3.0 system requirements
Diese Quellen liefern keine bestätigte lokale Wan-3.0-Hardwarespezifikation. Verwende für lokale Arbeit die nach Laufzeit getrennten 2.1-/2.2-Angaben.[3][6]
wan 3.0 gguf
Die offiziellen Quellen weisen keinen Wan-3.0-GGUF-Release aus. Prüfe bei Community-Konvertierungen anderer Wan-Modelle den Ausgangscheckpoint und den passenden Loader.[3][4]
wan 3.0 local download
Lade ein benanntes Wan-2.1- oder Wan-2.2-Modell. Die Wan-3.0-API-Vorlage in ComfyUI greift auf gehostete Generierung zu und installiert keinen lokalen Checkpoint.[2][1][8]
Erst das Modell, dann die Hardware wählen
Um Wan-Modelle lokal auszuführen, wähle zuerst eine echte Modellkarte und anschließend eine vollständige Laufzeitkonfiguration. Beginne für Text und Bild mit Wan 2.2 5B oder prüfe Wan 2.1 1.3B für kleinere Textaufgaben. Für gehostete Nutzung helfen der Wan-3.0-ComfyUI-Workflow, der Vergleich lokaler Videomodelle sowie Wan-2.7-API-Leitfaden und Modellseite. Verfügbarkeit, Speicherbedarf und Kosten bleiben getrennte Entscheidungen.
Quellen
- Wan-Video. Wan-Video/Wan2.2: Wan: Open and Advanced Large-Scale Video Generative Models. Abgerufen am 14. September 2026: github.com/Wan-Video/Wan2.2
- Wan-Video. Wan-Video/Wan2.1: Wan: Open and Advanced Large-Scale Video Generative Models. Abgerufen am 14. September 2026: github.com/Wan-Video/Wan2.1
- Wan-Video. Wan. Abgerufen am 14. September 2026: github.com/Wan-Video
- Wan-AI. Wan-AI (Wan-AI). Abgerufen am 14. September 2026: huggingface.co/Wan-AI/models
- Wan-AI. Wan-AI/Wan2.2-TI2V-5B · Hugging Face. Abgerufen am 14. September 2026: huggingface.co/Wan-AI/Wan2.2-TI2V-5B
- Comfy. Wan2.2 Video Generation ComfyUI Official Native Workflow Example - ComfyUI. Abgerufen am 14. September 2026: docs.comfy.org/tutorials/video/wan/wan2_2
- Wan-AI. Wan-AI/Wan2.1-T2V-1.3B · Hugging Face. Abgerufen am 14. September 2026: huggingface.co/Wan-AI/Wan2.1-T2V-1.3B
- Comfy. Wan 3.0 in ComfyUI: Native 30-Second Video with Omni-Reference Control. Abgerufen am 14. September 2026: blog.comfy.org/p/wan-30-in-comfyui-native-30-second
- Comfy. FAQs about Partner Nodes - ComfyUI. Abgerufen am 14. September 2026: docs.comfy.org/tutorials/partner-nodes/faq
- reAPI. Wan 3.0 — 30-Second Omni-Modal Video Generation. Abgerufen am 14. September 2026: reapi.ai/models/wan-3-0
- reAPI. Wan 3.0 | reAPI. Abgerufen am 14. September 2026: reapi.ai/docs/wan-3-0
Autor

Kategorien
Weitere Beiträge

KI-Videogenerator mit echten Personen: Was wirklich klappt
Echte Personen in KI-Videos nutzen: zulässige Referenzen, native Dialogoptionen, dokumentierte Eingabegrenzen sowie Prüfung, Ablehnung und Kosten.


CLAUDE.md: die einfache Datei für bessere Coding-Agenten
Erfahre, was CLAUDE.md macht, warum vier simple Regeln viral gingen, was in die Datei gehört und wie du ein robustes Projekt-Template aufbaust.


Kritische Schleife für AI-Video-Agenten: zuverlässige Video-QA
Kritische Schleife für AI-Video-Agenten mit Akzeptanzregeln, Reparaturbereichchen, Wiederholungsbudgets und menschlicher Überprüfung vor dem Schnitt.
