
Beste Open-Source-AI-Videomodelle für lokale GPUs (2026)
Vergleich von Wan 2.2, HunyuanVideo-1.5, CogVideoX1.5 und Mochi 1 nach GPU-Speicher, Output, Lizenz, Geschwindigkeit und Bereitstellungsgrenzen.
Wan 2.2 TI2V-5B ist das beste All-in-One-Modell für eine 24-GB-GPU. HunyuanVideo-1.5 ist der bessere Startpunkt bei 14–16 GB, während CogVideoX1.5-5B das realistischste Experiment darunter ist. Mochi 1 bleibt für seine Apache-2.0-Lizenz und hackbare Pipeline interessant, aber sein Speicherverbrauch und die 480p-Ausgabe machen es eher zur Spezialwahl als zur Standard-Lösung.
Diese Antwort kommt mit einer wichtigen Einschränkung: eine veröffentlichte minimale VRAM-Zahl setzt normalerweise CPU-Offloading, Tiling, niedrigere Präzision oder alle drei voraus. Sie sagt dir, dass ein Workflow passt. Sie sagt dir nicht, dass der Workflow schnell genug für die tägliche Nutzung ist.
Dieser Vergleich nutzt die offiziellen Modellkarten und Repositories der Projekte, geprüft am 30. Juli 2026. Der Begriff „Open-Source-AI-Videomodell" wird verwendet, weil das ist, wie Menschen diese Modelle suchen. „Open-weight" ist oft präziser, besonders wenn ein Modell eine maßgefertigte Gemeinschaftslizenz nutzt.
Beste lokale AI-Videomodelle auf einen Blick
| Modell | Veröffentlichter lokaler VRAM-Pfad | Videoausgabe | Lizenz | Beste Passung |
|---|---|---|---|---|
| Wan 2.2 TI2V-5B | Mindestens 24 GB mit CPU-Offloading[1] | 720p-Klasse, 24fps; Text-zu-Video und Bild-zu-Video | Apache-2.0 | Beste Balance für eine einzelne 24-GB-Workstation |
| HunyuanVideo-1.5 | 14 GB Minimum mit Modell-Offloading[2] | 480p/720p T2V und I2V, plus Super-Resolution-Pfad | Tencent Hunyuan Lizenz | Best dokumentiert für eine 14–16-GB-CUDA-GPU |
| CogVideoX1.5-5B | Diffusers BF16 ab 10 GB; INT8 ab 7 GB[3] | 1360×768, 5 oder 10 Sekunden | CogVideoX-Lizenz | Low-VRAM-Test, wenn langsame Generierung akzeptabel ist |
| Mochi 1 Vorschau | 22 GB für das niedrigere Präzisions-Diffusers-Beispiel; etwa 60 GB für das Referenz-Single-GPU-Repository[4] | Anfangsversion zielt auf 480p Text-zu-Video | Apache-2.0 | Forschung, LoRA-Arbeiten und permissive Lizenzierung |
Diese Zeilen sind nicht Benchmark-äquivalent. CogVideoX nutzt eine andere Präzision und Speicherstrategie als Wan's dokumentierte 24-GB-Befehl. Mochi's 22-GB-Beispiel akzeptiert ausdrücklich einen kleinen Qualitätsverlust. Behandle die Zahlen als Bereitstellungsrouten, nicht als Qualitätsranking.
Was deine GPU realistisch laufen kann
8 GB VRAM: ein technischer Test, keine komfortable Workstation
CogVideoX1.5-5B ist das einzige Modell dieser Gruppe, dessen Herausgeber einen INT8-Diffusers-Pfad ab etwa 7 GB dokumentieren. Die gleiche Modellkarte warnt, dass Quantisierung und sequenzielles CPU-Offloading die Geschwindigkeit reduzieren. Das Low-Memory-Testing wurde auf A100/H100-Hardware durchgeführt, obwohl die Autoren sagen, dass der Ansatz generell auf NVIDIA Ampere oder neueren Karten funktionieren sollte[3].
Eine 8-GB-Karte kann daher beweisen, dass das Modell läuft, lässt aber wenig Raum für die Anzeige, Decoder, längere Clips oder einen anderen Prozess. Erwarte Abhängigkeits-Tuning und einen großen System-RAM-Fußabdruck. Für reguläre Produktion ist ein gehosteter Job oder eine größere GPU normalerweise weniger frustrierend.
10–12 GB VRAM: CogVideoX wird für geduldige Experimente nutzbar
Der optimierte BF16-Diffusers-Pfad von CogVideoX1.5-5B beginnt bei etwa 10 GB. Dies ist ein besserer erster Test als INT8, wenn die Karte es halten kann. Der Tradeoff ist Zeit: die 50-Schritte-Ergebnisse des Herausgebers für einen Fünf-Sekunden-Clip werden selbst auf einem H100 in Hunderten von Sekunden gemessen, und länger auf einem A100[3]. Das sind keine Consumer-GPU-Prognosen, aber sie machen den Engpass klar.
CogVideoX erwartet auch englische Prompts. Teams, die Prompts in anderen Sprachen akzeptieren, brauchen einen Übersetzungs- oder Prompt-Umschreib-Schritt vor Inferenz.
14–16 GB VRAM: HunyuanVideo-1.5 ist der praktische Schritt nach oben
Tencent veröffentlicht ein 14-GB-Minimum mit aktiviertem Modell-Offloading. Der offizielle Quellenpfad zielt auf Linux, Python 3.10 oder neuer und eine NVIDIA CUDA GPU ab[2]. Das ist ein viel festerer Startpunkt als eine inoffizielle Behauptung, dass ein großes Videomodell „auf 12 GB läuft".
HunyuanVideo-1.5 unterstützt Text-zu-Video- und Bild-zu-Video-Checkpoints bei 480p und 720p. Das separate Super-Resolution-Modell kann Video auf 1080p hochskalieren. Dieser letzte Schritt ist zusätzliche Arbeit; er sollte nicht als natürliche 1080p-Generierung beschrieben werden.
Die Hauptbeschränkung ist eher rechtlich als technisch. Die Tencent Hunyuan Lizenz schließt die Nutzung in der Europäischen Union, dem Vereinigten Königreich und Südkorea aus, enthält Nutzungsbeschränkungen und verlangt eine separate Lizenz für bestimmte Produkte über ihrem angegebenen Schwellenwert[5]. Lies die aktuelle Lizenz, bevor du sie für einen kommerziellen Dienst wählst.
24 GB VRAM: die nutzbare lokale Video-Klasse
Hier fühlt sich lokale Generierung nicht mehr wie ein Memory-Stunt an. Wan 2.2 TI2V-5B hat einen offiziellen Single-GPU-Befehl für eine 24-GB-RTX-4090-ähnliche Karte. Es unterstützt Text-zu-Video und Bild-zu-Video in einer 5B-Pipeline und gibt 720p-Klasse-Video bei 24fps aus[1].
Wan's Modellkarte sagt, dass das 5B-Modell einen Fünf-Sekunden-720p-Video auf einer einzelnen Consumer-GPU ohne Spezialoptimierung in unter neun Minuten generieren kann. Das ist nutzbar für Vorschauen und Batch-Arbeiten, aber nicht für interaktive Bearbeitung. Queue-Design ist immer noch wichtig.
Mochi 1 kann auch diese Klasse durch sein 22-GB-BF16-Diffusers-Beispiel passen. Genmo bemerkt einen leichten Qualitätsverlust für diesen Pfad. Mit nur einem kleinen Betrag VRAM übrig kann eine andere Anwendung oder eine andere Frame-Zählung den Job aus dem Speicher drücken[4]. Wähle Mochi hier für seinen Forschungswert und seine Lizenz, nicht weil es die sicherste 24-GB-Bereitstellung ist.
48–80 GB VRAM: weniger Kompromisse, nicht automatisch Durchsatz
Mochis höher qualitatives Diffusers-Beispiel benötigt 42 GB, während sein Reference-Repository etwa 60 GB für Single-GPU-Betrieb beschreibt und eine H100 empfiehlt[4]. Mehr Speicher kann auch Offloading für die anderen Modelle reduzieren oder mehr als einen Worker unterstützen.
Es entfernt nicht die Rechenkosten von Diffusion. Vor dem Kauf einer größeren Karte, Benchmark die Anzahl der akzeptierten Clips pro Stunde, nicht die Zahl der eingereichten Prompts.
Wan 2.2: beste Gesamtlösung für eine 24-GB-GPU
Wan 2.2 TI2V-5B hat die sauberste Kombination aus lokaler Praktikabilität und Output-Fähigkeit in dieser Gruppe:
- Offizielle Gewichte und Inferenz-Code;
- ein dokumentierter Single-24-GB-GPU-Pfad;
- Text-zu-Video und Bild-zu-Video im gleichen Modell;
- 720p-Klasse-Ausgabe bei 24fps;
- eine Apache-2.0-Lizenz.
Sei präzise über den Modellnamen. Wan 2.2 hat auch größere A14B-Checkpoints. Ein Tutorial, das TI2V-5B auf einer 4090 zeigt, beweist nicht, dass die größeren Varianten die gleiche Hardware passen. Download-Größe, Inferenz-Argumente und Speicheranforderungen unterscheiden sich.
Wan ist das vernünftige erste Benchmark für einen unabhängigen Creator, Forschungsteam oder Studio mit einer 4090. Seine Schwäche ist Latenz. Ein Einzelcomputer kann einen nützlichen Batch über Nacht rendern; er ist weniger überzeugend als Backend für ein Produkt, das sofortige Ergebnisse verspricht.
HunyuanVideo-1.5: beste bei 14–16 GB
HunyuanVideo-1.5 packt ein 8.3B-Videomodell um ein überraschend zugängliches offizielles Minimum herum. Es ist der stärkste Kandidat hier, wenn die Maschine nicht 24 GB erreichen kann, aber immer noch beide Text-zu-Video und Bild-zu-Video braucht.
Seine Modellfamilie ist komplizierter als ein Download. Tencent listet separate 480p- und 720p-Checkpoints, destillierte Varianten und Super-Resolution-Gewichte auf. Entscheide, welcher Pfad das Produkt tatsächlich braucht, bevor du Speicher einrichtest oder einen Container baust.
Dieses Modell ist auch das klarste Beispiel, warum „offen" und „permissiv" verschiedene Fragen sind. Die Gewichte und der Trainingscode sind verfügbar, aber die Gemeinschaftslizenz hat Terrritorium, Zuschreibungs-, Vertriebs- und akzeptable Nutzungsbedingungen. Apache-2.0-Annahmen tragen nicht über.
CogVideoX1.5-5B: bestes Low-VRAM-Experiment
CogVideoX1.5-5B gewinnt den Anpassungswettbewerb. Die offizielle Tabelle dokumentiert 10-GB-BF16 und 7-GB-INT8-Diffusers-Konfigurationen gegenüber 76 GB für seinen BF16-SAT-Pfad[3]. Diese Spanne zeigt, wie sehr der Software-Pfad die Hardware-Antwort ändert.
Wähle CogVideoX, wenn:
- die verfügbare GPU 8–12 GB hat;
- Generierung im Hintergrund laufen kann;
- Prompts auf Englisch normalisiert werden können;
- das Team sich mit dem Anheften von CUDA, PyTorch, Diffusers und Quantisierungs-Abhängigkeiten wohlfühlt.
Wähle es nicht nur, weil „7 GB" effizient aussieht. Der INT8-Pfad tauscht Geschwindigkeit gegen Speicher, und das Modell's 5- oder 10-Sekunden-Ausgabe bleibt teuer, mehrmals zu samplen. Eine 12-GB-Installation, die zuverlässig fertigstellt, kann nützlicher sein als eine 8-GB-Konfiguration an ihrer Grenze.
CogVideoX nutzt eine eigene Lizenz. Überprüfe den Text für die geplante Verbreitung und kommerzielle Nutzung statt „downloadbar auf Hugging Face" als rechtliche Schlussfolgerung zu behandeln[6].
Mochi 1: beste für permissive Forschungsarbeit
Mochi 1 ist eine 10B-Text-zu-Video-Forschungs-Vorschau unter Apache-2.0. Genmo veröffentlicht die Gewichte, Inferenz-Code, eine programmierbare Pipeline und einen LoRA-Trainer. Das macht es eine gute Basis für Teams, die sich um Stack-Modifizierung kümmern statt einfach den höchsten Auflösungs-Clip zu produzieren.
Seine Einschränkungen sind ungewöhnlich gut dokumentiert. Der Anfangs-Checkpoint zielt auf 480p, ist auf Photorealismus abgestellt, kann unter extremer Bewegung Verformung zeigen und funktioniert weniger gut bei animierten Stilen[7]. Die Reference-Implementierung braucht auch etwa 60 GB VRAM auf einer GPU. Diffusers senkt das auf 22 GB in BF16, aber mit einem angegebenen Qualitätstradeoff.
Mochi ergibt Sinn auf einer Forschungs-Workstation oder einem Multi-GPU-Server. Es ist schwieriger für einen Creator zu rechtfertigen, der eine einzelne Karte speziell für 720p-Ausgabe in Fertigformat kauft.
„Läuft lokal" hat vier verschiedene Bedeutungen
Modellvergleiche kollabieren oft vier Meilensteine in einen:
- Der Prozess startet. Die Gewichte laden mit Quantisierung und Offloading.
- Ein Sample fertigstellt. Ein kurzer, kleiner Batch-Job vermeidet einen Out-of-Memory-Fehler.
- Der Workflow ist wiederholbar. Zehn Jobs fertigstellen ohne Speicherfragmentierung, Driver-Abstürze oder manuelle Bereinigung.
- Das System ist nutzbar. Durchsatz, akzeptierte Ausgaberate und Betriebsaufwand schlagen die verfügbare Alternative.
Nur der vierte Meilenstein unterstützt eine Produktionsentscheidung. CPU-Offloading verschiebt Druck ins System-RAM und PCIe-Transfers. Quantisierung kann Speicher reduzieren während Inferenz langsamer wird. VAE-Tiling spart Speicher aber ändert das Ausführungsprofil. Eine Desktop-GPU verliert auch einen Teil ihrer Kapazität an die Anzeige und andere Anwendungen.
Geschlossene gehostete Modelle sind eine separate Kategorie: eine API oder ComfyUI-Node kann einen bekannten Modellnamen exponieren während alle Inferenz remote passiert. Für ein konkretes Beispiel dieser Unterscheidung, siehe die Erklärung von ob Seedance lokal läuft.
Ein fairer lokaler Benchmark braucht einen Nachmittag
Beginne nicht mit einer großen Prompt-Bibliothek. Nutze fünf Prompts, die verschiedene Fehlermodi exponieren:
- eine festgestellte Kamera mit einem bewegten Subjekt;
- zwei Menschen, die interagieren;
- schnelle Seitwärtsbewegung;
- Bild-zu-Video mit einem Gesicht oder Produkt, der/das konsistent bleiben muss;
- eine Szene mit Text, Händen oder wiederholter Geometrie.
Führe jedes Modell bei der Auflösung, Dauer und Speichereinstellung aus, die du tatsächlich versenden würdest. Zeichne auf:
| Metrik | Warum es wichtig ist |
|---|---|
| Peak VRAM | Zeigt, ob der Workflow neben echten Services überlebt |
| Peak System RAM | Zeigt die versteckte Kosten des CPU-Offloading |
| Cold-Start-Zeit | Wichtig für Serverless-Worker und neu gestartete Queues |
| Sekunden pro Clip | Bestimmt Kapazität, aber nicht Qualität |
| Akzeptierte Clips pro zehn Versuche | Erfasst Bewegung, Identität und Prompt-Fehlschlag |
| Wattstunden pro akzeptiertem Clip | Macht lokale Betriebskosten vergleichbar |
| Manuelle Interventionen | Exponiert eine spröde Pipeline vor Produktion |
Halte Seeds und Prompts fest. Wenn ein Modell ein Prompt-Umschreiben braucht, speichere dieses Umschreiben als Teil seiner Pipeline statt still einem besseren Prompt während der Evaluierung zu geben.
Vor der Bereitstellung eines Open-Weight-Videomodells
Der Checkpoint ist nur eine Komponente. Ein zuverlässiger lokaler Service braucht auch:
- genügend NVMe-Platz für Gewichte, Caches, Inputs und gerenderte Frames;
- angeheftete Versionen für den NVIDIA-Driver, CUDA, PyTorch und Aufmerksamkeits-Bibliotheken;
- einen Worker, der GPU-Speicher nach fehlgeschlagenen Jobs freigeben kann;
- Anfragegrenzen für Dauer, Auflösung, Frame-Zählung und Batch-Größe;
- Ausgabe-Moderation und eine Richtlinie für hochgeladene Gesichter oder urheberrechtlich geschützte Assets;
- Modell- und Lizenzhinweise in das Produkt getragen, wo erforderlich;
- reproduzierbare Benchmark-Prompts für Upgrades.
Video-Diffusions-Fehlschläge sind teuer, weil sie spät ankommen. Ein Worker kann Minuten verbringen, bevor er einen Out-of-Memory-Fehler oder einen unbrauchbaren Clip zurückgibt. Validiere Inputs und reserviere Speicher, bevor der Job die Generierungs-Queue eintritt.
FAQ
Was ist das beste Open-Source-AI-Videomodell für 12 GB VRAM?
CogVideoX1.5-5B ist die klarste dokumentierte Wahl. Die offizielle Modellkarte listet einen optimierten BF16-Diffusers-Pfad ab 10 GB und einen INT8-Pfad ab 7 GB auf. Beide nutzen Memory-Sparen-Techniken und können langsam sein.
Was ist das beste lokale Videomodell für eine RTX 4090?
Wan 2.2 TI2V-5B ist der beste Startpunkt in diesem Vergleich. Der Herausgeber dokumentiert ein 24-GB-Single-GPU-Setup, 720p-Klasse-Ausgabe bei 24fps und Unterstützung für Text-zu-Video und Bild-zu-Video.
Kann HunyuanVideo-1.5 auf 16 GB VRAM laufen?
Ja, nach Tencent's veröffentlichtem 14-GB-Minimum mit Modell-Offloading. Das offizielle Setup zielt auf Linux und eine NVIDIA CUDA GPU ab. Verfügbares System-RAM und Speichergeschwindigkeit beeinflussen die Erfahrung immer noch.
Ist Mochi 1 praktisch auf einer 24-GB-GPU?
Es kann mit dem offiziellen 22-GB-BF16-Diffusers-Beispiel passen, das einen leichten Qualitätsverlust bemerkt. Seine Reference-Implementierung braucht viel mehr Speicher, und das Anfangsmodell zielt auf 480p, daher ist Wan 2.2 üblicherweise die praktischere 24-GB-Wahl.
Kann ich diese Modelle kommerziell nutzen?
Die Antwort hängt vom Modell ab. Wan 2.2 TI2V-5B und Mochi 1 nutzen Apache-2.0. HunyuanVideo-1.5 nutzt Tencent's Gemeinschaftslizenz, und CogVideoX1.5 nutzt die CogVideoX-Lizenz. Überprüfe die aktuelle Lizenz, akzeptable Nutzungsregeln, Terrritorium und Vertriebsbedingungen für den exakten Checkpoint. Dieser Artikel ist ein technischer Vergleich, keine rechtliche Beratung.
Sagt das minimale VRAM die Generierungsgeschwindigkeit voraus?
Nein. Die kleinsten Konfigurationen sparen üblicherweise Speicher durch CPU-Offloading, Tiling oder Quantisierung, von denen alle die Geschwindigkeit reduzieren können. Miss die Wanduhr-Zeit und akzeptierte Outputs auf der Ziel-Maschine.
References
- Wan-AI. Wan2.2-TI2V-5B model card and official repository. Weights, Apache-2.0 license, 720p output, 24GB command, and performance guidance. Retrieved July 30, 2026 from huggingface.co/Wan-AI/Wan2.2-TI2V-5B and github.com/Wan-Video/Wan2.2
- Tencent. HunyuanVideo-1.5 model card. Official 14GB minimum, system requirements, checkpoints, and output paths. Retrieved July 30, 2026 from huggingface.co/tencent/HunyuanVideo-1.5
- Z.ai. CogVideoX1.5-5B model card. Diffusers and SAT memory figures, quantization trade-offs, duration, and resolution. Retrieved July 30, 2026 from huggingface.co/zai-org/CogVideoX1.5-5B
- Genmo. Mochi 1 preview model card. Diffusers memory examples and lower-precision trade-off. Retrieved July 30, 2026 from huggingface.co/genmo/mochi-1-preview
- Tencent. Tencent Hunyuan Community License Agreement. Territory, distribution, commercial, and use terms. Retrieved July 30, 2026 from HunyuanVideo-1.5 LICENSE
- Z.ai. CogVideoX License. License linked from the official model card. Retrieved July 30, 2026 from CogVideoX1.5-5B LICENSE
- Genmo. Mochi repository. Hardware guidance, Apache-2.0 license, architecture, and documented limitations. Retrieved July 30, 2026 from github.com/genmoai/mochi
Autor

Kategorien
Weitere Beiträge

Atlas Cloud vs Higgsfield: API-Plattform oder Creator Studio?
Atlas Cloud, Higgsfield und reAPI für Seedance vergleichen: API-Zugriff, Creator-Workflows, Preismodelle, Modellvielfalt und die beste Lösung für dein Team.


Fünf Produktanzeigen mit n8n unter 0,20 $ generieren
Einen getesteten Bildgenerierungs-Lauf für 0,075 $ als n8n-Workflow umwandeln, mit vergrenztem Polling, Retry-Budget und praktischer Review-Checkliste.


Seedance 2.5: API-Zugang, Preise und Grenzen
Seedance 2.5 ist verfügbar: Modell-ID, 480p-/720p-Preise, 30-Sekunden-Videos, mehr Referenzen und die weiterhin falsche 4K-Angabe.
