Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Beste Open-Source-AI-Videomodelle für lokale GPUs (2026)
2026/07/30

Beste Open-Source-AI-Videomodelle für lokale GPUs (2026)

Vergleich von Wan 2.2, HunyuanVideo-1.5, CogVideoX1.5 und Mochi 1 nach GPU-Speicher, Output, Lizenz, Geschwindigkeit und Bereitstellungsgrenzen.

Wan 2.2 TI2V-5B ist das beste All-in-One-Modell für eine 24-GB-GPU. HunyuanVideo-1.5 ist der bessere Startpunkt bei 14–16 GB, während CogVideoX1.5-5B das realistischste Experiment darunter ist. Mochi 1 bleibt für seine Apache-2.0-Lizenz und hackbare Pipeline interessant, aber sein Speicherverbrauch und die 480p-Ausgabe machen es eher zur Spezialwahl als zur Standard-Lösung.

Diese Antwort kommt mit einer wichtigen Einschränkung: eine veröffentlichte minimale VRAM-Zahl setzt normalerweise CPU-Offloading, Tiling, niedrigere Präzision oder alle drei voraus. Sie sagt dir, dass ein Workflow passt. Sie sagt dir nicht, dass der Workflow schnell genug für die tägliche Nutzung ist.

Dieser Vergleich nutzt die offiziellen Modellkarten und Repositories der Projekte, geprüft am 30. Juli 2026. Der Begriff „Open-Source-AI-Videomodell" wird verwendet, weil das ist, wie Menschen diese Modelle suchen. „Open-weight" ist oft präziser, besonders wenn ein Modell eine maßgefertigte Gemeinschaftslizenz nutzt.

Beste lokale AI-Videomodelle auf einen Blick

ModellVeröffentlichter lokaler VRAM-PfadVideoausgabeLizenzBeste Passung
Wan 2.2 TI2V-5BMindestens 24 GB mit CPU-Offloading[1]720p-Klasse, 24fps; Text-zu-Video und Bild-zu-VideoApache-2.0Beste Balance für eine einzelne 24-GB-Workstation
HunyuanVideo-1.514 GB Minimum mit Modell-Offloading[2]480p/720p T2V und I2V, plus Super-Resolution-PfadTencent Hunyuan LizenzBest dokumentiert für eine 14–16-GB-CUDA-GPU
CogVideoX1.5-5BDiffusers BF16 ab 10 GB; INT8 ab 7 GB[3]1360×768, 5 oder 10 SekundenCogVideoX-LizenzLow-VRAM-Test, wenn langsame Generierung akzeptabel ist
Mochi 1 Vorschau22 GB für das niedrigere Präzisions-Diffusers-Beispiel; etwa 60 GB für das Referenz-Single-GPU-Repository[4]Anfangsversion zielt auf 480p Text-zu-VideoApache-2.0Forschung, LoRA-Arbeiten und permissive Lizenzierung

Diese Zeilen sind nicht Benchmark-äquivalent. CogVideoX nutzt eine andere Präzision und Speicherstrategie als Wan's dokumentierte 24-GB-Befehl. Mochi's 22-GB-Beispiel akzeptiert ausdrücklich einen kleinen Qualitätsverlust. Behandle die Zahlen als Bereitstellungsrouten, nicht als Qualitätsranking.

Was deine GPU realistisch laufen kann

8 GB VRAM: ein technischer Test, keine komfortable Workstation

CogVideoX1.5-5B ist das einzige Modell dieser Gruppe, dessen Herausgeber einen INT8-Diffusers-Pfad ab etwa 7 GB dokumentieren. Die gleiche Modellkarte warnt, dass Quantisierung und sequenzielles CPU-Offloading die Geschwindigkeit reduzieren. Das Low-Memory-Testing wurde auf A100/H100-Hardware durchgeführt, obwohl die Autoren sagen, dass der Ansatz generell auf NVIDIA Ampere oder neueren Karten funktionieren sollte[3].

Eine 8-GB-Karte kann daher beweisen, dass das Modell läuft, lässt aber wenig Raum für die Anzeige, Decoder, längere Clips oder einen anderen Prozess. Erwarte Abhängigkeits-Tuning und einen großen System-RAM-Fußabdruck. Für reguläre Produktion ist ein gehosteter Job oder eine größere GPU normalerweise weniger frustrierend.

10–12 GB VRAM: CogVideoX wird für geduldige Experimente nutzbar

Der optimierte BF16-Diffusers-Pfad von CogVideoX1.5-5B beginnt bei etwa 10 GB. Dies ist ein besserer erster Test als INT8, wenn die Karte es halten kann. Der Tradeoff ist Zeit: die 50-Schritte-Ergebnisse des Herausgebers für einen Fünf-Sekunden-Clip werden selbst auf einem H100 in Hunderten von Sekunden gemessen, und länger auf einem A100[3]. Das sind keine Consumer-GPU-Prognosen, aber sie machen den Engpass klar.

CogVideoX erwartet auch englische Prompts. Teams, die Prompts in anderen Sprachen akzeptieren, brauchen einen Übersetzungs- oder Prompt-Umschreib-Schritt vor Inferenz.

14–16 GB VRAM: HunyuanVideo-1.5 ist der praktische Schritt nach oben

Tencent veröffentlicht ein 14-GB-Minimum mit aktiviertem Modell-Offloading. Der offizielle Quellenpfad zielt auf Linux, Python 3.10 oder neuer und eine NVIDIA CUDA GPU ab[2]. Das ist ein viel festerer Startpunkt als eine inoffizielle Behauptung, dass ein großes Videomodell „auf 12 GB läuft".

HunyuanVideo-1.5 unterstützt Text-zu-Video- und Bild-zu-Video-Checkpoints bei 480p und 720p. Das separate Super-Resolution-Modell kann Video auf 1080p hochskalieren. Dieser letzte Schritt ist zusätzliche Arbeit; er sollte nicht als natürliche 1080p-Generierung beschrieben werden.

Die Hauptbeschränkung ist eher rechtlich als technisch. Die Tencent Hunyuan Lizenz schließt die Nutzung in der Europäischen Union, dem Vereinigten Königreich und Südkorea aus, enthält Nutzungsbeschränkungen und verlangt eine separate Lizenz für bestimmte Produkte über ihrem angegebenen Schwellenwert[5]. Lies die aktuelle Lizenz, bevor du sie für einen kommerziellen Dienst wählst.

24 GB VRAM: die nutzbare lokale Video-Klasse

Hier fühlt sich lokale Generierung nicht mehr wie ein Memory-Stunt an. Wan 2.2 TI2V-5B hat einen offiziellen Single-GPU-Befehl für eine 24-GB-RTX-4090-ähnliche Karte. Es unterstützt Text-zu-Video und Bild-zu-Video in einer 5B-Pipeline und gibt 720p-Klasse-Video bei 24fps aus[1].

Wan's Modellkarte sagt, dass das 5B-Modell einen Fünf-Sekunden-720p-Video auf einer einzelnen Consumer-GPU ohne Spezialoptimierung in unter neun Minuten generieren kann. Das ist nutzbar für Vorschauen und Batch-Arbeiten, aber nicht für interaktive Bearbeitung. Queue-Design ist immer noch wichtig.

Mochi 1 kann auch diese Klasse durch sein 22-GB-BF16-Diffusers-Beispiel passen. Genmo bemerkt einen leichten Qualitätsverlust für diesen Pfad. Mit nur einem kleinen Betrag VRAM übrig kann eine andere Anwendung oder eine andere Frame-Zählung den Job aus dem Speicher drücken[4]. Wähle Mochi hier für seinen Forschungswert und seine Lizenz, nicht weil es die sicherste 24-GB-Bereitstellung ist.

48–80 GB VRAM: weniger Kompromisse, nicht automatisch Durchsatz

Mochis höher qualitatives Diffusers-Beispiel benötigt 42 GB, während sein Reference-Repository etwa 60 GB für Single-GPU-Betrieb beschreibt und eine H100 empfiehlt[4]. Mehr Speicher kann auch Offloading für die anderen Modelle reduzieren oder mehr als einen Worker unterstützen.

Es entfernt nicht die Rechenkosten von Diffusion. Vor dem Kauf einer größeren Karte, Benchmark die Anzahl der akzeptierten Clips pro Stunde, nicht die Zahl der eingereichten Prompts.

Wan 2.2: beste Gesamtlösung für eine 24-GB-GPU

Wan 2.2 TI2V-5B hat die sauberste Kombination aus lokaler Praktikabilität und Output-Fähigkeit in dieser Gruppe:

  • Offizielle Gewichte und Inferenz-Code;
  • ein dokumentierter Single-24-GB-GPU-Pfad;
  • Text-zu-Video und Bild-zu-Video im gleichen Modell;
  • 720p-Klasse-Ausgabe bei 24fps;
  • eine Apache-2.0-Lizenz.

Sei präzise über den Modellnamen. Wan 2.2 hat auch größere A14B-Checkpoints. Ein Tutorial, das TI2V-5B auf einer 4090 zeigt, beweist nicht, dass die größeren Varianten die gleiche Hardware passen. Download-Größe, Inferenz-Argumente und Speicheranforderungen unterscheiden sich.

Wan ist das vernünftige erste Benchmark für einen unabhängigen Creator, Forschungsteam oder Studio mit einer 4090. Seine Schwäche ist Latenz. Ein Einzelcomputer kann einen nützlichen Batch über Nacht rendern; er ist weniger überzeugend als Backend für ein Produkt, das sofortige Ergebnisse verspricht.

HunyuanVideo-1.5: beste bei 14–16 GB

HunyuanVideo-1.5 packt ein 8.3B-Videomodell um ein überraschend zugängliches offizielles Minimum herum. Es ist der stärkste Kandidat hier, wenn die Maschine nicht 24 GB erreichen kann, aber immer noch beide Text-zu-Video und Bild-zu-Video braucht.

Seine Modellfamilie ist komplizierter als ein Download. Tencent listet separate 480p- und 720p-Checkpoints, destillierte Varianten und Super-Resolution-Gewichte auf. Entscheide, welcher Pfad das Produkt tatsächlich braucht, bevor du Speicher einrichtest oder einen Container baust.

Dieses Modell ist auch das klarste Beispiel, warum „offen" und „permissiv" verschiedene Fragen sind. Die Gewichte und der Trainingscode sind verfügbar, aber die Gemeinschaftslizenz hat Terrritorium, Zuschreibungs-, Vertriebs- und akzeptable Nutzungsbedingungen. Apache-2.0-Annahmen tragen nicht über.

CogVideoX1.5-5B: bestes Low-VRAM-Experiment

CogVideoX1.5-5B gewinnt den Anpassungswettbewerb. Die offizielle Tabelle dokumentiert 10-GB-BF16 und 7-GB-INT8-Diffusers-Konfigurationen gegenüber 76 GB für seinen BF16-SAT-Pfad[3]. Diese Spanne zeigt, wie sehr der Software-Pfad die Hardware-Antwort ändert.

Wähle CogVideoX, wenn:

  • die verfügbare GPU 8–12 GB hat;
  • Generierung im Hintergrund laufen kann;
  • Prompts auf Englisch normalisiert werden können;
  • das Team sich mit dem Anheften von CUDA, PyTorch, Diffusers und Quantisierungs-Abhängigkeiten wohlfühlt.

Wähle es nicht nur, weil „7 GB" effizient aussieht. Der INT8-Pfad tauscht Geschwindigkeit gegen Speicher, und das Modell's 5- oder 10-Sekunden-Ausgabe bleibt teuer, mehrmals zu samplen. Eine 12-GB-Installation, die zuverlässig fertigstellt, kann nützlicher sein als eine 8-GB-Konfiguration an ihrer Grenze.

CogVideoX nutzt eine eigene Lizenz. Überprüfe den Text für die geplante Verbreitung und kommerzielle Nutzung statt „downloadbar auf Hugging Face" als rechtliche Schlussfolgerung zu behandeln[6].

Mochi 1: beste für permissive Forschungsarbeit

Mochi 1 ist eine 10B-Text-zu-Video-Forschungs-Vorschau unter Apache-2.0. Genmo veröffentlicht die Gewichte, Inferenz-Code, eine programmierbare Pipeline und einen LoRA-Trainer. Das macht es eine gute Basis für Teams, die sich um Stack-Modifizierung kümmern statt einfach den höchsten Auflösungs-Clip zu produzieren.

Seine Einschränkungen sind ungewöhnlich gut dokumentiert. Der Anfangs-Checkpoint zielt auf 480p, ist auf Photorealismus abgestellt, kann unter extremer Bewegung Verformung zeigen und funktioniert weniger gut bei animierten Stilen[7]. Die Reference-Implementierung braucht auch etwa 60 GB VRAM auf einer GPU. Diffusers senkt das auf 22 GB in BF16, aber mit einem angegebenen Qualitätstradeoff.

Mochi ergibt Sinn auf einer Forschungs-Workstation oder einem Multi-GPU-Server. Es ist schwieriger für einen Creator zu rechtfertigen, der eine einzelne Karte speziell für 720p-Ausgabe in Fertigformat kauft.

„Läuft lokal" hat vier verschiedene Bedeutungen

Modellvergleiche kollabieren oft vier Meilensteine in einen:

  1. Der Prozess startet. Die Gewichte laden mit Quantisierung und Offloading.
  2. Ein Sample fertigstellt. Ein kurzer, kleiner Batch-Job vermeidet einen Out-of-Memory-Fehler.
  3. Der Workflow ist wiederholbar. Zehn Jobs fertigstellen ohne Speicherfragmentierung, Driver-Abstürze oder manuelle Bereinigung.
  4. Das System ist nutzbar. Durchsatz, akzeptierte Ausgaberate und Betriebsaufwand schlagen die verfügbare Alternative.

Nur der vierte Meilenstein unterstützt eine Produktionsentscheidung. CPU-Offloading verschiebt Druck ins System-RAM und PCIe-Transfers. Quantisierung kann Speicher reduzieren während Inferenz langsamer wird. VAE-Tiling spart Speicher aber ändert das Ausführungsprofil. Eine Desktop-GPU verliert auch einen Teil ihrer Kapazität an die Anzeige und andere Anwendungen.

Geschlossene gehostete Modelle sind eine separate Kategorie: eine API oder ComfyUI-Node kann einen bekannten Modellnamen exponieren während alle Inferenz remote passiert. Für ein konkretes Beispiel dieser Unterscheidung, siehe die Erklärung von ob Seedance lokal läuft.

Ein fairer lokaler Benchmark braucht einen Nachmittag

Beginne nicht mit einer großen Prompt-Bibliothek. Nutze fünf Prompts, die verschiedene Fehlermodi exponieren:

  • eine festgestellte Kamera mit einem bewegten Subjekt;
  • zwei Menschen, die interagieren;
  • schnelle Seitwärtsbewegung;
  • Bild-zu-Video mit einem Gesicht oder Produkt, der/das konsistent bleiben muss;
  • eine Szene mit Text, Händen oder wiederholter Geometrie.

Führe jedes Modell bei der Auflösung, Dauer und Speichereinstellung aus, die du tatsächlich versenden würdest. Zeichne auf:

MetrikWarum es wichtig ist
Peak VRAMZeigt, ob der Workflow neben echten Services überlebt
Peak System RAMZeigt die versteckte Kosten des CPU-Offloading
Cold-Start-ZeitWichtig für Serverless-Worker und neu gestartete Queues
Sekunden pro ClipBestimmt Kapazität, aber nicht Qualität
Akzeptierte Clips pro zehn VersucheErfasst Bewegung, Identität und Prompt-Fehlschlag
Wattstunden pro akzeptiertem ClipMacht lokale Betriebskosten vergleichbar
Manuelle InterventionenExponiert eine spröde Pipeline vor Produktion

Halte Seeds und Prompts fest. Wenn ein Modell ein Prompt-Umschreiben braucht, speichere dieses Umschreiben als Teil seiner Pipeline statt still einem besseren Prompt während der Evaluierung zu geben.

Vor der Bereitstellung eines Open-Weight-Videomodells

Der Checkpoint ist nur eine Komponente. Ein zuverlässiger lokaler Service braucht auch:

  • genügend NVMe-Platz für Gewichte, Caches, Inputs und gerenderte Frames;
  • angeheftete Versionen für den NVIDIA-Driver, CUDA, PyTorch und Aufmerksamkeits-Bibliotheken;
  • einen Worker, der GPU-Speicher nach fehlgeschlagenen Jobs freigeben kann;
  • Anfragegrenzen für Dauer, Auflösung, Frame-Zählung und Batch-Größe;
  • Ausgabe-Moderation und eine Richtlinie für hochgeladene Gesichter oder urheberrechtlich geschützte Assets;
  • Modell- und Lizenzhinweise in das Produkt getragen, wo erforderlich;
  • reproduzierbare Benchmark-Prompts für Upgrades.

Video-Diffusions-Fehlschläge sind teuer, weil sie spät ankommen. Ein Worker kann Minuten verbringen, bevor er einen Out-of-Memory-Fehler oder einen unbrauchbaren Clip zurückgibt. Validiere Inputs und reserviere Speicher, bevor der Job die Generierungs-Queue eintritt.

FAQ

Was ist das beste Open-Source-AI-Videomodell für 12 GB VRAM?

CogVideoX1.5-5B ist die klarste dokumentierte Wahl. Die offizielle Modellkarte listet einen optimierten BF16-Diffusers-Pfad ab 10 GB und einen INT8-Pfad ab 7 GB auf. Beide nutzen Memory-Sparen-Techniken und können langsam sein.

Was ist das beste lokale Videomodell für eine RTX 4090?

Wan 2.2 TI2V-5B ist der beste Startpunkt in diesem Vergleich. Der Herausgeber dokumentiert ein 24-GB-Single-GPU-Setup, 720p-Klasse-Ausgabe bei 24fps und Unterstützung für Text-zu-Video und Bild-zu-Video.

Kann HunyuanVideo-1.5 auf 16 GB VRAM laufen?

Ja, nach Tencent's veröffentlichtem 14-GB-Minimum mit Modell-Offloading. Das offizielle Setup zielt auf Linux und eine NVIDIA CUDA GPU ab. Verfügbares System-RAM und Speichergeschwindigkeit beeinflussen die Erfahrung immer noch.

Ist Mochi 1 praktisch auf einer 24-GB-GPU?

Es kann mit dem offiziellen 22-GB-BF16-Diffusers-Beispiel passen, das einen leichten Qualitätsverlust bemerkt. Seine Reference-Implementierung braucht viel mehr Speicher, und das Anfangsmodell zielt auf 480p, daher ist Wan 2.2 üblicherweise die praktischere 24-GB-Wahl.

Kann ich diese Modelle kommerziell nutzen?

Die Antwort hängt vom Modell ab. Wan 2.2 TI2V-5B und Mochi 1 nutzen Apache-2.0. HunyuanVideo-1.5 nutzt Tencent's Gemeinschaftslizenz, und CogVideoX1.5 nutzt die CogVideoX-Lizenz. Überprüfe die aktuelle Lizenz, akzeptable Nutzungsregeln, Terrritorium und Vertriebsbedingungen für den exakten Checkpoint. Dieser Artikel ist ein technischer Vergleich, keine rechtliche Beratung.

Sagt das minimale VRAM die Generierungsgeschwindigkeit voraus?

Nein. Die kleinsten Konfigurationen sparen üblicherweise Speicher durch CPU-Offloading, Tiling oder Quantisierung, von denen alle die Geschwindigkeit reduzieren können. Miss die Wanduhr-Zeit und akzeptierte Outputs auf der Ziel-Maschine.

References

  1. Wan-AI. Wan2.2-TI2V-5B model card and official repository. Weights, Apache-2.0 license, 720p output, 24GB command, and performance guidance. Retrieved July 30, 2026 from huggingface.co/Wan-AI/Wan2.2-TI2V-5B and github.com/Wan-Video/Wan2.2
  2. Tencent. HunyuanVideo-1.5 model card. Official 14GB minimum, system requirements, checkpoints, and output paths. Retrieved July 30, 2026 from huggingface.co/tencent/HunyuanVideo-1.5
  3. Z.ai. CogVideoX1.5-5B model card. Diffusers and SAT memory figures, quantization trade-offs, duration, and resolution. Retrieved July 30, 2026 from huggingface.co/zai-org/CogVideoX1.5-5B
  4. Genmo. Mochi 1 preview model card. Diffusers memory examples and lower-precision trade-off. Retrieved July 30, 2026 from huggingface.co/genmo/mochi-1-preview
  5. Tencent. Tencent Hunyuan Community License Agreement. Territory, distribution, commercial, and use terms. Retrieved July 30, 2026 from HunyuanVideo-1.5 LICENSE
  6. Z.ai. CogVideoX License. License linked from the official model card. Retrieved July 30, 2026 from CogVideoX1.5-5B LICENSE
  7. Genmo. Mochi repository. Hardware guidance, Apache-2.0 license, architecture, and documented limitations. Retrieved July 30, 2026 from github.com/genmoai/mochi