
MiniMax H3 lokal vs. API: Kosten, VRAM und Lizenz
Was sagen die offiziellen MiniMax- und ComfyUI-Dokumente zur lokalen H3-Hardware? Vergleich mit den gehosteten API-Kosten für 768P und 2K.
Führen Sie MiniMax H3 lokal aus, wenn der offizielle optimierte Workflow zu Ihrer Hardware passt und Sie viele Iterationen oder private Eingaben benötigen; verwenden Sie eine API für gelegentliche fertige Clips, gehostete 2K-Ausgabe, Parallelität oder einen Betrieb ohne Einrichtungsaufwand. Laut offiziellem ComfyUI-Leitfaden kann dynamisches Offloading den Workflow auf einer RTX 3060 starten. Ein Start ist jedoch weder ein Geschwindigkeitsbenchmark noch der Beleg, dass verschiedene VRAM-Stufen gleichwertige Ergebnisse liefern.[1]
Die Aussage „läuft lokal“ braucht drei Zahlen: Auflösung, Dauer und Laufzeit. Ohne sie wirken ein Start mit wenig Speicher und eine Serverbereitstellung wie dasselbe Ergebnis.
Was lokales H3 derzeit bedeutet
| Setup | Offiziell dokumentiertes Ergebnis | Wichtige Einschränkung |
|---|---|---|
| Offizielles optimiertes ComfyUI-Paket | 42,5GB Gesamtmodellumfang; dynamisches Offloading kann auf RTX 3060 starten | Ein Start ist kein Geschwindigkeitsbenchmark |
| Offizielles SGLang-Beispiel | Vollständige Bereitstellung auf vier GPUs | Serverroute, kein Rezept für eine einzelne Consumer-GPU |
ComfyUIs offizieller H3-Leitfaden setzt die native 16:9-Leinwand auf 1344×768 und bündelt beschnittene INT8-Gewichte, einen NVFP4-Text-Encoder, getrennte Video- und Audio-VAEs sowie optionale Turbo LoRAs.[1] Die veröffentlichte Optimierung reduzierte den Full-Precision-Umfang von 123,6GB auf 42,5GB. Offloading lässt eine kleinere Karte den Workflow starten, indem Komponenten durch den Systemspeicher bewegt werden; es lässt diese Komponenten nicht verschwinden.
Die VRAM-Kapazität allein beantwortet daher nicht, ob ein lokaler Workflow nützlich ist. Auflösung, Dauer, Laufzeit und Umfang des Offloadings gehören in dasselbe Testergebnis.
Was die offiziellen Dokumente zur lokalen Hardware belegen
Die zitierten offiziellen Quellen belegen zwei konkrete Bereitstellungswege: einen optimierten ComfyUI-Workflow mit dynamischem Offloading und ein Multi-GPU-Beispiel mit SGLang. Eine vergleichbare Leistungstabelle für Consumer-Systeme mit 8GB, 12GB und 24GB wird nicht veröffentlicht.
Bevor Sie ein lokales Ergebnis als Kaufempfehlung behandeln, stellen Sie drei direkte Fragen:
- Kann der genaue Workflow ohne Out-of-Memory-Fehler geladen werden?
- Welche Auflösung und Dauer erzeugt er, und wie lange dauert ein Versuch?
- Nutzt die gewünschte Ausgabe nur den nativen lokalen Workflow oder zusätzlich einen offiziellen gehosteten Kontext- oder Regenerationsdienst?
MiniMax' Modellkarte unterscheidet den nativen lokalen Workflow ebenfalls vom vollständigen 2K-Pfad. Der veröffentlichte 2K-Workflow kombiniert die lokale Bereitstellung mit offiziellen Context-IR- oder Regenerations-APIs.[2] Lokales 768p und gehostetes 2K sind deshalb unterschiedliche Ausgabeprodukte, nicht zwei Preise für dieselbe Aufgabe.
MiniMax H3 API-Kosten
Preise überprüft am 23. August 2026:
| Gehostete Route | Pro Sekunde | 5 Sekunden | 15 Sekunden |
|---|---|---|---|
| MiniMax direkt, 768P | $0,080 | $0,400 | $1,200 |
| reAPI, 768P | $0,074 | $0,370 | $1,110 |
| MiniMax direkt, 2K | $0,130 | $0,650 | $1,950 |
| reAPI, 2K | $0,119 | $0,595 | $1,785 |
MiniMax's offizielles Preisblatt berechnet nach Output-Dauer. Input-Video-Dauer wird auch mit der gewählten Auflösung berechnet, die ersten fünf Referenzbilder sind kostenlos, später Bilder addieren einen Aufschlag und Audio-Referenzen sind kostenlos.[3]
Die reAPI MiniMax H3 Model Page veröffentlicht getrennte 768P- und 2K-Rates.[4] Das sind datierte Zahlen, keine ewigen Versprechen; nutze die Live-Seite für ein Budget.
Hardware-Amortisation wird in Versuchen gemessen
Angenommen, H3 erfordert ein Hardware-Upgrade für $500. Ignorieren Sie Elektrizität und Setup-Zeit zuerst.
- Bei $1,11 für einen 15-Sekunden-768P-API-Clip kauft $500 etwa 450 Versuche.
- Bei $1,785 für einen 15-Sekunden-2K-Clip kauft es etwa 280 Versuche.
- Ein $1.000-Maschinen-Budget verschiebt diese Zahlen auf etwa 900 Versuche bei 768P oder 560 bei 2K.
Die korrekte Einheit ist Versuche, nicht gelieferte Videos. Wenn ein akzeptierter Schuss fünf Generationen benötigt, könnten 450 Versuche zu 90 fertigen Aufnahmen werden. Lokale Erzeugung profitiert am meisten, wenn abgelehnte Entwürfe den Workload dominieren.
Die Arithmetik ändert sich auch, wenn die GPU bereits auf dem Schreibtisch sitzt. Ihre Kaufkosten sind versunken, und lokales H3 wird schnell attraktiv für unbegrenzte Low-Auflösungs-Iteration, Offline-Referenzmaterial, benutzerdefinierte Knoten und vollständige Workflow-Kontrolle.
API-Zugang verdient seinen Preis, wenn das Volumen unregelmäßig ist, eine 2K-Lieferung erforderlich ist, mehrere Jobs ohne Belegung eines Workstation laufen sollen oder das Team lieber $0,37 ausgibt, um einen Prompt zu testen, als ein Wochenende mit der Abstimmung der Speichereinstellungen zu verbringen.
Überprüfen Sie die Lizenz, bevor Sie die GPU kaufen
MiniMax H3 ist Open-Weight, nicht Apache- oder MIT-lizenziert. Die aktuelle Community-Lizenz schließt die Vereinigten Staaten, die Europäische Union, das Vereinigte Königreich und Südkorea von seinem anwendbaren Gebiet aus und weist Benutzer dort an, eine separate schriftliche Genehmigung zu erhalten.[5]
Öffentlicher Download und Berechtigung für eine Bereitstellung sind separate Fragen. Die Lizenz enthält auch kommerzielle Umsatz- und Zuschreibungsbedingungen. Unser MiniMax H3 Lizenz-Leitfaden erklärt die Klauseln, ohne zu versuchen, Rechtsberatung zu geben.
Diese Unterscheidung ist am wichtigsten für Self-Hosting, da das Team die Gewichte direkt nimmt und betreibt. Eine gehostete API ist eine andere vertragliche Route und sollte unter ihren Service-Bedingungen bewertet werden.
Häufig gestellte Fragen
Kann MiniMax H3 auf 8GB VRAM laufen?
Die zitierten offiziellen Quellen belegen kein Ergebnis für eine 8GB-Konfiguration. Der offizielle ComfyUI-Leitfaden dokumentiert einen Start per dynamischem Offloading auf einer RTX 3060, aber keine Leistung für eine 8GB-Konfiguration.
Reichen 12GB VRAM für H3 aus?
Die hier zitierten offiziellen Belege reichen nicht aus, um jede 12GB-Konfiguration als geeignet zu bezeichnen. Sie zeigen einen bestimmten optimierten Offloading-Pfad, keine allgemeine Leistungsgarantie für 12GB.
Ist lokales H3 kostenlos?
Es gibt keine pro-Generation API-Rechnung, aber Hardware, Stromversorgung, Speicher, Setup-Zeit und fehlgeschlagene lokale Versuche haben trotzdem Kosten. Die Community-Lizenz kann auch bestimmen, ob die beabsichtigte Bereitstellung erlaubt ist.
Wann ist die API billiger als lokales H3?
Für eine neue $500-Hardware-Ausgabe liegt der aktuelle Break-Even bei etwa 450 fünfzehn-Sekunden-768P-Versuchen oder 280 fünfzehn-Sekunden-2K-Versuchen auf reAPI, vor Elektrizität und Setup-Zeit.
Erzeugt lokales H3 die gleiche 2K-Ausgabe wie die gehostete API?
Nicht durch den nativen ComfyUI-Basis-Workflow. MiniMax beschreibt den vollständigen 2K-Workflow als Kombination von lokaler Bereitstellung und offiziellen Kontext- oder Regenerationsdiensten.
Referenzen
- ComfyUI. MiniMax H3 offizielles Tutorial. Abgerufen am 23. August 2026. docs.comfy.org
- MiniMaxAI. MiniMax H3 Model Card und Bereitstellungsbeispiele. Abgerufen am 23. August 2026. huggingface.co
- MiniMax API. Pay-as-you-go Preise. Abgerufen am 23. August 2026. platform.minimax.io
- reAPI. MiniMax H3 Model Page und Live Preise. Abgerufen am 23. August 2026. reapi.ai
- MiniMaxAI. MiniMax H3 Community License. Abgerufen am 23. August 2026. huggingface.co
Autor

Kategorien
Weitere Beiträge

Beste Seedance-2.5-Alternativen: H3, Veo, Sora und mehr
Vergleich der besten Seedance-2.5-Alternativen für Videogenerierung, darunter MiniMax H3, Seedance 2.0, Veo 3.1, Sora 2, Runway und Kling 3.


GPT API günstiger: Fünf Modelle 20% unter OpenAI-Preisen
Fünf GPT-Modelle kosten auf reAPI 20% weniger als OpenAI-Standardpreise. Vergleich und Rechnung für GPT-5.4, GPT-5.5 und alle GPT-5.6-Varianten.


KI lange Videos: Verkettung über die Grenze
AI-Videos maximal 30 Sekunden pro Erzeugung. Segmente verketten ohne Naht, Parameter-Regeln, sichtbare Bruchstellen, und Kosten für drei Minuten Video.
