
MiniMax-H3-Guide: Prompts schreiben für bessere Videos
Schreib bessere MiniMax-H3-Prompts für Text-zu-Video, Bild-zu-Video, gemischte Referenzen, natives Audio, Kamerabewegungen und API-Workflows.
Ein guter MiniMax-H3-Prompt beschreibt kein Poster. Er inszeniert eine Einstellung. Benenne die Person oder den Gegenstand, die sichtbare Veränderung, die Kamera, die Dauer und den Sound. Wenn du Referenzen hinzufügst, weisen Sie jeder eine einzige Aufgabe zu. H3 erzeugt Bild und natürlichen Stereo-Sound zusammen, daher gehören Stille, Ambience, Dialog, Musik und Effekte in dieselbe Anweisung wie die Bewegung.[1]
Das Modell akzeptiert Prompts bis zu 7.000 Zeichen, aber Länge ist nicht das Ziel. Sechs präzise Zeilen schlagen normalerweise eine Seite voller Adjektive. Dieser MiniMax-H3-Prompt-Leitfaden zeigt dir, wie du diese Zeilen für Text-zu-Video, Bild-zu-Video und gemischte Video-Referenzen auf reAPI schreibst.
TL;DR
- Schreib die Veränderung über die Zeit, nicht eine statische Aufzählung des Bildes.
- Trenne Charakteraktion, Kameraaktion und Sound, damit sie nicht um Platz in einem Satz konkurrieren.
- Für Bild-zu-Video beschreib den Übergang; die Bilder beschreiben bereits die Endpunkte.
- Für Video mit Referenzen markiere die Rolle jeder Bild-, Video- und Audio-Eingabe.
- Fang mit sechs Sekunden an. Erhöhe die Dauer nur, wenn die Aktion es wirklich braucht.
- Zeitblöcke wie
[0–2 Sekunden]sind eine Schreibtechnik, keine garantierte Parser-Anweisung. Nutze sie, um die beabsichtigte Abfolge unmissverständlich zu machen.
Die Struktur des MiniMax-H3-Prompts
H3 unterstützt drei Anfrage-Formen: reiner Text-zu-Video-Prompt, Bild-zu-Video mit erstem und letztem Frame, und Video mit Referenzen aus Bildern, Videos und Audio. Das API wählt den Modus basierend auf dem angehängten Material; der Prompt sollte sich entsprechend ändern. Die MiniMax-H3-API-Referenz dokumentiert die genauen Validierungsregeln.[2]
Für einen reinen Text-Prompt verwende diese Reihenfolge:
SUBJECT — wer oder was die Einstellung folgt
ACTION — eine sichtbare Entwicklung mit klarem Ende
SETTING — nur Details, die die Einstellung beeinflussen
CAMERA — Ausschnitt, Bewegung, Fokus und Tempo
LIGHT — Richtung, Tageszeit und Materialverhalten
SOUND — Dialog, Ambience, Geräusch, Musik oder bewusste StilleDas ist keine Magie-Syntax. Es ist ein Weg, um drei verschiedene Aktionen und vier verschiedene Kamerabewegungen zu verhindern, dass sie in einem dekorativen Absatz vergraben werden.

Starte mit einer Veränderung, nicht mit einem Mood Board
„Cinematisches Café, wunderschönes Licht, Premium, melancholisch" nennt eine Ästhetik, gibt dem Video aber nirgendwo hin, wohin es gehen kann. Füge ein physisches Ereignis und einen Endpunkt hinzu:
Sechs-Sekunden-Großaufnahme einer gebürsteten Edelstahlespressomaschine bei Sonnenaufgang. Ein Barista sperrt den Siebträger, drückt den Schalter und der erste dunkle Kaffeestrahl erreicht die Tasse in der letzten Sekunde. Langsamer Dolly von links nach rechts, flache Tiefenschärfe, warme Fensterreflexionen. Ein Schalterklick, aufsteigender Dampf, ruhiger Raumklang. Kein Dialog oder Musik.
Die Einstellung hat jetzt einen Anfang, eine Mitte und ein überprüfbares Ende. Die Kamera hat eine Bewegung. Der Sound-Untergrund ist klein genug zum Mischen. „Premium" ist weg, weil die Materialien, das Licht, das Tempo und die Zurückhaltung diese Arbeit bereits erledigen.
Behalte eine dominante Aktion
Kurze Clips bestrafen überladene Choreografie. Wenn ein Sechssekunden-Prompt eine Person bittet, einzutreten, zu sitzen, ein Paket zu öffnen, zu sprechen, zu trinken, nach draußen zu schauen und zu gehen, muss das Modell etwas komprimieren oder weglassen. Wähle die Aktion, um die es im Clip geht. Verschiebe den Rest in einen anderen Shot.
Gib der Kamera ein Verb
Schwenk, Neigung, Dolly, Kran, Umlauf, Handstativ-Tracking und Schärfenverlauf sind keine Synonyme. Wähle eine primäre Kamerabewegung. Eine zweite Anweisung kann Fokus oder einen kleinen Abschluss beschreiben, aber ein „Dolly rein während Umlauf, Kran rauf und Whip-Schwenk" Shot ist normalerweise eine Anfrage nach Konflikt.
Beschreib Materialverhalten statt Qualität
Wörter wie „atemberaubend", „episch" und „hochwertig" geben einem Betrachter nichts zu überprüfen. Beschreib, was Licht tut: eine schmale Reflexion, die über gebürstetes Metall gleitet, weiches Fensterlicht, das ein Gesicht umhüllt, oder Regen, der eine Neon-Reflexion auf nassem Asphalt bricht.
Ein Text-zu-Video-Prompt-Template für MiniMax H3
Text-zu-Video hat keinen Quellframe, daher muss der Prompt sowohl das Bild als auch die Bewegung etablieren. Die Anfrage braucht auch eine explizite Seitenverhältnis auf reAPI.
[Dauer und Ausschnitt]
A [shot size] of [subject] in [setting].
[Aktion]
The subject [single action], ending with [visible final beat].
[Kamera und Licht]
[One camera move], [focus behavior]. [Specific light and material response].
[Audio]
[Dialogue if any]. [Ambience]. [Foley]. [Music or no music].
[Schutzvorschriften]
One continuous shot. No cuts. No added text or logos.Ausgefülltes Beispiel:
Acht-Sekunden-mittelweite Einstellung eines Radfahrers, der unter einer Unterführung im leichten Regen wartet. Er zieht einen Handschuh fest, schaut zur Straße, dann schiebt sich ab und verlässt Frame rechts. Langsames Handstativ-Tracking nach vorn; der Fokus bleibt auf seinem Gesicht, bis das Fahrrad sich bewegt. Kühles Tageslicht, nasses Beton, kleine Bernstein-Reflexionen von vorbeifahrenden Autos. Regen auf Beton, ein Freilauf-Klick, ein entfernter Bus, keine Musik, kein Dialog. Eine durchgehende Einstellung, keine Schnitte, kein Text auf dem Bildschirm.
Die entsprechende Anfrage ist klein:
curl https://reapi.ai/api/v1/videos/generations \
-H "Authorization: Bearer $REAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "minimax-h3",
"prompt": "Eight-second medium-wide shot of a cyclist waiting beneath an overpass in light rain. She tightens one glove, looks toward the road, then pushes off and exits frame right. Slow handheld track forward; focus stays on her face until the bicycle moves. Cool daylight, wet concrete, small amber reflections from passing cars. Rain on concrete, a freewheel click, one distant bus, no music, no dialogue. One continuous shot, no cuts, no on-screen text.",
"aspect_ratio": "16:9",
"duration": 8
}'Die Einreichung gibt eine Task-ID zurück. Frage den gemeinsamen Task-Endpunkt ab, bis das Ergebnis fertig ist. Das fertige MP4 enthält die erzeugte Audio-Spur.
Schreib Bild-zu-Video-Prompts als Übergänge
Im Bild-zu-Video-Modus etablieren ein erstes Frame, letztes Frame oder beide bereits Aussehen und Ausrichtung. Jede visuelle Datei wiederholen, verschwendet Prompt-Platz und kann die Generierung von den bereitgestellten Bildern abziehen.
Sag H3, was zwischen ihnen passieren muss:
Move continuously from the first frame to the last frame.
The paper package unfolds along its existing creases; no new panels appear.
Camera remains locked. The product does not rotate.
Soft paper rustle, one small table tap, quiet studio room tone, no music.
End on the exact composition of the last frame.Auf reAPI leitet sich Bild-zu-Video von den Bildern ab. Sende kein aspect_ratio-Feld in diesem Modus. Schneide die Quellbilder auf das beabsichtigte Lieferseitenverhältnis zu, bevor du einreichst.[2]
Wenn die Start- und End-Frames sich über Gegenstandsgröße, Kamerahöhe oder Beleuchtung nicht einig sind, kann der Prompt den Widerspruch nicht vollständig reparieren. Repariere zuerst die Endpunkte. Das Modell sollte seine Anstrengung auf Bewegung verwenden, nicht auf die Versöhnung zweier unterschiedlicher Aufnahmen.
Weise jeder Referenz eine Aufgabe zu
Referenz-zu-Video ist H3s charakteristischster Workflow. Eine Anfrage kann bis zu neun Bilder, drei Videos und drei Audio-Clips enthalten. Mehr Eingaben erzeugen nicht automatisch bessere Kontinuität. Ein unmarkierter Referenzen-Stapel bittet das Modell zu erraten, was es aus jeder Datei kopieren soll.
Nutze eine explizite Referenzen-Map:
Reference Image 1: preserve this person's face, hair, coat, and proportions.
Reference Image 2: use only the train-car interior and seat materials.
Reference Video 1: use its walking pace and shoulder movement, not its camera.
Reference Audio 1: use this voice identity and cadence for the quoted line.
Create one seven-second shot. The character walks down the aisle toward camera,
touches the top of one seat, and says, "We are almost there." Slow stabilized
dolly backward at eye level. Late-afternoon light moves across the windows.
Keep the voice clear over low rail noise; no music and no extra speakers.Das trennt Identität, Umgebung, Bewegung und Stimme. Es sagt auch einem menschlichen Betrachter, wo er hinschauen soll, wenn ein Ergebnis fehlschlägt.
Referenz-Videos sind nicht kostenlos. Auf der reAPI-Route wird ihre Dauer zur abgerechneten erzeugten Dauer hinzugefügt. Die ersten fünf Referenz-Bilder sind enthalten, während Bilder sechs bis neun eine Pro-Bild-Gebühr hinzufügen. Nutze die MiniMax-H3-Modellseite für aktuelle Sätze, statt eine Anfrage mit ungenutzten Referenzen zu polstern.[3]
Inszeniere Sound als Teil der Einstellung
MiniMax H3 erzeugt natürlichen Stereo-Sound mit dem Bild. Ein nützlicher Sound-Brief beantwortet fünf Fragen:
| Frage | Beispielantwort |
|---|---|
| Wer spricht? | Die Frau im blauen Mantel, und niemand sonst |
| Was ist genau? | "We are almost there." |
| Was etabliert Ort? | Niedriges Schienensgeräusch und zwei leise Wagenklapperäusche |
| Was sollte im Vordergrund sein? | Stimme klar und zentral über der Ambience |
| Was muss abwesend sein? | Keine Musik, Menschenmenge, Durchsage oder Untertitel |
„Cinematischer Sound" beantwortet keinen von ihnen.
Wenn es Dialog gibt, halte die Zeile kurz genug für den Clip. Lies sie laut mit dem beabsichtigten Tempo. Eine Zeile mit zwölf Wörtern, die fünf Sekunden dauert, lässt wenig Raum für die Aktion, Reaktion und natürliche Stille um sie.
Stille sollte angegeben werden. Ohne „keine Musik" oder „kein Dialog" kann das Modell ein leeres Sound-Bett füllen, weil der Prompt es offen gelassen hat. Das Gleiche gilt für Untertitel und Text auf dem Bildschirm.
Zeitblöcke helfen, wenn Reihenfolge wichtig ist
Für einen Shot mit mehreren Beats kann grobe Timing Sequenz klären:
[0–2 Sekunden] Locked close-up. The match touches the wick; only room tone.
[2–5 Sekunden] The flame catches and grows. Very slow dolly in; soft ignition.
[5–7 Sekunden] A hand shields the flame, then leaves frame. One quiet breath.
No cut, no dialogue, no music.Behandle diese Klammern als redaktionellen Überblick. MiniMax verspricht keine Frame-genaue Einhaltung der Prosa-Timing, und erzeugtes Video sollte nicht für Arbeiten verwendet werden, die deterministische Frame-Timing erfordern. Die Blöcke reduzieren immer noch die Mehrdeutigkeit über Reihenfolge und Betonung.
Fünf Prompt-Fehler und ihre kleineren Fixes
| Fehler | Warum das passiert | Kleinerer Fix |
|---|---|---|
| Der Shot fühlt sich statisch an | Prompt beschreibt Aussehen, nicht Veränderung | Füge eine physische Aktion und einen finalen Beat hinzu |
| Die Kamera ruckelt | Mehrere Kamerabewegungen konkurrieren | Behalte eine Bewegung; mache den Rest zu Rahmenbeschränkungen |
| Identität driftet | Referenzen haben keine zugewiesenen Rollen | Benenne eine Identitätsquelle und schütze ihre Invarianten |
| Audio ist ungeordnet | „Cinematischer Sound" lässt alles offen | Liste Vordergrund-Sound, Ambience und explizite Absenzen auf |
| Last Frame wird verpasst | Endpunkte widersprechen oder Aktion ist überladen | Richte die Quellframes aus und vereinfache den Übergang |
Negative Anweisungen funktionieren am besten, wenn sie eine Anforderung schützen. „Keine Schnitte" ist nützlich für eine durchgehende Produktoffenbarung. Zwanzig generische Verbote verstecken normalerweise die eine Einschränkung, die wichtig war.
Eine kompakte Prompt-Überprüfung vor einer Generierung
Lies den Prompt einmal durch und unterstreiche die Antworten:
- Was ändert sich während des Clips?
- Was muss in der letzten Sekunde wahr sein?
- Was macht die Kamera?
- Welche visuellen Details sind geschützt?
- Wer spricht, und welche exakten Worte sagen sie?
- Welche Ambience und Effekte sollten gehört werden?
- Welche Sounds, Schnitte, Text oder Logos dürfen nicht erscheinen?
- Wenn Referenzen angehängt sind, welche einzelne Rolle erfüllt jede?
Wenn zwei Antworten sich widersprechen, repariere den Brief, bevor du die Dauer erhöhst oder eine andere Referenz hinzufügst.
FAQ
Wie lang sollte ein MiniMax-H3-Prompt sein?
Das reAPI-Feld akzeptiert 1–7.000 Zeichen, aber die meisten einzelnen Shots brauchen die Obergrenze nicht. Nutze genug Detail, um Aktion, Kamera, Licht, Sound und geschützte Einschränkungen zu spezifizieren. Entferne Adjektive, die keine Überprüfungsentscheidung ändern.
Kann MiniMax H3 Dialog und Soundeffekte erzeugen?
Ja. H3 erzeugt natürlichen Stereo-Sound und akzeptiert Dialog, Musik, Ambience und Effekte in demselben Prompt wie die visuelle Anweisung.
Versteht MiniMax H3 Kamerabefehle?
MiniMax' Video-Dokumentation gibt Kamerabewegungsanweisungen für seine Video-Modelle, und H3-Prompts können Ausschnitt, Bewegung und Fokus beschreiben. Behandle sie als Anweisung eher als deterministische Motion-Control-Daten.[1]
Sollte ich erste/letzte Frames oder Referenz-Bilder verwenden?
Nutze erste/letzte Frames, wenn der Shot auf einer spezifischen Komposition beginnen oder enden muss. Nutze Referenzen-Modus, wenn separate Assets Identität, Umgebung, Bewegung oder Stimme definieren. Die zwei Input-Familien können nicht in einer reAPI-Anfrage gemischt werden.
Wie viele Referenzen kann MiniMax H3 nutzen?
Die aktuelle reAPI-Route akzeptiert bis zu neun Bilder, drei Video-Clips und drei Audio-Clips. Audio kann nicht die einzige Referenz sein. Gesamtreferenz-Video- und Referenz-Audio-Dauer-Grenzen gelten auch.
Sind Zeitklammern offizielle MiniMax-Syntax?
Nein. Sie sind ein lesbarer Weg, um Reihenfolge und grobe Betonung zu kommunizieren. Präsentiere sie nicht als frame-genaue Kontrollen oder garantierte Parser-Befehle.
Der Prompt ist eine Produktionsnotiz
Der beste MiniMax-H3-Prompt ähnelt einer kurzen Notiz von einem Regisseur an eine kleine Crew. Er sagt, was passiert, wohin die Kamera geht, was das Mikrofon hört und welche Details nicht driften können. Er bittet das Modell nicht, den Shot in einer Wolke von Style-Wörtern zu entdecken.
Beginne mit einer Aktion und sechs Sekunden. Überprüfe die Bewegung und den Sound separat. Füge erst dann Referenzen, Zeitblöcke oder längere Dauer hinzu. Der MiniMax-H3-Spielplatz und die API-Anleitung verwenden die gleichen Anfrage-Modi, daher kann ein Prompt von einem manuellen Test in Code gehen, ohne seinen Job zu ändern.
Offenlegung: reAPI veröffentlicht diesen Leitfaden und betreibt den hier beschriebenen gerouteten MiniMax-H3-Endpunkt. API-Grenzen und Abrechnungsverhalten beziehen sich auf reAPI's aktuellen Vertrag; MiniMax-Funktionsbeschreibungen stammen von MiniMax' offizieller Dokumentation. Die Beispiel-Prompts sind Schreibmuster, keine Benchmark-Ergebnisse.
References
- MiniMax API. Video Generation Guide — MiniMax H3 inputs, output, audio, and camera direction. Retrieved August 13, 2026. platform.minimax.io/docs/guides/video-generation
- reAPI. MiniMax H3 API reference — request modes, limits, and billing. Retrieved August 13, 2026. reapi.ai/docs/minimax-h3
- reAPI. MiniMax H3 model page and live pricing. Retrieved August 13, 2026. reapi.ai/models/minimax-h3
Further reading
Autor

Kategorien
Weitere Beiträge

FLUX 3 Video API Kosten: Draft, HD, FHD und Fortsetzung
Berechne FLUX-3-Videokosten für Draft, HD, FHD, Keyframes und Fortsetzung. Der Workflow von Draft bis Final und Gesamtkosten für 5–20 Sekunden.


Das Kontextfenster in Claude: Was zählt bei der Nutzung
Das Kontextfenster in Claude hat 1M Token, aber Werkzeugdefs, beibehaltenes Denken und Cache verbrauchen es alle. Mehr ist nicht automatisch besser.


Claude Fable 5.1 Migrationsleitfaden: Tool-Choice 400 beheben
Migriere von Claude Fable 5 ohne Toolaufrufe zu brechen. Behebe erzwungene Tool-Auswahl, Thinking Blocks, Verlaufskompression und Fallbacks.
