Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
KI-Videokamera-Bewegungen mit einer Telefonreferenz steuern
2026/08/27

KI-Videokamera-Bewegungen mit einer Telefonreferenz steuern

Erfasse natürliche Kamerabewegung mit deinem Telefon, wandle sie in eine Referenz um und lenke dein KI-Videomodell ohne 3D-Animation zu erlernen.

Eine Referenz für Telefonkamerabewegungen zeigt einem KI-Videomodell, wie sich die Kamera bewegen soll, anstatt es aufzufordern, Wörter wie „handheld" oder „cinematisch" zu interpretieren. Du erfasst zuerst den Weg, die Geschwindigkeit, die Pausen und die kleinen menschlichen Unvollkommenheiten. Das Videomodell nutzt dann diesen Clip als Bewegungsleitfaden, während die Eingabe und statische Referenzen das endgültige Motiv und den visuellen Stil definieren.

Du brauchst kein fertiges Set oder einen polierten Referenzfilm. Ein Raum, ein paar Kartons und eine Person als Stand-in für das Motiv genügen. Dieses Tutorial behandelt auch einen optionalen AR-Workflow für Creator, die eine virtuelle Szene auf einem iPhone blockieren möchten.

TL;DR

  • Entscheide den Start-Frame, End-Frame und eine Kamerabewegung, bevor du aufnimmst.
  • Nutze einen Stand-in oder einfache Objekte, um die Position und Größe des Motivs zu zeigen.
  • Nimm langsam in einem hellen, strukturierten Raum auf, damit das Device-Tracking und visuelle Merkmale klar bleiben.
  • Schneide die Referenz auf eine saubere Bewegung; entferne versehentliche Umrasterungen am Anfang und Ende.
  • Sage dem Modell, was es aus dem Video kopieren und was es ignorieren soll.
  • Überprüfe Weg, Geschwindigkeit, Bildkomposition, Parallaxe und Motivkontakt separat vom visuellen Stil.

Anfänger-Telefonkamerabewegungsworkflow von blockierter Szene über aufgenommene
Referenz bis zur KI-Generierung und Bewegungsüberprüfung

Warum eine Bewegungsreferenz besser funktioniert als Kamera-Adjektive

Text ist nützlich zum Benennen einer Einstellung. Er ist weniger präzise beim Beschreiben des vollständigen Wegs einer von Menschen gesteuerten Kamera. „Slow handheld push-in" lässt mehrere Entscheidungen offen: die Gehgeschwindigkeit, Höhe, Seitendrift, der Moment der Verzögerung, die Menge an Vibration und wo das Objektiv stoppt.

Ein Referenz-Clip enthält diese Entscheidungen als Bewegung. ByteDance beschreibt Seedance-Videoreferenzen als Mittel zur Anleitung von Bildkomposition, Kamerasprache und Bewegungsrhythmus.[1] Die generierte Aufnahme ist keine Frame-by-Frame-Kopie, aber das Modell hat eine konkrete Flugbahn zum Befolgen.

Stell dir die Eingaben als getrennte Abteilungen vor:

EingabeHauptrolle
TelefonreferenzvideoKameraweg, Geschwindigkeit, Pause, Vibration, räumlicher Rhythmus
Start- oder StilbildCharakter, Produkt, Kleidung, Palette, Beleuchtung
EingabeaufforderungSzenenbedeutung, Aktion, Einschränkungen, was jede Referenz steuert
Audioreferenz, wenn genutztTiming, Stimme, Musik oder Soundcharakter

Je klarer diese Rollen sind, desto einfacher ist es, einen Fehler zu diagnostizieren.

Wähle eine von zwei anfänglichen Aufnahmemethoden

Methode A: Drehe eine physische Blockade

Das ist der schnellste Weg. Stelle einen Stuhl, eine Schachtel, eine Lampe oder einen Freund dorthin, wo das endgültige Motiv sein wird. Gehe mit dem Telefon die beabsichtigte Kamerabewegung ab und nimm sie auf. Die Objekte müssen nicht wie die endgültige Szene aussehen; sie müssen nur Position, Größe und Okklusion bewahren.

Nutze diese Methode für:

  • einen Push auf ein Produkt auf einem Tisch;
  • eine handheld-Umkreisung um einen Performer;
  • eine Enthüllung hinter einer Wand oder einem Vordergroundobjekt;
  • eine niedrige Tracking-Bewegung neben einem beweglichen Motiv;
  • eine Rack-ähnliche Umrasterung von Vordergrund zu Hintergrund.

Methode B: Erfasse eine virtuelle Blockade mit AR

Ein AR-Tool kann Stand-ins in einer virtuellen Szene platzieren und die physische Telefonbewegung in einen aufgenommenen Kameraweg übersetzen. Das Open-Source-Projekt Film Space bietet beispielsweise ein SwiftUI-Virtual-Studio mit Figurenstand-ins, Objektivvoreinstellungen, Szenenblockierung, Kameramodus und Aufnahme.[2]

Diese Route erfordert mehr Einrichtung, da du eine kompatible Apple-Entwicklungsumgebung und ein Gerät benötigst. Der Vorteil ist, dass du eine Aufnahme üben kannst, wenn der physische Ort oder das Motiv nicht vorhanden ist.

ARKit kombiniert Kameraanalyse mit Bewegungserkennung, um die Gerätebewegung zu schätzen. Apple empfiehlt sichtbare Szendetails, vorhersehbare Beleuchtung und kontrollierte Bewegung; dunkle Räume, leere Flächen, Unschärfe oder sehr schnelle Bewegung können die Tracking-Qualität verringern.[3]

Wenn du absolut neu bist, beginne mit einer physischen Blockade. Wechsle zu AR nur, wenn du virtuelle Stand-ins oder wiederholbare räumliche Marken brauchst.

Schritt 1: Schreibe eine Kamerabewegungskarte

Fang nicht an zu laufen, bis die Aufnahme einen definierten Anfang und Ende hat.

{
  "shot": "product reveal",
  "duration": "6 seconds",
  "start_frame": "wide, product hidden behind foreground box",
  "path": "move 1.5 meters right while advancing 0.5 meters",
  "height": "chest height, constant",
  "subject_rule": "product becomes centered at 4 seconds",
  "end_frame": "medium close view, hold for 1 second",
  "shake": "small natural walking drift",
  "avoid": "fast rotation, digital zoom, subject leaving frame"
}

Diese Karte verhindert ein häufiges Anfängerproblem: eine interessante Bewegung zu erfassen, die nicht auf einem editierbaren Frame endet.

Schritt 2: Blockiere das Motiv und den Vordergrund

Stelle einen Stand-in an die endgültige Motivposition. Stimme Höhe und Breite ungefähr ab. Wenn die endgültige Szene einen Tisch, eine Tür oder eine Vordergrundoffenbarung hat, beziehe ein einfaches Objekt in die gleiche Tiefe ein.

Markiere drei Bodenpositionen mit abnehmbarem Klebeband:

  1. Kamerabeginn;
  2. der Punkt, an dem die Enthüllung stattfindet;
  3. Kameraende.

Das Modell braucht Parallaxe-Hinweise, um Tiefe zu verstehen. Eine einzelne Person gegen eine weiße Wand zeigt weniger räumliche Informationen als eine Person mit Vordergrund-, Mittelgrund- und Hintergrundobjekten.

Schritt 3: Erfasse einen sauberen Take

Stelle das Telefon in Querformat für eine 16:9-Ausgabe oder im Hochformat für eine 9:16-Ausgabe. Halte die Objektivauswahl während der Bewegung fest. Vermeide digitales Zoomen, da es Objektivwechsel mit physischer Bewegung vermischt.

Nutze diese Probe-Sequenz:

  1. Bleibe eine Sekunde lang am Start stehen.
  2. Fang an, dich allmählich zu bewegen, anstatt ruckartig in die Bewegung zu gehen.
  3. Halte das Telefon auf der geplanten Höhe.
  4. Schau auf die Motivbildkomposition, nicht auf deine Füße.
  5. Verringere die Geschwindigkeit vor der letzten Marke.
  6. Halte den End-Frame eine Sekunde lang.

Nimm drei Takes auf. Die beste Referenz ist normalerweise die einfachste, nicht die dramatischste. Wenn ein schneller Whip-Pan oder aggressives Zittern wesentlich ist, teste es nur, nachdem eine kontrollierte Version erfolgreich ist.

Schritt 4: Bereite den Referenz-Clip vor

Schneide den Clip so, dass er absichtliche Halten, Bewegung und End-Halten enthält. Entferne den Moment, in dem du zum Aufnahmeknopf greifst. Mute den Ton, es sei denn, er enthält Timing-Informationen, die das Modell nutzen soll.

Überprüfe dann:

  • Ist das Motiv durchgehend sichtbar oder klar vertreten?
  • Stoppt die Kamera auf der geplanten Bildkomposition?
  • Ist der Horizont stabil genug für den beabsichtigten Stil?
  • Gibt es versehentliche Personen, Bildschirme oder private Details im Bild?
  • Ist die Datei über eine öffentliche HTTPS-URL für die API-Anfrage verfügbar?

Lade keine privaten oder identifizierbaren Inhalte hoch, es sei denn, du hast das Recht, sie zu nutzen. Eine Blockade mit Objekten ist oft sicherer als die Aufnahme einer unabhängigen Person.

Schritt 5: Schreibe eine Referenzrolle-Eingabeaufforderung

Die Eingabeaufforderung sollte sagen, was das Modell von jeder Eingabe ausleihen darf.

Video 1 is camera-motion guidance only. Follow its camera path, speed,
foreground reveal, and one-second ending hold. Ignore its room appearance,
objects, colors, and lighting.

Image 1 defines the product shape, label layout, and color. Preserve the product
throughout. The final scene is a warm studio table with a dark blue background.

The camera begins wide behind a soft foreground shape, moves right and slightly
forward, reveals the product at 4 seconds, then holds on a centered medium close
view. No added text, logos, hands, or extra products. No digital zoom.

Der Satz „camera-motion guidance only" ist wichtig. Ohne ihn könnte das Modell das Aussehen, die Beleuchtung oder das Aussehen des Blockade-Stand-ins der Blockade ausleihen.

Schritt 6: Sende die Referenz an das Videomodell

Seedance 2.5 auf reAPI akzeptiert öffentliche Videoreferenzen. Halte den ersten Test kurz und nutze 720p, bis die Bewegung genehmigt wird.

curl https://reapi.ai/api/v1/videos/generations \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "doubao-seedance-2.5-face",
    "prompt": "Video 1 is camera-motion guidance only. Follow its path, speed, foreground reveal, and ending hold. Ignore its room and objects. Image 1 defines the product. Warm studio table, dark blue background. Preserve product geometry. No added text or logos.",
    "video_urls": ["https://example.com/phone-camera-reference.mp4"],
    "image_urls": ["https://example.com/product-reference.png"],
    "resolution": "720p",
    "size": "16:9",
    "duration": 6,
    "generate_audio": false
  }'

Die aktuelle reAPI-Route erlaubt mehrere Bild- und Videoreferenzen mit Datei-, Dauer- und Gesamteingabelimits dokumentiert auf der Seedance-2.5-API-Seite. Überprüfe diese Seite vor dem Aufbau der Upload-Validierung, da Grenzen und Preise zeitempfindlich sind.

Schritt 7: Überprüfe die Bewegung vor dem Aussehen

Vergleiche den generierten Clip mit der Referenz Seite an Seite. Ignoriere Farbe und feine Textur beim ersten Durchgang.

ÜberprüfungFrage
WegIst die Kamera in die gleiche allgemeine Richtung und Tiefe gereist?
GeschwindigkeitHat sie zu den gewollten Momenten beschleunigt, gesteuert und gestoppt?
BildkompositionIst das Motiv im geplanten Bildbereich geblieben?
ParallaxeHaben sich Vordergrund und Hintergrund natürlich getrennt?
HorizontIst die Neigung absichtlich und nicht versehentlich?
End-FrameGibt es eine saubere Halten, die einen Schnitt oder Titel akzeptieren kann?

Wenn die Bewegung falsch ist, vereinfache die Referenz oder stelle die kopierten Attribute expliziter dar. Wenn die Bewegung richtig ist, aber das Produkt driftet, behalte die Bewegungsreferenz und verstärke den Produktanker. Löse nicht beide Probleme, indem du eine völlig andere Bewegung aufnimmst.

Fehlerbehebung

Der generierte Shot kopiert den Blockade-Raum

Sage, dass das Video nur Bewegungsleitfaden ist, beschreibe die Ersatzumgebung und gebe ein starkes Stil- oder Startbild. Eine visuell überlastete Blockade kann die neue Szene auch überwältigen, also verwende einfache Objekte und neutrale Beleuchtung.

Die Bewegung ist zu schnell

Nimm einen langsameren Take mit einem längeren Start und Ende auf. Geschwindigkeitanweisungen in Text können helfen, aber eine langsamere Referenz bringt klarere Timing.

Der Kameraweg funktioniert, aber das Motiv gleitet

Verbessere Tiefenhinweise in der Blockade und füge einen klaren Motivstand-in hinzu. Sage, ob das Motiv stationär ist, läuft oder an der Kamerabewegung befestigt ist.

Die Ausgabe sieht verwackelt aus

Unterscheide absichtliches handheld-Zittern von versehentlicher Vibration. Gehe Ferse-Zehe, halte die Ellbogen entspannt und entferne plötzliche Handgelenkskorrektionen. Wenn du stärkeres Zittern willst, füge es hinzu, nachdem der Basispfad funktioniert.

AR-Tracking springt

Gehe in helleres Licht, beziehe strukturierte Oberflächen ein, verringere die Geschwindigkeit und vermeide, die Kamera auf eine weiße Wand zu richten. Diese Bedingungen stimmen mit Apples World-Tracking-Anleitung überein.[3]

FAQ

Kann ich ein normales Telefondvideo als Referenz aufnehmen?

Ja. Eine physische Blockade genügt oft. Halte das räumliche Layout einfach und sage dem Modell, dass es Bewegung anstelle des Raums oder der Objekte kopieren soll.

Brauche ich ein iPhone?

Nein für normale Referenzaufnahmen. Der hier beschriebene optionale AR-Workflow nutzt ARKit und daher ein Apple-Gerät, aber eine normale Kamerareferenz kann auf anderen Telefonen aufgenommen werden.

Sollte die Referenz den echten Schauspieler oder das Produkt enthalten?

Nicht unbedingt. Stand-ins reduzieren Datenschutz- und Lizenzbedenken. Nutze separate Identitätsbilder für das Endmotiv, wenn das Modell diese unterstützt.

Entspricht der generierte Kameraweg genau?

Nein. Behandle die Referenz als starken Leitfaden, nicht als deterministische Motion Capture. Überprüfe das Ergebnis und rechne mit gewisser Variation.

Ist eine Telefonreferenz besser als Blender?

Telefonaufnahmen sind schneller für natürliche handheld-Bewegungen. Blender ist besser für wiederholbare Wege, unmögliche Bewegungen, exakte räumliche Blockierung und Teambewertung. Das Blender-Kameraviz-Tutorial behandelt diesen Weg.

Fazit

Eine Telefonkamerabewegungsreferenz gibt einem KI-Video-Workflow etwas, das die Eingabesprache nicht vollständig ausdrücken kann: einen ausgeführten Weg mit echtem Timing und menschlicher Bewegung. Halte die Blockade einfach, definiere, was das Modell kopieren soll, und beurteile die Bewegung vor dem visuellen Polieren. Sobald der Weg funktioniert, nutze die gleiche Referenz mit verschiedenen Motiven und Stilen erneut, anstatt die Bewegung in jeder Eingabeaufforderung neu zu entdecken.

Referenzen

  1. ByteDance Seed. Seedance 2.0 Official Launch. 12. Februar 2026. seed.bytedance.com
  2. Max Prokopp. Film Space: SwiftUI virtual film studio with AR camera and scene recording. Abgerufen 27. August 2026. GitHub
  3. Apple Developer Documentation. Understanding World Tracking. Abgerufen 27. August 2026. developer.apple.com
  4. reAPI. Seedance 2.5 API — Parameters, Modes & Billing. Abgerufen 27. August 2026. reapi.ai