GPT Image 2.5 is live — OpenAI's newest image model, targeted edits that leave the rest of the frame alone
KI-Videogenerator mit echten Personen: Was wirklich klappt
2026/08/09

KI-Videogenerator mit echten Personen: Was wirklich klappt

Echte Personen in KI-Videos nutzen: zulässige Referenzen, native Dialogoptionen, dokumentierte Eingabegrenzen sowie Prüfung, Ablehnung und Kosten.

Kann ein KI-Videogenerator mit echten Personen arbeiten? Ja, wenn die abgebildete Person zugestimmt hat und die gewählte Route Referenzen mit echten Personen ausdrücklich unterstützt. Danach müssen Sie Eingabe, Spracherzeugung, Prüfung und Kosten des Auftrags klären.

Die nützliche Unterscheidung beginnt nicht beim Tool, sondern bei der Identität. Das Foto einer zustimmenden Person, eine synthetische Figur und eine namentlich genannte Person sind rechtlich und technisch verschiedene Eingaben. Dieser Leitfaden erklärt die dokumentierten Wege, die Anforderungen für Dialog und die Prüfungen nach einer abgelehnten Referenz.

TL;DR

  • Referenzfotos und Clips von echten Personen werden unterstützt. Die Parameterreferenz von Seedance 2.5 besagt deutlich, dass „Referenzbilder / Videos echte Personen enthalten können."[1]
  • Abgelehnte Referenzmaterialien erstatten vollständig Kosten. Material wird vor der Generierung automatisch überprüft, und alles, was abgelehnt wird, schlägt fehl mit einem Fehler und einer vollständigen Rückerstattung der Reserve.[2]
  • Sprechen ist eine separate Fähigkeit. Seedance 2.5 generiert „synchronisierte Sprache, Soundeffekte und Hintergrundmusik" mit generate_audio, standardmäßig aktiviert.[1] Kling 3.0 dokumentiert Lippensynchronisation explizit.[3]
  • Benannte Prominente werden auf jeder Route abgelehnt. Das ist die eigene Linie des Modells, nicht eine Plattformrichtlinie, und kein Parameter erreicht sie.
  • Zustimmung liegt immer noch bei Ihnen. Eine API, die einen Upload akzeptiert, hat auf Ihrem Namen keine Erlaubnis erworben.

Vier verschiedene Anfragen mit einem Suchbegriff

Ihr eigenes Material oder ein zustimmendes Motiv. Dies ist der größte legitime Fall: Gründer in ihren eigenen Produktdemos, UGC-Ersteller, Schauspieler, die eine Freigabe unterzeichnet haben, ein Kunde, dessen Markenvideo Sie erstellen. Es wird unterstützt, und der Rest dieses Artikels handelt größtenteils davon.

Eine synthetische Person, deren Referenz abgelehnt wird. Die Fehlermeldung allein zeigt weder, wie das Bild bewertet wurde, noch welche interne Prüfung entschieden hat. Prüfen Sie die dokumentierten Eingabeanforderungen und das Prüfergebnis, bevor Sie eine Ursache annehmen.

Eine benannte öffentliche Person. Abgelehnt. Nicht von reAPI als Richtlinie, sondern vom Modell auf jedem Host, der es weiterverkauft. Jede Plattform, die sonst wirbt, irrt sich entweder oder verkauft Ihnen ein Ähnlichkeitsrechte-Problem.

Personen sprechen. Eine Fähigkeitsfrage eher als eine Berechtigungsfrage, und sie wird durch die Wahl des Modells beantwortet, nicht durch die Wahl der Plattform.

Trennen Sie diese Fälle bei der Fehlersuche. Eine unterstützte Personenreferenz, eine abgelehnte synthetische Referenz und eine Anfrage nach einer namentlich genannten Person erfordern unterschiedliche nächste Schritte.

Ein zustimmendes Motiv als Referenz verwenden

Der unterstützte Weg ist Referenzmaterial, nicht die Beschreibung eines Bildes. Seedance 2.5 nimmt bis zu 30 Referenzbilder, 10 Referenzclips und 10 Audiotracks in einer Generierung.[1]

curl https://reapi.ai/api/v1/videos/generations \
  -H "Authorization: Bearer rk_live_your_key" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "doubao-seedance-2.5-face",
    "prompt": "@Image1 walks through a sunlit workshop, handheld follow",
    "resolution": "720p",
    "duration": 8,
    "image_urls": ["https://your-cdn.example.com/subject-01.jpg"]
  }'

Die Einschränkungen, die Sie vor der Zusammenstellung eines Referenzsatzes kennen sollten:[1]

FeldLimitFormate
image_urlsbis zu 30, jeweils unter 30 MBjpeg, png, webp, bmp, tiff, gif, heic, heif
video_urlsbis zu 10, jeweils 2–30 s, unter 200 MB, kombiniert 30 smp4, mov, 480p to 4K
audio_urlsbis zu 10, jeweils 2–30 s, unter 15 MBwav, mp3

Zwei Regeln überraschen Leute. Jede Referenz muss eine öffentliche HTTP(S)-URL sein; Base64 und data:-Payloads werden auf der ganzen Plattform abgelehnt, nicht nur bei diesem Modell.[1] Und image_urls können nicht mit image_with_roles kombiniert werden, daher sind Charakterreferenzen und Verkettung von Erst-/Letztbild separate Modi.[1]

Referenzmaterial wird vor der Generierung automatisch geprüft. Wird es abgelehnt, endet die Aufgabe mit einem Fehler und der reservierte Betrag wird vollständig erstattet.[2] Ein abgelehnter Versuch kostet damit Zeit, nicht diesen Betrag.

Sie zum Sprechen bringen

Dies ist, wo die Modellwahl mehr zählt als die Plattformwahl, und die beiden dokumentierten Optionen verhalten sich unterschiedlich.

Seedance 2.5 generiert Audio nativ. generate_audio standardisiert auf true und produziert „synchronisierte Sprache, Soundeffekte und Hintergrundmusik (Mono)."[1] Die Sprache wird mit dem Video generiert, nicht dubben, sodass Mundbewegung und Audio aus dem gleichen Durchgang stammen. Sie lenken das durch den Prompt.

Kling 3.0 dokumentiert die Fähigkeit genauer und beschreibt synchronisiertes natives Audio als „Dialog, Lippensynchronisation, Umgebungston."[3] Wenn die Genauigkeit der Lippensynchronisation im Dialog das ist, worüber Sie beurteilt werden, ist das die explizite Behauptung zum Testen.

Was keiner bietet, ist ein Dubbing-Modus, in dem Sie eine fertige Voice-Spur liefern und genaue Mundformabstimmung dazu erhalten. Seedance 2.5s audio_urls werden als Referenz-Audiotracks dokumentiert,[1] was ein anderer Job als Lippensynchronisations-Fahren ist. Wenn Ihre Pipeline bereits aufgezeichnetes VO hat, testen Sie diese Annahme auf einem kurzen Clip, bevor Sie danach bauen.

Ein praktischer Hinweis für Sprechkopf-Arbeit: Audio überlebt Segmentierung nicht. Jede Generierung synthetisiert ihre eigene Spur, daher gibt eine aus mehreren Clips zusammengesetzte Sequenz Ihnen mehrere unabhängige Audiobetten. Für Dialog länger als eine Generierung, nehmen Sie die Stimme separat auf oder synthetisieren Sie und behandeln Sie das Video als nur Bild.

Die Linie, die sich nicht bewegt

Benannte lebende Personen werden abgelehnt. Jede ehrliche Route setzt das durch, und es sitzt mit dem Modell, nicht mit irgendeinen Plattformeinstellungen. Wenn ein Host sonst behauptet, ist die richtige Antwort Verdacht, nicht eine Anmeldung.

Dritte Charaktere werden auch abgelehnt. Der gleiche Check erfasst erkennbare urheberrechtlich geschützte Charaktere, was eine wiederkehrende Frustration für Anime und Fan-Arbeit ist und keine verlegerische Lösung hat.

Zustimmung wird nicht durch ein Upload-Formular übertragen. Die API, die Ihr Referenzfoto akzeptiert, ist keine Erlaubnis von der Person darin. Freigaben, Ähnlichkeitsrechte und, in mehreren Rechtsordnungen, biometrische Datenregeln sind Ihre Verantwortung und werden nicht der Plattform, weil eine Anfrage 200 zurückgab.

Das letzte ist keine Rechtsboilerplate. Es ist der Grund, warum der unterstützte Weg überhaupt existiert: Der Check soll den nicht-konsensualen Fall verhindern, und er funktioniert besser, wenn der legitime Fall einen Platz zum Gehen hat.

Wenn eine synthetische Referenz abgelehnt wird

Eine Ablehnung zeigt nicht, ob der Inhalt, das Format oder eine andere Prüfregel den Ausschlag gab. Leiten Sie aus dem Wortlaut keinen internen Mechanismus ab. Prüfen Sie zuerst URL, Dateityp, Größe, Dauer und Feldkombination anhand der veröffentlichten Parameterreferenz.[1]

Wenn die Eingabe gültig ist, aber die automatische Prüfung sie weiterhin ablehnt, behandeln Sie das Ergebnis als Moderationsentscheidung und nicht als Beweis für die Herkunft des Bildes. Verwenden Sie eine andere zulässige Referenz oder ein Modell mit einer passenderen dokumentierten Eingaberichtlinie. Der Leitfaden zu Face-Detected-Fehlern trennt Eingabevalidierung und Prüfung, ohne über interne Systeme zu spekulieren.

Was kostet es

Referenzgetriebene Arbeit wird wie jede andere Generierung mit Seedance 2.5 bepreist, mit einer Besonderheit. Referenzbilder und Audio ändern den Tarif nicht; ein Referenz-Video aktiviert den niedrigeren Sekundentarif. reAPI berechnet dann max(Ausgabe + ceil(Gesamtdauer der Quellvideos), ceil(5 / 3 × Ausgabe)) Sekunden.[2]

Job, 720pKosten
8 s aus Referenzbildern$2.135
30 s aus Referenzbildern$8.005
10 s Referenzclip zu 5 s Ausgabe$2.402

Die Werte nutzen die veröffentlichten Sekundentarife und die einmalige Aufrundung der gesamten Anfrage auf volle Credits.[2] Eine fehlgeschlagene Moderationsprüfung wird vollständig erstattet, sodass explorative Referenzsätze Zeit statt Credits kosten.

FAQ

Kann ich einen KI-Videogenerator mit echten Personen verwenden?

Ja, mit Referenzmaterial eines zustimmenden Motivs. Die Parameterreferenz von Seedance 2.5 gibt an, dass Referenzbilder und Videos echte Personen enthalten können.[1]

Kann ich eine berühmte Person generieren?

Nein. Benannte öffentliche Personen werden auf Modell-Ebene auf jeder Route abgelehnt, und kein Parameter ändert das.

Welches Modell handhaby Menschen sprechen?

Seedance 2.5 generiert synchronisierte Sprache neben dem Video mit generate_audio.[1] Kling 3.0 dokumentiert Dialog und Lippensynchronisation explizit.[3]

Kann ich meine eigene Sprachaufzeichnung liefern und Lippensynchronisation dafür erhalten?

Nicht als dokumentierter Modus. Seedance 2.5s audio_urls sind Referenztracks statt eines Lippensynchronisations-Fahrers.[1] Testen Sie es auf einem kurzen Clip, bevor Sie eine Pipeline danach auslegen.

Warum wurde mein KI-generierter Charakter als echte Person abgelehnt?

Die Meldung verrät den internen Grund nicht. Prüfen Sie zuerst URL, Format, Größe und Feldkombination; sind sie gültig, behandeln Sie das Ergebnis als Ablehnung der Prüfung. Der Face-Detected-Leitfaden enthält eine dokumentationsbasierte Checkliste.

Werden mir Gebühren berechnet, wenn eine Referenz abgelehnt wird?

Nicht auf reAPI. Eine Aufgabe, die Überprüfung schlägt, erstattet die Reserve vollständig.[2]

Kann ich die Referenzdatei direkt hochladen?

Nein. Jede Referenz muss eine öffentliche HTTP(S)-URL sein. Base64 und data:-Payloads werden plattformweit abgelehnt.[1]

Wie viele Referenzbilder kann eine Generierung aufnehmen?

Bis zu 30, plus 10 Clips und 10 Audiotracks.[1]

Mit Gesichtern arbeiten statt um sie herum

Klären Sie vor der Toolwahl, um welche der vier Anfragen es geht. Eine zustimmende Person und ein gültiger Referenzsatz bilden einen unterstützten Ablauf mit veröffentlichten Parametern und Rückerstattung bei Ablehnung. Bei einer abgelehnten synthetischen Referenz prüfen Sie Eingabe und Moderation, statt über einen verborgenen Klassifizierer zu spekulieren. Dialog bleibt eine Modellwahl mit zwei dokumentierten Optionen.

Nur die vierte Anfrage, eine benannte Person, die nicht zugestimmt hat, hat keine Route, und das ist wert, zu verteidigen, nicht zu umgehen. Ein KI-Videogenerator mit echten Personen ist ein normales Tool, wenn die Personen ja sagten, und der Grund der unterstützte Weg offen bleibt, ist, dass der nicht unterstützte bleibt geschlossen.

Vollständige Parameterreferenz unter reapi.ai/docs/seedance-2-5; aktuelle Raten auf der Seedance 2.5 Modellseite.

Referenzen

  1. reAPI. doubao-seedance-2.5-face — request body, reference limits, generate_audio and platform media rules. Retrieved August 2026 from reapi.ai/docs/seedance-2-5
  2. reAPI. Seedance 2.5 — model page, real-person reference support, published rates and refund behaviour. Retrieved 9 August 2026 from reapi.ai/models/seedance-2-5
  3. reAPI. Kling 3.0 — native audio with dialogue and lip sync. Retrieved August 2026 from reapi.ai/docs/kling-3-0

Weitere Ressourcen