
Document-to-Video API: PDF, PPT, XLS, DOCX oder Webseite
Nutze Wan 3.0 um Videos aus PDFs, Präsentationen, Tabellen oder Webseiten zu generieren—mit Eingabelimits, Kostenrechnung und Anfrage-Beispielen.
Wan 3.0 kann ein PDF, PPT/PPTX, XLS/XLSX, DOC/DOCX, Text- oder Markdown-Datei—oder eine öffentliche Webseite—als Referenz für ein 2–30-Sekunden-Video nutzen. Das Dokumentlimit ist 100 MB und 50 Seiten. Das ist praktisch für Concept-Videos und Zusammenfassungen, aber es ist generative Interpretation, keine pixelgenaue PowerPoint-Export.[1]
Diese letzte Unterscheidung spart viele falsche Erwartungen. Wenn du jeden Slide, jedes Diagramm-Label und jeden Satz exakt reproduziert brauchst, rendere das Deck selbst. Wenn du ein Modell brauchst, das Quellmaterial liest und es in eine kurze visuelle Umsetzung verwandelt, ist Document-to-Video der richtige Job.
Unterstützte Dokument- und Link-Eingaben
Die aktuelle Wan 3.0 API akzeptiert eines der folgenden:
| Input | Unterstützte Formen | Limit |
|---|---|---|
| Office-Dokument | DOCX, DOC, XLSX, XLS, PPTX, PPT | 100 MB, 50 Seiten |
| PDF/Text | PDF, TXT, MD | 100 MB, 50 Seiten wenn zutreffend |
| Apple iWork | Keynote, Pages, Numbers | 100 MB, 50 Seiten |
| Webseite | Öffentliche URL ohne Login | Eine URL |
Nutze file_url für ein Dokument und link_url für eine Webseite. Sie schließen sich gegenseitig aus; das Senden beider wird vor der Generierung abgelehnt.[1]
Die URLs müssen öffentliche HTTP(S)-Links sein. Ein Pfad wie /Users/me/report.pdf, ein privater Google-Drive-Link oder eine Seite hinter einem Login können vom Modell nicht abgerufen werden.
Eine minimale PDF-zu-Video-Anfrage
Lade das Dokument zuerst in den Speicher und sende dann die URL:
curl -X POST https://api.reapi.ai/api/v1/videos/generations \
-H "Authorization: Bearer $REAPI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "wan3.0-video",
"file_url": "https://files.example.com/q3-product-brief.pdf",
"prompt": "Create a 20-second product launch concept. Keep the three claims and the product color from the brief. Use four clear scenes and restrained on-screen text.",
"resolution": "720P",
"duration": 20,
"audio": true
}'Die Antwort ist asynchron und enthält eine Task-ID. Frage GET /api/v1/tasks/{id} ab, bis der Status completed ist; das MP4 erscheint in output.video_urls.[1]
Bei der aktuellen Rate von 720P zu $0,076 pro Sekunde kostet die 20-Sekunden-Anfrage $1,52. Die Dokumentgröße addiert keine zweite Abrechnungseinheit. Auflösung und Ausgabedauer bestimmen die öffentliche Rate.[2]
Webseite-zu-Video nutzt das gleiche Modell
Ersetze file_url mit link_url:
{
"model": "wan3.0-video",
"link_url": "https://example.com/products/travel-backpack",
"prompt": "Make a 15-second vertical product story. Use only features stated on the page. Show the opening, laptop sleeve, and carry-on fit in that order.",
"size": "9:16",
"resolution": "720P",
"duration": 15
}Öffentlich bedeutet abrufbar ohne Cookies, nur-JavaScript-Authentifizierung, Unternehmens-VPN oder regionsabhängigen Login. Eine Seite, die in deinem Browser lädt, kann für einen Remote-Fetcher trotzdem unerreichbar sein.
Gib dem Modell eine redaktionelle Anweisung, nicht "mache ein Video"
Ein Dokument beschreibt mehr, als ein 30-Sekunden-Video zeigen kann. Der Prompt muss dem Modell sagen, was zu bewahren ist und welche Art von Schnitt zu machen ist.
Ein nützlicher Prompt beantwortet fünf Fragen:
- Wer ist die Zielgruppe?
- Welche eine Aussage muss überleben?
- Welche Fakten oder visuellen Assets müssen verwendet werden?
- Welche sollte die Szenreihenfolge sein?
- Was darf nicht erfunden werden?
Für einen Finanzbericht zum Beispiel:
Create a 25-second internal update for employees. Open with revenue growth,
then show the two regions responsible, and finish on the stated Q4 priority.
Do not invent customer names, forecasts, or percentages. Read numbers exactly
as written. Use charts as visual references rather than recreating their labels.Dies garantiert keine perfekten Nummern in generierten Pixeln. Es reduziert Mehrdeutigkeit und gibt Reviewern eine Akzeptanz-Checkliste.
Wann du das Dokument selbst zuerst extrahieren solltest
Die direkte Dokumenteingabe ist schnell, aber Vorverarbeitung ist besser, wenn:
- jede Aussage vor der Generierung genehmigt werden muss;
- das Dokument sensible Seiten enthält, die nicht gesendet werden sollten;
- nur zwei Absätze relevant sind;
- das gewünschte Video länger als 30 Sekunden ist;
- ein Skript, eine Shot-Liste und ein Voice-Over separate Überprüfung brauchen;
- die Quelle dichte Tabellen enthält, die genau erscheinen sollten.
In diesen Fällen extrahiere den genehmigten Text, schreibe einen Szenenplan und sende den endgültigen Prompt plus einen kleinen Satz visueller Referenzen. Der zusätzliche Schritt erstellt einen stabilen Audit-Trail und verhindert, dass ein irrelevanter Anhang die Ausgabe steuert.
Dokumente können mit Referenzmaterial kombiniert werden
Wan 3.0s Referenzfamilie akzeptiert auch bis zu zehn Bilder, fünf kurze Referenzvideos und fünf Audio-Clips. Ein Produktbrief kann daher die Fakten liefern, während Bilder das Produkt definieren und ein kurzer Clip die gewünschte Bewegung definiert.[1]
Halte den Satz klein. Zehn Bilder, die sich in Farbe oder Form widersprechen, sind schlechter als drei klare Ansichten. Benenne die wichtigen Assets im Prompt und erkläre ihre Rolle.
Behandle Remote-Dokumente als Daten, die dein System verlassen
Document-to-Video ist praktisch, weil das Modell eine Datei abrufen und interpretieren kann. Dieses gleiche Verhalten bedeutet, dass die Datei an einen gehosteten Service gesendet wird. Vor dem Einreichen klassifiziere die Quelle und entferne alles, das das Video nicht braucht.
Eine sichere Vorverarbeitungs-Checkliste:
- Lösche versteckte Slides, Speaker Notes, verfolgte Änderungen und Anhänge;
- Exportiere nur das genehmigte Arbeitsblatt oder den Seitenbereich;
- Ersetze Kundennamen und interne Kennungen, wenn sie nicht wesentlich sind;
- Bestätige, dass eine signierte URL spät genug verfällt für den asynchronen Job;
- Vermeide eine öffentliche permanente URL für vertrauliches Material;
- Behalte die genaue Quellversion, die zur Videogenerierung verwendet wird.
Das API-Limit von 50 Seiten ist ein Maximum, keine Empfehlung. Ein dreieitiges genehmigtes Extrakt gibt dem Modell einen klareren Brief und offenbart weniger Informationen als ein 50-seitiges Board-Deck.
Füge nach der Generierung eine faktische Überprüfung hinzu
Das Quelldokument kann den Inhalt leiten, aber das Video bleibt generierte Medien. Überprüfe es gegen ein kurzes Fact Sheet, anstatt nur auf visuelle Qualität zu prüfen.
| Überprüfungselement | Wie man es verifiziert |
|---|---|
| Produkterscheinung | Vergleiche mit genehmigten Referenzbildern |
| Gesprochene Aussagen | Transkribiere die Ausgabe und vergleiche mit dem Brief |
| Text auf dem Bildschirm | Frame für Frame lesen; ersetze ihn in Post, wenn falsch |
| Nummern/Daten | Überprüfe gegen die Quelle, niemals vom Aussehen ableiten |
| Erforderliche Ausschlüsse | Bestätige, dass verbotene Namen, Logos oder Aussagen fehlen |
| Szenreihenfolge | Vergleiche mit der angeforderten Sequenz des Prompts |
Wenn genaue Texte wichtig sind, rendere sie als deterministische Überlagerung nach der Videogenerierung. Das Anfordern von "der gleichen Tabelle, die in der Kalkulationstabelle gezeigt wird" garantiert nicht korrekte Tabellenzellen in den Pixeln.
Teile langes Quellmaterial in eine Videoreihe
Dreißig Sekunden reichen nicht aus, um ein Produkthandbuch, Quartalsbericht oder einen vollständigen Kurs abzudecken. Vermeide es, jeden Abschnitt in einen gehetzten Clip zu quetschen. Zerlege die Quelle in unabhängige Aussagen und gib jedem eine genehmigte Extraktion und visueller Brief.
Zum Beispiel könnte eine Produktseite zu drei Videos werden: das Problem und die Zielgruppe, der Kern-Workflow und Setup oder Preise. Jede Anfrage bleibt auf einen kleinen Teil der Quelle zurückzuführen. Die Serie erstellt auch sauberere Akzeptanzkriterien und lässt einen fehlgeschlagenen Abschnitt neu generiert werden, ohne den Rest zu bezahlen.
Die Aufteilung sollte der Leserintention folgen, nicht der Dokumentpaginierung. Folie 1–10 ist selten eine bedeutungsvolle Episode allein.
Häufige Fehlstellen
| Symptom | Wahrscheinliche Ursache | Behebung |
|---|---|---|
| Anfrage sofort abgelehnt | Beide file_url und link_url wurden gesendet | Behalte eine |
| URL funktioniert nur in deinem Browser | Login, Cookies oder privates Netzwerk erforderlich | Nutze eine öffentliche signierte URL oder genehmigten Speicher |
| Video ignoriert eine Schlüsselaussage | Quelle ist zu breit für die Dauer | Benenne die Aussage und Szenreihenfolge im Prompt |
| Zahlen auf dem Bildschirm sind falsch | Generatives Video zeichnet Text neu | Füge exakten Text in Post ein oder nutze eine deterministische Überlagerung |
| Ausgabe wirkt wie eine generische Anzeige | Prompt definiert nicht Zielgruppe oder Beweise | Geben Sie Zielgruppe, erforderliche Fakten und Ausschlüsse an |
Die vollständige Feldliste befindet sich in der Wan 3.0 API-Dokumentation, und die aktuelle Rate Card ist auf der Wan 3.0 Modellseite.
Referenzen
- reAPI Wan 3.0 API documentation, accessed August 23, 2026.
- reAPI Wan 3.0 model and pricing page, accessed August 23, 2026.
- Alibaba Cloud, "Wan 3.0: 30-Second AI Video Generation from Any Input", 2026.
Autor

Kategorien
Weitere Beiträge

Wan 2.7 Video API: 1080p, Audio, Preise und Limits (2026)
Wan-2.7-Video-API für Text-, Bild-, Referenz- und Video-Bearbeitungs-Workflows: 1080p-Preise, Audio-Steuerung, 2–15s-Limits und Beispielcode.


KI-Musikvideo-API: Vollständige Videos aus Song und Bildern
Vollständiges Musikvideo aus einem Song und bis zu sieben Referenzbildern – API-Beispiele, Untertiteloptionen und genaue Kostentabellen für jede Auflösung.


FLUX 3 Video API Kosten: Draft, HD, FHD und Fortsetzung
Berechne FLUX-3-Videokosten für Draft, HD, FHD, Keyframes und Fortsetzung. Der Workflow von Draft bis Final und Gesamtkosten für 5–20 Sekunden.
