GPT Image 2.5 is live — OpenAI's newest image model, targeted edits that leave the rest of the frame alone

deepseek-v4.1-flash — 1M Kontext, 384K Output, Vision

deepseek-v4.1-flash ist DeepSeeks V4.1-Flash-Modell auf reAPIs OpenAI-kompatiblem Chat-Endpunkt. deepseek-v4.1-flash liest ein Kontextfenster von 1M Tokens, kann in einer einzigen Antwort bis zu 384.000 Tokens schreiben, denkt standardmäßig nach mit drei echten Effort-Stufen und nimmt Bilder neben Text an. Die aktuellen Raten für deepseek-v4.1-flash stehen in der Preistabelle auf dieser Seite.

Kernmerkmale
1M Kontext · 384.000 Max-Output · Vision · Thinking standardmäßig aktiv
Geeignet für
Lange Dokumente, Repository-Analyse, Diagramm- und Screenshot-Auswertung
Eingabe
Chatnachrichten, Text und Bilder (OpenAI-kompatibel)
Ausgabe
Text, optionales Streaming
DeepSeek V4.1 Flash

DeepSeek V4.1 Flash fragen

Beginne mit dem Text im Eingabefeld oder wähle ein Beispiel.

Enter zum Senden · Umschalt+Enter für eine neue Zeile

Preise

Credit-basiert — 1 Credit = 0,001 USD. Du zahlst nur für erfolgreich abgeschlossene Generierungen.

Kosten des ersten Tests
$0.00171.7 credits

Ein 1K-Token-Prompt mit einer 1K-Token-Antwort in der günstigsten Stufe.

Testbudget-Leitfaden
Credits aufladen
$10
≈ 5882 Tests
$50
≈ 29411 Tests
$100
≈ 58823 Tests
Input
$0.400
Preis · 1M tokens
Output
$1.300
Preis · 1M tokens
Cache-Lesevorgang
$0.015
Preis · 1M tokens

Was ist deepseek-v4.1-flash?

deepseek-v4.1-flash ist DeepSeeks V4.1-Flash-Gewichte, bereitgestellt über reAPIs OpenAI-kompatiblen /api/v1/chat/completions-Endpunkt. DeepSeeks eigene Models-und-Pricing-Tabelle gibt der Flash-Linie ein Kontextfenster von 1M Tokens, ein dokumentiertes Maximum von 384K Output-Tokens, Vision, JSON-Output, Tool Calls sowie sowohl einen Thinking- als auch einen Non-Thinking-Modus. Standardmäßig ist Thinking bei hohem Effort aktiv. Ungewöhnlich für seine Klasse ist die Output-Seite: Die meisten schnellen Modelle deckeln die Generierung weit unter ihrem Kontextfenster, während deepseek-v4.1-flash bis zu 384.000 Tokens weiterschreiben kann — genau das, was ein vollständiger Übersetzungsdurchlauf oder ein dateiweises Refactoring wirklich braucht. Abgerechnet wird pro Token aus deinem reAPI-Guthaben, wobei Input, Output und Cache-Lesevorgänge jeweils ihre eigene Rate haben.

Was du mit diesem Modell bauen kannst

Echte Workflows und produktionsreife Use Cases, die du mit diesem Modell bauen und ausliefern kannst.

deepseek-v4.1-flash verarbeitet ein langes Dokument in einem einzigen Durchlauf

Vollständige Dokument- und Repository-Durchläufe

Ein Kontextfenster von 1M Tokens ist nur die halbe Miete bei einer langen Aufgabe; die andere Hälfte ist, die Antwort auch ausschreiben zu dürfen. deepseek-v4.1-flash kombiniert dieses Fenster mit einer Output-Obergrenze von 384.000 Tokens, sodass ein übersetztes Handbuch, eine umgeschriebene Testsuite oder ein klauselweiser Vertragsreview in einer einzigen Antwort zurückkommen kann, statt in Stücke zerlegt, zusammengesetzt und abgeglichen zu werden. Weil deepseek-v4.1-flash bei jeder Kontextlänge gleich viel kostet, überschreitet ein langer Prompt keine Schwelle, die die Rate mitten in der Aufgabe ändert. Setze max_tokens bei solchen Aufgaben bewusst — sonst verwendet deepseek-v4.1-flash den Endpunkt-Standard statt der Obergrenze.

API-Dokumentation lesen
deepseek-v4.1-flash liest ein Diagramm und einen Screenshot

Diagramme, Screenshots und gescannte Seiten

deepseek-v4.1-flash nimmt Bilder über denselben Endpunkt und dieselbe Request-Form wie Text entgegen. DeepSeek unterstützt JPEG, PNG, GIF und WebP und erkennt das Format anhand der tatsächlichen Bytes der Datei statt anhand ihres Namens oder des deklarierten MIME-Typs, sodass auch ein falsch beschrifteter Upload funktioniert. Schicke ein Bild an deepseek-v4.1-flash inline als base64-Data-URL, als öffentlichen http(s)-Link, den das Modell für dich abruft, oder als Files-API-Handle. Damit sind die zwei Formen abgedeckt, in denen diese Arbeit normalerweise anfällt: ein lokaler Screenshot und eine URL, die schon in deiner Pipeline liegt.

deepseek-v4.1-flash verwandelt ein gescanntes Formular in strukturiertes JSON

Strukturierte Extraktion, die strukturiert bleibt

DeepSeek dokumentiert JSON-Output und Tool Calls als unterstützte Features der Flash-Gewichte, daher ist die Bitte an deepseek-v4.1-flash um maschinenlesbaren Output ein Vertrag und kein Prompt-Trick. In Kombination mit Vision macht das deepseek-v4.1-flash geeignet dafür, gescannte Rechnungen, Dashboards und Formulare in Zeilen zu verwandeln. Ein Vorbehalt, den du kennen solltest, bevor du die Schleife baust: Trägt ein Request tools, muss der Reasoning-Text, den deepseek-v4.1-flash zurückgibt, in späteren Turns wieder mitgeschickt werden; ohne tools wird er ignoriert und kann verworfen werden.

Warum reAPI für DeepSeek V4.1 Flash

Eine Output-Obergrenze, die zum Fenster passt

Schnelle Modell-Stufen werben meist mit einem großen Kontextfenster und deckeln die Generierung dann eine Größenordnung darunter. DeepSeek dokumentiert für die Flash-Gewichte ein Maximum von 384K Output-Tokens, sodass deepseek-v4.1-flash Arbeit in der Größenordnung zurückgeben kann, in der es sie liest. Bei Übersetzungen, Refactorings und langen strukturierten Extraktionen ist das der Unterschied zwischen einem einzigen Request und einer Chunking-Pipeline, die du selbst schreiben, abstimmen und debuggen musst.

Vision auf demselben Endpunkt

deepseek-v4.1-flash nimmt Bilder im Standard-OpenAI-Content-Block-Format entgegen — kein eigener Vision-Endpunkt, keine andere Base URL, keine zweite Model-ID, an die geroutet werden muss. Bilder können inline als base64, als öffentliche URL, die deepseek-v4.1-flash herunterlädt, oder als Files-API-Handle vorliegen, und DeepSeek erkennt das Format am Dateiinhalt statt am Dateinamen. Bildverständnis zu einer bestehenden Text-Integration hinzuzufügen ist nur eine Änderung am Message-Body und sonst nichts.

Ein Key für jedes Modell auf der Plattform

Derselbe reAPI-Key und dasselbe Guthaben, die deepseek-v4.1-flash aufrufen, rufen auch die Claude-, GPT-, Gemini- und Kimi-Familien auf. deepseek-v4.1-flash direkt gegen ein anderes Modell antreten zu lassen oder umzuschalten, wenn ein Anbieter eine schlechte Stunde hat, ist eine Änderung an einem Model-String und nicht eine zweite Integration, eine zweite Rechnung und ein zweiter Satz Zugangsdaten zum Rotieren.

deepseek-v4.1-flash vs. GPT-5.6 Luna

Die eigentliche Entscheidung für eine kostensensible Stufe mit einem sehr großen Kontextfenster. Beide nehmen Text und Bilder an und beide bieten einen Reasoning-Regler, der Vergleich geht also nicht darum, welches insgesamt besser ist — es geht um die Output-Obergrenze, wie jedes einen langen Prompt bepreist, und wie viel Kontrolle du über Thinking bekommst. Die Rate wird klar benannt: Luna ist das günstigere der beiden.

Fähigkeit
deepseek-v4.1-flash auf reAPI
GPT-5.6 Luna
Kontextfenster
1M Tokens, von DeepSeek für die Flash-Gewichte dokumentiert
1,05M Tokens, von OpenAI dokumentiert
Max Output-Tokens
384.000 — etwa dreimal so viel wie beim Rivalen, und der Grund, warum ein vollständiger Durchlauf in einer Antwort zurückkommen kann
128.000
Preisbildung bei langen Prompts
Eine Rate über jede Kontextlänge hinweg; ein langer Prompt überschreitet nie eine Preisschwelle
Ab der dokumentierten Schwelle gilt eine zweite, höhere Stufe
Reasoning-Kontrolle
Drei Stufen — low, high, max — mit high als Standard; andere Stufen werden akzeptiert und auf diese abgebildet
Sechs Stufen einschließlich none, Thinking lässt sich also vollständig abschalten
Bildeingabe
Inline base64, eine öffentliche URL, die für dich abgerufen wird, oder ein Files-API-Handle; Format wird aus dem Dateiinhalt gelesen
Bilder werden in ihren ursprünglichen Maßen akzeptiert
Rate pro Token
Höher als beim Rivalen, sowohl bei Input als auch bei Output; die Live-Zahlen stehen in der Tabelle oben
Niedriger bei Input und Output

Der Vergleich spiegelt das Verhalten wider, das DeepSeek und OpenAI zum Zeitpunkt der Erstellung dokumentiert haben. Raten werden als Verhältnisse und nicht als Beträge beschrieben; die Live-Zahlen stehen in der Preistabelle oben und auf der jeweiligen Modellseite.

deepseek-v4.1-flash in drei Schritten ausliefern

  1. step 01

    Einen reAPI-Key erstellen

    Melde dich an und erstelle einen Key in deinem Dashboard. Neue Konten starten mit bereits gutgeschriebenem Guthaben — genug, um echte Requests zu senden und eine echte Rechnung zu sehen, bevor du aufladen musst.

    Öffnen
  2. step 02

    Base URL auf reAPI richten

    Behalte deinen OpenAI-Client. Tausche die Base URL gegen reapi.ai/api/v1 und den Model-String gegen deepseek-v4.1-flash — deepseek-v4.1-flash spricht denselben Chat-Completions-Vertrag, daher ändert sich sonst nichts an deiner Aufrufstelle.

    Öffnen
  3. step 03

    Messages senden und die Antwort lesen

    Poste dein messages-Array und lies choices[0].message. deepseek-v4.1-flash gibt sein Reasoning in reasoning_content neben content zurück, und usage weist Input-, Output- und Cache-Tokens getrennt aus.

    Öffnen
docs/api/deepseek-v4-1-flash

API-Referenz

Sofort einsetzbarer Code und die vollständige Parametertabelle.

curl https://reapi.ai/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4.1-flash",
    "messages": [
      { "role": "user", "content": "Hello" }
    ],
    "reasoning_effort": "high",
    "max_tokens": 8192,
    "stream": true
  }'

Parametervalidierung fehlgeschlagen

Synchron abgelehnt, das fehlerhafte Feld wird benannt. Enum-Werte, Bereiche und URL-Felder prüfen — es wird nichts berechnet.

Authentifizierung oder Guthaben

401 bedeutet fehlender/ungültiger Bearer-Key; 402 bedeutet, die Reservierung übersteigt das Guthaben. Keys und Credits in der Konsole verwalten.

Inhalt oder Material abgelehnt

Referenzmaterial und Ausgaben durchlaufen eine automatische Prüfung. Abgelehnte Tasks schlagen mit klarer Fehlermeldung fehl und werden voll erstattet.

Task fehlgeschlagen oder Timeout

Ein fehlgeschlagener Task wird nie berechnet — die Reservierung wird automatisch erstattet. Task-ID behalten und erneut versuchen.

Häufig gestellte Fragen

Häufige Fragen zu diesem Modell.

deepseek-v4.1-flash wird pay-as-you-go pro Token aus deinem reAPI-Guthaben abgerechnet, mit getrennten Raten für Input, Output und Cache-Lesevorgänge und ohne Abo. Die Rate steigt nicht mit der Kontextlänge, und Reasoning-Tokens zählen als Output. Aktuelle Zahlen stehen in der Preistabelle auf dieser Seite.

start building

Bereit zum Start?

Probiere es im Playground aus oder hol dir einen API-Key, um direkt loszulegen.