Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
DeepSeek Harness mit OpenAI-kompatibler API konfigurieren
2026/08/23

DeepSeek Harness mit OpenAI-kompatibler API konfigurieren

DeepSeek Harness mit reAPI verbinden, zwischen V4 Flash und Pro wählen, Tool-Calls verifizieren und Kosten gecachter Agent-Schleifen kalkulieren.

DeepSeek Harness kann einen OpenAI-kompatiblen Modell-Endpunkt nutzen, wenn das Provider-Plugin vier Werte erhält: eine Basis-URL, einen API-Schlüssel, eine Modell-ID und einen Chat-Completions-Pfad. Für reAPI lautet die Basis-URL https://api.reapi.ai/v1, und die aktuellen Modell-IDs sind deepseek-v4-flash und deepseek-v4-pro.[1][2]

Das Harness-Projekt wird noch als Developer Preview gekennzeichnet, seine Befehlsnamen und Konfigurationsdateien können sich verschieben. Der stabile Teil ist die Provider-Schnittstelle. Konfiguriere diese zuerst, verifiziere dann eine einfache Nachricht und einen Tool-Call, bevor du weitere Plugins installierst.

Die vier zu mappenden Werte

Harness-Provider-EinstellungreAPI-Wert
Provider-TypOpenAI-kompatibel
Basis-URLhttps://api.reapi.ai/v1
API-SchlüsselEin reAPI-Schlüssel, gespeichert in einer Umgebungsvariablen
Modelldeepseek-v4-flash oder deepseek-v4-pro

Füge den Schlüssel nicht in eine Repository-Datei ein. Das Provider-Plugin sollte ihn aus einer Umgebungsvariablen oder dem Geheimnisspeicher der aktuellen Harness-Version auslesen.

Auf HTTP-Ebene sollte sich die Anfrage in folgendes auflösen:

POST https://api.reapi.ai/v1/chat/completions
Authorization: Bearer YOUR_API_KEY
Content-Type: application/json

Dieser minimale Text-Body reicht, um den Modellzugriff außerhalb von Harness zu testen, bevor du Agent-Verhalten debuggst:

{
  "model": "deepseek-v4-flash",
  "messages": [
    { "role": "user", "content": "Reply with exactly: provider ok" }
  ],
  "stream": false,
  "max_tokens": 64
}

Wenn diese direkte Anfrage fehlschlägt, ist nicht Harness das Problem. Behebe erst die URL, den Schlüssel, die Modell-ID, das Guthaben oder den Netzwerkzugriff.

Starten mit Flash, eskaliere schwierige Schritte auf Pro

Beide aktuellen DeepSeek-V4-Varianten bieten ein 1-Million-Token-Kontextfenster, bis zu 384K Ausgabe, Tool-Nutzung, Thinking-Modus, Vision-Eingabe und Kontext-Caching auf der reAPI-Route.[2] Ihre Kosten und Einsatzzwecke unterscheiden sich deutlich.

ModellCache-Miss-Eingabe / 1MCache-Hit-Eingabe / 1MAusgabe / 1MErster Harness-Job
DeepSeek V4 Flash$0,14$0,0028$0,28Dateisuche, Zusammenfassungen, routinemäßige Änderungen
DeepSeek V4 Pro$1,74$0,0145$3,48Architektur, schwieriges Debugging, lange Pläne

Eine Agent-Schleife wiederholt Anweisungen, Repository-Kontext und Tool-Schemas. Das macht Cache-Verhalten ungewöhnlich wichtig. Flash-Cache-Hit-Eingabe ist 50-mal billiger als Cache-Miss-Eingabe; Pro-Cache-Hit-Eingabe ist 120-mal billiger.

Nutze Flash als Standard beim Verbindungsaufbau. Leite einen Schritt auf Pro nur weiter, wenn sein Reasoning-Bedarf die etwa 12,4-fache Cache-Miss-Eingaberate und Ausgaberate rechtfertigt.

Halte das stabile Präfix stabil

Kontext-Caching ist am nützlichsten, wenn der Anfang aufeinanderfolgender Anfragen identisch bleibt. In einem Code-Agent enthält dieses Präfix oft:

  • Systemanweisungen;
  • Repository-Richtlinien;
  • Tool-Definitionen und JSON-Schemas;
  • ein unverändertes Architektur-Dokument;
  • das vorige Gespräch vor dem neuesten Tool-Ergebnis.

Das Reordern von Tools, das Hinzufügen von Zeitstempeln am Anfang oder das Neugenerieren derselben Anweisungen mit kleineren Wording-Änderungen kann die Präfix-Wiederverwendung verhindern. Platziere volatilen Zustand nach dem stabilen Block.

Beispiel: Eine Pro-Schleife mit 200.000 stabilen Eingabe-Tokens, 10.000 neuen Eingabe-Tokens und 8.000 Ausgabe-Tokens kostet ungefähr:

200.000 gecachte Eingabe  × $0,0145 / 1.000.000 = $0,0029
 10.000 neue Eingabe      × $1,74   / 1.000.000 = $0,0174
  8.000 Ausgabe           × $3,48   / 1.000.000 = $0,02784
                                                    -------
                                                    $0,04814

Ohne Cache-Hit würden dieselben 210.000 Eingabe-Tokens $0,3654 vor Ausgabe kosten. Das Kontext-Layout eines Agenten kann wichtiger sein als das Trimmen einiger hundert Tokens aus der neuesten Nachricht.

Verifiziere Tool-Calls vor dem Hinzufügen von Plugins

Eine erfolgreiche Chat-Response beweist nicht, dass ein Agent handeln kann. Führe danach einen harmlosen Tool-Call-Test durch:

{
  "model": "deepseek-v4-flash",
  "messages": [
    { "role": "user", "content": "What files are in the current directory?" }
  ],
  "tools": [
    {
      "type": "function",
      "function": {
        "name": "list_files",
        "description": "List files in the current working directory",
        "parameters": { "type": "object", "properties": {} }
      }
    }
  ],
  "tool_choice": "auto"
}

Das Modell sollte einen strukturierten Tool-Call zurückgeben. Harness führt die lokale Funktion aus und liefert das Ergebnis beim nächsten Durchgang. Wenn das Modell stattdessen „Ich würde die Dateien auflisten" als Text ausgibt, überprüfe, ob das Provider-Plugin tools weitergeleitet und die Assistant-Tool-Call-Felder intact zurückgegeben hat.

Fünf Fehlerpunkte, die wie Modell-Probleme aussehen

SymptomPrüfe zuerst
401-ResponseSchlüssel fehlt oder Harness hat die Umgebungsvariable nicht geerbt
404-ResponseBasis-URL oder /v1/chat/completions-Pfad wurde dupliziert/ausgelassen
Modell nicht gefundenNutze die exakte ID deepseek-v4-flash oder deepseek-v4-pro
Agent spricht, handelt aber nieProvider-Adapter hat Tool-Definitionen oder Tool-Call-Ausgabe verworfen
Antwort bricht vor Fertigstellung abThinking nutzte das Ausgabe-Budget; erhöhe max_tokens

Thinking ist auf der aktuellen DeepSeek-V4-Route standardmäßig aktiviert. Reasoning-Tokens werden zur Ausgabe-Auslastung gezählt, daher kann eine kleine Ausgabe-Obergrenze einen Tool-Plan vor seiner benutzerbar Antwort beenden.[2]

Teste die vollständige Agent-Schleife mit einem Wegwerf-Repository

Nach bestandenen Message- und Tool-Call-Tests gib Harness ein kleines für Integrationstests erstelltes Repository. Es sollte eine lesbare Datei, einen fehlgeschlagenen Test, einen geschützten Pfad und einen harmlosen Befehl enthalten. Bitte den Agent, den Test zu diagnostizieren, einen Patch vorzuschlagen, die enge Überprüfung durchzuführen und vor jedem Commit oder einer externen Aktion zu stoppen.

Dies offenbart vier Integrationsfehler, die ein JSON-Tool-Call-Test nicht kann:

  • relative Pfade werden außerhalb des beabsichtigten Arbeitsverzeichnisses aufgelöst;
  • Befehlsausgabe wird abgeschnitten, bevor das Modell den Fehler sieht;
  • ein Patch-Tool ändert Zeilenumbrüche oder Datei-Kodierung;
  • die Genehmigungsgrenze wird in der UI durchgesetzt, aber nicht im Plugin.

Wiederhole dieselbe Aufgabe nach Harness-Neustart. Session-Recovery ist in einem Code-Agent wichtig, weil lange Läufe bei gewöhnlichen Grenzen fehlschlagen: Laptop-Standby, Prozess-Neustart, Provider-Timeout oder malformed Tool-Output. Ein funktionierender erster Durchgang ist nicht genug.

Logge genug, um Laufzeit- und Modell-Fehler zu trennen

Behalte mindestens folgende: Request-ID, ausgewähltes Modell, Token-Nutzung, Cache-Hit-Tokens, Finish-Reason, Tool-Name, Tool-Dauer und redaktionsfreier Fehler. Logge keine API-Schlüssel oder uneingeschränkte Dateiinhalte.

Wenn ein Agent stoppt, beantworten diese Felder verschiedene Fragen:

BeobachtungWahrscheinliche Schicht
HTTP 401/404 vor jeglicher Modell-AusgabeProvider-Konfiguration
finish_reason: lengthAusgabe-Budget
Gültiger Tool-Call aber keine AusführungHarness/Plugin-Laufzeit
Tool ausgeführt, Ergebnis erreicht Modell nieLoop-Serialisierung
Wiederholte volle Eingabe mit Null-Cache-HitsKontexterstellung
Modell wählt risikanten Befehl trotz korrektem SchemaModell/Prompt/Genehmigungsrichtlinie

Ohne diese Trennung wechseln Teams oft Modelle, um eine fehlende Umgebungsvariable zu beheben, oder rewritten Prompts, um ein verlorenes Tool-Ergebnis zu beheben.

Leite versteckte Reasoning nicht als Konversationsverlauf weiter

Die DeepSeek-V4-Response kann Reasoning-Inhalt separat von der endgültigen Antwort tragen. Die API-Dokumentation empfiehlt, vorherige Reasoning-Inhalte vor dem nächsten Durchgang zu entfernen.[2] Speichere das für Abrechnung und Debugging Notwendige unter der Produktrichtlinie, aber füge versteckes Reasoning nicht zur nächsten Benutzer-/Assistant-History hinzu, als wäre es gewöhnlicher Inhalt.

Das Gespräch sollte die sichtbare Assistant-Response, strukturierte Tool-Calls und die vom Protokoll geforderten Tool-Ergebnisse bewahren. Dies hält die nächste Anfrage gültig und verhindert, dass der Kontext mit Material wächst, das der Endpunkt nicht zu erhalten erwartet.

Plugin-Sicherheit gehört ins Setup, nicht danach

Die Harness-Preview unterstützt Plugins, was auch bedeutet, dass Third-Party-Code Prompts, Dateien, Tool-Ausgabe oder Netzwerkzugriff erhalten kann. Bevor du einen aktivierst:

  1. lese den Plugin-Quellcode und die Berechtigungsfläche;
  2. führe Harness in einem Wegwerf-Repository oder Sandbox aus;
  3. starten mit nur-lesenden Dateisystem-Tools;
  4. blockiere Geheimnisdateien und übergeordnete Verzeichnisse;
  5. fordere Bestätigung für Shell, Paketinstallation, Git-Pushes und externe Nachrichten.

Der Modell-Endpunkt kann ein über-berechtigtes lokales Plugin nicht korrigieren. Diese Grenze gehört zur Agent-Laufzeit.

Der aktuelle Modell-Vertrag und SDK-Beispiele stehen in der DeepSeek-V4-API-Dokumentation mit aktuellen Preisen auf der DeepSeek-V4-Modellseite.

Referenzen

  1. DeepSeek, "deepseek-harness" offizielles Repository, Developer Preview, abgerufen am 23. August 2026.
  2. reAPI DeepSeek V4 API-Dokumentation, abgerufen am 23. August 2026.
  3. DeepSeek Harness offizielle Produktseite, abgerufen am 23. August 2026.