Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Usar DeepSeek Harness con una API compatible con OpenAI
2026/08/23

Usar DeepSeek Harness con una API compatible con OpenAI

Conecta Harness a un endpoint OpenAI-compatible, elige V4 Flash o Pro, verifica llamadas de herramientas y estima costos de agentes con caché.

DeepSeek Harness puede usar un endpoint de modelo compatible con OpenAI cuando su plugin de proveedor recibe cuatro valores: una URL base, una clave de API, un ID de modelo y una ruta de Chat Completions. Para reAPI, la URL base es https://api.reapi.ai/v1, y los ID de modelo actuales son deepseek-v4-flash y deepseek-v4-pro.[1][2]

El proyecto Harness aún está etiquetado como vista previa para desarrolladores, así que sus nombres de comando y archivo de configuración podrían cambiar. La parte estable es el contrato del proveedor. Configura eso primero, después verifica un mensaje simple y una llamada de herramienta antes de instalar plugins adicionales.

Los cuatro valores a asignar

Configuración del proveedor HarnessValor de reAPI
Tipo de proveedorOpenAI-compatible
URL basehttps://api.reapi.ai/v1
Clave de APIUna clave de API de reAPI almacenada en una variable de entorno
Modelodeepseek-v4-flash o deepseek-v4-pro

No pegues la clave en un archivo del repositorio. El plugin del proveedor debe leerla de una variable de entorno o del almacén de secretos soportado por la versión actual de Harness.

A nivel HTTP, la solicitud debe resolverse como:

POST https://api.reapi.ai/v1/chat/completions
Authorization: Bearer YOUR_API_KEY
Content-Type: application/json

Este cuerpo mínimo es suficiente para probar el acceso al modelo fuera de Harness antes de depurar el comportamiento del agente:

{
  "model": "deepseek-v4-flash",
  "messages": [
    { "role": "user", "content": "Reply with exactly: provider ok" }
  ],
  "stream": false,
  "max_tokens": 64
}

Si esa solicitud directa falla, el problema no es Harness. Primero, corrige la URL, la clave, el ID del modelo, el saldo o el acceso a la red.

Empieza con Flash, asciende los pasos difíciles a Pro

Ambas variantes actuales de DeepSeek V4 exponen una ventana de contexto de 1M de tokens, hasta 384K de salida, uso de herramientas, modo de pensamiento, entrada de visión y almacenamiento en caché de contexto en la ruta de reAPI.[2] Su precio y carga de trabajo prevista difieren mucho.

ModeloEntrada de cache-miss / 1MEntrada de cache-hit / 1MSalida / 1MPrimer trabajo de Harness
DeepSeek V4 Flash$0.14$0.0028$0.28búsqueda de archivos, resúmenes, ediciones comunes
DeepSeek V4 Pro$1.74$0.0145$3.48arquitectura, depuración difícil, planes largos

Un bucle de agente repite instrucciones, contexto del repositorio y esquemas de herramientas. Esto hace que el comportamiento del caché sea inusualmente importante. La entrada de cache-hit de Flash es 50 veces más barata que su entrada de cache-miss; la entrada de cache-hit de Pro es 120 veces más barata que su tasa de fallo.

Usa Flash como predeterminado mientras conectas el agente. Enruta un paso a Pro solo cuando su requisito de razonamiento justifica aproximadamente 12.4 veces la tasa de entrada de cache-miss y la tasa de salida.

Mantén el prefijo estable estable

El almacenamiento en caché de contexto es más útil cuando el comienzo de solicitudes consecutivas permanece idéntico. En un agente de codificación, ese prefijo a menudo contiene:

  • instrucciones del sistema;
  • política del repositorio;
  • definiciones de herramientas y esquemas JSON;
  • un documento de arquitectura sin cambios;
  • la conversación anterior antes del resultado de herramienta más reciente.

Reordenar herramientas, agregar marcas de tiempo cerca del principio o regenerar las mismas instrucciones con pequeños cambios de redacción puede evitar la reutilización de prefijos. Coloca el estado volátil después del bloque estable.

Por ejemplo, un bucle de Pro con 200.000 tokens de entrada estable, 10.000 tokens de entrada nuevos y 8.000 tokens de salida cuesta aproximadamente:

200,000 cached input × $0.0145 / 1,000,000 = $0.0029
 10,000 new input    × $1.74   / 1,000,000 = $0.0174
  8,000 output       × $3.48   / 1,000,000 = $0.02784
                                                -------
                                                $0.04814

Sin un acierto de caché, los mismos 210.000 tokens de entrada costarían $0.3654 antes de la salida. La distribución del contexto del agente puede importar más que recortar unos pocos cientos de tokens del mensaje más reciente.

Verifica las llamadas de herramientas antes de agregar plugins

Una respuesta de chat exitosa no prueba que un agente pueda actuar. Ejecuta a continuación una prueba de llamada de herramienta inofensiva:

{
  "model": "deepseek-v4-flash",
  "messages": [
    { "role": "user", "content": "What files are in the current directory?" }
  ],
  "tools": [
    {
      "type": "function",
      "function": {
        "name": "list_files",
        "description": "List files in the current working directory",
        "parameters": { "type": "object", "properties": {} }
      }
    }
  ],
  "tool_choice": "auto"
}

El modelo debe devolver una llamada de herramienta estructurada. Harness ejecuta la función local y proporciona el resultado en el siguiente turno. Si el modelo imprime "Yo enumeraría los archivos" como prosa, inspecciona si el plugin del proveedor reenviaba tools y devolvió los campos de llamada de herramienta del asistente intactos.

Cinco puntos de fallo que parecen problemas de modelo

SíntomaVerifica primero
respuesta 401La clave está ausente o Harness no heredó la variable de entorno
respuesta 404La URL base o la ruta /v1/chat/completions estaba duplicada/omitida
Modelo no encontradoUsa el ID exacto deepseek-v4-flash o deepseek-v4-pro
El agente habla pero nunca actúaEl adaptador del proveedor dejó caer definiciones de herramientas o salida de llamadas de herramientas
La respuesta se detiene antes de completarseEl pensamiento usó el presupuesto de salida; aumenta max_tokens

El pensamiento está activado por defecto en la ruta actual de DeepSeek V4. Los tokens de razonamiento cuentan para el uso de salida, por lo que un límite de salida pequeño puede terminar un plan de herramienta antes de la respuesta visible del usuario.[2]

Prueba el bucle completo del agente con un repositorio desechable

Después de que pasen las pruebas de mensajes y llamadas de herramientas, dale a Harness un pequeño repositorio creado para pruebas de integración. Debe contener un archivo legible, una prueba fallida, una ruta protegida y un comando inofensivo. Pide al agente que diagnostique la prueba, proponga un parche, ejecute la comprobación estrecha y se detenga antes de cualquier commit o acción externa.

Esto revela cuatro fallos de integración que una prueba de llamada de herramienta JSON no puede:

  • las rutas relativas se resuelven fuera del directorio de trabajo previsto;
  • la salida del comando se trunca antes de que el modelo vea el error;
  • una herramienta de parche cambia terminaciones de línea o codificación de archivo;
  • el límite de aprobación se refuerza en la interfaz de usuario pero no en el plugin.

Repite la misma tarea después de reiniciar Harness. La recuperación de sesión importa en un agente de codificación porque las ejecuciones largas fallan en límites ordinarios: suspensión del portátil, reinicio de proceso, tiempo de espera del proveedor o salida de herramienta malformada. Un primer turno que funciona no es suficiente.

Registra lo suficiente para separar fallos en tiempo de ejecución y modelo

Como mínimo, retén un ID de solicitud, modelo seleccionado, uso de tokens, tokens de acierto de caché, motivo de terminación, nombre de herramienta, duración de herramienta y error redactado. No registres claves de API ni contenido de archivo sin restricciones.

Cuando un agente se detiene, estos campos responden diferentes preguntas:

ObservaciónCapa probable
HTTP 401/404 antes de cualquier salida de modeloConfiguración del proveedor
finish_reason: lengthPresupuesto de salida
Llamada de herramienta válida pero sin ejecuciónTiempo de ejecución de Harness/plugin
Herramienta ejecutada, resultado nunca llega al modeloSerialización de bucle
Entrada completa repetida sin aciertos de cachéConstrucción de contexto
Modelo elige un comando arriesgado a pesar del esquema correctoModelo/prompt/política de aprobación

Sin esa separación, los equipos a menudo cambian modelos para arreglar una variable de entorno faltante o reescriben prompts para arreglar un resultado de herramienta caído.

No reenvíes el razonamiento oculto como historial de conversación

La respuesta de DeepSeek V4 puede contener contenido de razonamiento separado de la respuesta final. La documentación de la API aconseja eliminar contenido de razonamiento anterior antes del siguiente turno.[2] Almacena lo necesario para facturación y depuración según la política del producto, pero no añadas razonamiento oculto al siguiente historial de usuario/asistente como si fuera contenido ordinario.

La conversación debe preservar la respuesta del asistente visible, las llamadas de herramienta estructuradas y los resultados de herramientas requeridos por el protocolo. Esto mantiene la siguiente solicitud válida y evita que el contexto crezca con material que el endpoint no espera recibir de vuelta.

La seguridad del plugin pertenece a la configuración

La vista previa de Harness soporta plugins, lo que también significa que código de terceros puede recibir prompts, archivos, salida de herramientas o acceso a la red. Antes de habilitar uno:

  1. lee la fuente del plugin y la superficie de permisos;
  2. ejecuta Harness en un repositorio desechable o sandbox;
  3. empieza con herramientas de sistema de archivos de solo lectura;
  4. bloquea archivos secretos y directorios padre;
  5. requiere confirmación para shell, instalación de paquetes, pushes de git y mensajes externos.

El endpoint del modelo no puede corregir un plugin local con permisos excesivos. Ese límite pertenece al tiempo de ejecución del agente.

El contrato de modelo actual y los ejemplos del SDK están en la documentación de la API de DeepSeek V4, con precios en vivo en la página del modelo DeepSeek V4.

References

  1. DeepSeek, "deepseek-harness" official repository, developer preview, accessed August 23, 2026.
  2. reAPI DeepSeek V4 API documentation, accessed August 23, 2026.
  3. DeepSeek Harness official product page, accessed August 23, 2026.