Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Cómo usar Claude Opus 4.8: codificación, honestidad y coste
2026/07/27

Cómo usar Claude Opus 4.8: codificación, honestidad y coste

Claude Opus 4.8: tabla de referencia oficial, mejoras de honestidad, Dynamic Workflows y planificación de migración desde Opus 4.7 con cambio de esfuerzo.

Anthropic lanzó Claude Opus 4.8 el 28 de mayo de 2026, cuarenta y uno días después de Opus 4.7 y exactamente al mismo precio: 5 $ por millón de tokens de entrada y 25 $ por millón de tokens de salida[1][3]. Saber cómo usar bien Claude Opus 4.8 es principalmente una cuestión de entender qué cambió bajo una etiqueta de precio que no se movió.

Tres cosas sí lo hicieron. La codificación agentic mejoró de nuevo, con SWE-bench Pro pasando de 64,3% a 69,2%[1]. El modo rápido se volvió tres veces más barato. Y Anthropic dedicó la mayor parte de su anuncio a algo que no es un número de capacidad en absoluto: el modelo tiene aproximadamente cuatro veces menos probabilidades que Opus 4.7 de dejar pasar sin señalar un defecto en el código que escribió[1]. Para cualquiera que ejecute agentes desatendidos, ese último cambio altera el perfil de riesgo más que el número de referencia.

TL;DR

  • Precio sin cambios, capacidad mejorada. 5 $ / 25 $ por millón de tokens, igual que Opus 4.7 y 4.6[3]. En reAPI el mismo modelo funciona a 4,00 $ / 20,00 $, que es el 80% de la tarifa publicada de Anthropic.
  • La mejora de honestidad es el titular. Aproximadamente cuatro veces menos probable que Opus 4.7 de dejar pasar sus propios defectos de código sin comentarios, y aproximadamente diecisiete veces menos probable que Sonnet 4.6 de producir un resumen desonesto de su trabajo agentic[1].
  • El modo rápido bajó a un tercio. 10 $ / 50 $ por millón de tokens para aproximadamente 2,5 veces la velocidad de salida, contra el modo rápido de 30 $ / 150 $ en modelos Claude anteriores[1].
  • El nivel de esfuerzo predeterminado cambió de medium a high. Los arneses que dependían del antiguo default obtienen razonamiento más profundo, latencia más alta y más tokens de salida a menos que lo establezcan explícitamente[1].
  • Se eliminaron los presupuestos de pensamiento fijo. El código que pasa budget_tokens debe moverse a thinking: {"type": "adaptive"}[1].
  • No gana en todas partes. GPT-5.5 sigue ganando en Terminal-Bench 2.1, 78,2% frente a 74,6%, y GPQA Diamond bajó ligeramente desde Opus 4.7[1].

Qué es Claude Opus 4.8

Imagen clave de lanzamiento de Claude Opus 4.8

Claude Opus 4.8 es el modelo fronterizo en la familia Claude 4 de Anthropic y un reemplazo directo para Opus 4.7 en cada superficie que envía Anthropic. El identificador de la API es claude-opus-4-8, sin sufijo de fecha[2]. Lee hasta 1M de tokens en una solicitud y devuelve hasta 128K, o hasta 300K en la API por lotes con un encabezado beta[2].

Si deseas un recorrido a nivel de especificación, escribimos uno: qué es Claude Opus 4.8 cubre la ventana de contexto, modalidades y lista de capacidades. Esta guía es sobre el lado operativo, que es donde viven las decisiones interesantes.

Cómo funciona Opus 4.8 en codificación y referencias agentic

Tabla de referencias de Claude Opus 4.8 de Anthropic comparando Opus 4.8, Opus 4.7, GPT-5.5 y Gemini 3.1 Pro en codificación agentic, codificación de terminal, razonamiento multidisciplinario, uso de computadora, trabajo de conocimiento y análisis financiero

La comparación del titular de Anthropic pone Opus 4.8 contra Opus 4.7, GPT-5.5 y Gemini 3.1 Pro en las evaluaciones que considera representativas del trabajo agentic real[1].

ReferenciaOpus 4.8Opus 4.7GPT-5.5Gemini 3.1 Pro
Codificación agentic (SWE-bench Pro)69,2%64,3%58,6%54,2%
Codificación de terminal agentic (Terminal-Bench 2.1)74,6%66,1%78,2%70,3%
Razonamiento multidisciplinario (HLE, sin herramientas)49,8%46,9%41,4%44,4%
Razonamiento multidisciplinario (HLE, con herramientas)57,9%54,7%52,2%51,4%
Uso de computadora agentic (OSWorld-Verified)83,4%82,8%78,7%76,2%
Trabajo de conocimiento (GDPval-AA, Elo)1890175317691314
Análisis financiero agentic (Finance Agent v2)53,9%51,5%51,8%43,0%

Opus 4.8 lidera seis de las siete filas. La excepción es Terminal-Bench 2.1, donde GPT-5.5 gana 78,2% a 74,6%[1].

Tres advertencias pertenecen al lado de esa tabla, porque importan para una decisión de compra real. SWE-bench Verified, informado por separado, sube a 88,6% desde 87,6%, un paso pequeño en un nivel donde el punto de referencia comienza a saturarse. GPQA Diamond fue por el camino equivocado, bajando a 93,6% desde 94,2% de Opus 4.7. Y estas son evaluaciones dirigidas por proveedores, así que lee toda la tabla como una señal direccional en lugar de una auditoría neutral. Anthropic también reporta 96,7% en USAMO 2026 y un aumento a 84,3% en BrowseComp de agente único[1].

El resumen honesto es "ampliamente por delante, no por delante en todas partes".

Lo que los socios informan desde producción

Los resultados subestiman las ganancias del mundo real a menudo lo suficiente como para que las declaraciones de socios de acceso temprano en la nota de lanzamiento de Anthropic valgan más que otra fila de evaluación. Varios son lo suficientemente específicos como para actuar[1].

  • Databricks informó un cambio de paso en el razonamiento agentic con aproximadamente 61% menos costo de token que Opus 4.7. Este es el que importa para la economía de producción, porque una ganancia de capacidad que también reduce el gasto es rara en una versión puntual.
  • Cursor informó un uso de herramientas significativamente más eficiente, completando tareas de extremo a extremo en menos pasos al mismo nivel de inteligencia.
  • Cognition, que construye Devin, informó un uso limpio de herramientas e instrucciones lo suficientemente consistentes para mantener cargas de trabajo de ingeniería autónoma funcionando desatendidas.
  • Harvey registró su puntuación más alta en su Benchmark de Agente Legal, y el primer modelo en pasar el 10% en su estándar de todo aprobado más estricto.

Trata la cifra del 61% como una hipótesis a probar en tu propio tráfico en lugar de un número para poner en un presupuesto. El costo de token depende de la carga de trabajo, y el cambio de esfuerzo predeterminado descrito a continuación empuja en la dirección opuesta.

La actualización de honestidad

La parte más distintiva de esta versión es un cambio de comportamiento, no un número de capacidad. En la evaluación de comportamiento desalineado interno de Anthropic, puntuada de 1 a 10 donde más bajo es mejor, Opus 4.8 se sitúa cerca de Claude Mythos Preview y muy por debajo de Opus 4.7 y Sonnet 4.6[1]. En términos prácticos, Anthropic reporta que es aproximadamente cuatro veces menos probable que Opus 4.7 de dejar pasar defectos en su propio código sin comentarios, y aproximadamente diecisiete veces menos probable que Sonnet 4.6 de producir un resumen desonesto de su trabajo agentic[1].

Puntuaciones de auditoría de comportamiento automatizado para Claude Opus 4.8 contra Claude Mythos Preview, Opus 4.7 y Sonnet 4.6, donde una puntuación de comportamiento desalineado más baja es mejor

Dos cosas mantienen eso en perspectiva. Estas son reducciones de tasa, no eliminaciones. Un modelo cuatro veces menos probable de ocultar un defecto todavía ocasionalmente oculta uno, así que la revisión humana del código agentic no desaparece. Y las métricas de honestidad provienen de las evaluaciones propias de Anthropic en lugar de puntos de referencia de terceros, así que son el encuadre del proveedor hasta que las pruebas independientes alcancen.

La dirección aún importa. En un bucle largo desatendido, un modelo que dice proactivamente que no está seguro es materialmente más seguro de desplegar que uno que envía con confianza un resultado roto.

Dynamic Workflows

La característica nueva insignia se envía como una vista previa de investigación en Claude Code y aborda un problema que cada usuario de codificación agentic eventualmente golpea: algunos trabajos son demasiado grandes para un agente y una ventana de contexto. Una migración de marco en cientos de miles de líneas. Una actualización de dependencia tocando cada servicio. Un refactorizado en toda el repositorio.

El diseño es orquestador y trabajadores. Opus 4.8 planifica el trabajo, lo divide en segmentos independientes y lo envía a cientos de subagentes ejecutándose en paralelo. Cada subagente planifica, ejecuta y verifica su propio segmento, y el orquestador fusiona los resultados verificados. Anthropic encuadra el conjunto de pruebas existente del repositorio como la puerta para lo que cuenta como hecho, y describe el sistema como llevando una migración de escala de base de código de inicio a fusión[1].

Esta es una característica de orquestación que la coherencia de horizonte largo mejorada del modelo hace viable, que es también por qué el trabajo de honestidad y el trabajo de flujo de trabajo pertenecen a la misma versión. Abanicarse en cientos de agentes solo es útil si cada uno señala de manera confiable lo que no pudo terminar.

Esfuerzo, modo rápido y la ecuación de coste

Dos cambios aquí, y el primero es un aumento de factura silencioso si lo pierdes.

El nivel de esfuerzo predeterminado de la API se movió de medium a high, con xhigh y max disponibles arriba[1]. Cualquier arnés que dependiera del antiguo default ahora razona más profundo, se ejecuta más lento y emite más tokens de salida sin cambiar una línea de código. Si estás comparando el coste de Opus 4.8 contra el coste de Opus 4.7, iguala los niveles de esfuerzo primero o la comparación no tiene sentido.

El modo rápido bajó a un tercio de su precio anterior. Ejecuta el mismo modelo a aproximadamente 2,5 veces la velocidad de salida por 10 $ por millón de tokens de entrada y 50 $ por millón de salida, contra 30 $ / 150 $ en modelos Claude anteriores[1]. Eso sigue siendo el doble de la tarifa estándar, pero mueve el modo rápido de "demasiado caro para justificar" a rango para productos sensibles a la latencia.

Aquí está la tarifa oficial completa[3]:

ArtículoPrecio por MTok
Entrada5 $
Salida25 $
Impactos de caché y actualizaciones0,50 $
Escritura de caché (5 minutos)6,25 $
Escritura de caché (1 hora)10 $
Entrada por lotes2,50 $
Salida por lotes12,50 $
Entrada en modo rápido10 $
Salida en modo rápido50 $

La API por lotes reduce ambas dimensiones, y el almacenamiento en caché de indicaciones hace que el contexto repetido sea barato de releer a 0,50 $ por millón de tokens[3]. Entre un precio estándar plano, un nivel rápido más barato y un default de esfuerzo que se movió, la pregunta dejó de ser si Opus es asequible y se convirtió en qué nivel de esfuerzo, en qué modo, para qué clase de tarea.

Cómo usar Claude Opus 4.8: migrando desde Opus 4.7

Anthropic describe el movimiento como en gran medida no rompedor, pero tres cambios valen la pena atrapar antes de que el tráfico de producción se voltee[1].

  1. El nivel de esfuerzo predeterminado cambió de medium a high. Establécelo explícitamente o acepta razonamiento más profundo, latencia más alta y más tokens de salida.
  2. Se eliminaron los presupuestos de tokens de pensamiento extendido fijo. El código que pasa un valor budget_tokens se migra a thinking: {"type": "adaptive"}.
  3. La API de Mensajes ahora acepta entradas del sistema a mitad de tarea sin romper la caché de indicaciones. No es un cambio rompedor, sino un comportamiento a conocer si tu agente actualiza instrucciones a mitad de ejecución.

La lista de verificación que se sostiene para cualquier actualización de modelo: reproduce 20 a 50 tareas reales de tu traza de producción en niveles de esfuerzo igualados, compara costo de extremo a extremo y calidad en lugar de tasas por token, retoca indicaciones que fijan esfuerzo o presupuestos de pensamiento, y pilota Dynamic Workflows en un trabajo genuinamente grande antes de cablearlo en automatización. La matemática del coste de token es empírica. Mídela en tu propia carga de trabajo.

Quién debe preocuparse ahora

Equipos que ya ejecutan Opus 4.7. La ganancia de SWE-bench Pro más la reducción de coste de token reportada hacen que una prueba piloto de migración valga la pena el tiempo, siempre que presupuestes el nuevo default high de esfuerzo y compares coste en tareas reales primero.

Equipos con trabajos de escala de base de código. Dynamic Workflows es la razón para actualizar si tienes una migración o refactorización en toda el repositorio que se atascó porque era demasiado grande para un agente. Comienza con un trabajo único limitado donde el conjunto de pruebas es confiable.

Cualquiera que ejecute bucles agentic desatendidos. Las mejoras de honestidad importan más donde ningún humano revisa cada paso en tiempo real: ejecuta durante la noche, canalizaciones autónomas, tareas de investigación largas.

Equipos que probablemente deberían saltárselo. Si estás comenzando de cero en lugar de migrar, mira Claude Opus 5 antes de comprometerte con 4.8. Se cotiza al mismo 5 $ / 25 $, y en reAPI se ejecuta más barato que Opus 4.8. Opus 4.8 sigue siendo la respuesta correcta cuando necesitas un modelo cuyo comportamiento tus evaluaciones ya caracterizan, o cuando específicamente deseas pensar apagado en niveles de esfuerzo alto, que Opus 5 ya no permite.

Llamando a Claude Opus 4.8 junto a tus otros modelos

Todo lo anterior es un problema de enrutamiento vistiendo un disfraz de migración. El default de esfuerzo se movió, así que el coste por tarea se movió. El modo rápido se volvió viable para una clase de rutas de las que fue fijado de precios. GPT-5.5 sigue ganando codificación de terminal. Opus 5 existe ahora al mismo precio de lista. Nada de eso se resuelve en una configuración, y todo cambia de nuevo en la siguiente versión.

reAPI expone Claude Opus 4.8 a través de un punto final /v1/chat/completions compatible con OpenAI, así que el cliente que ya usas para llamadas GPT y Gemini también lo llama:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

resp = client.chat.completions.create(
    model="claude-opus-4-8",
    messages=[{"role": "user", "content": "Refactor this module and add tests."}],
    max_tokens=16000,
    stream=True,
)

Las tarifas en la puerta de enlace son 4,00 $ por millón de tokens de entrada y 20,00 $ por millón de salida, que es el 80% de los 5 $ / 25 $ publicados de Anthropic. La referencia del punto final está en reapi.ai/docs/claude-opus-4-8, y las tarifas actuales viven en reapi.ai/models/claude-opus-4-8.

Intercambiar una cadena de modelo es la parte fácil. Ser capaz de intercambiarlo sin un segundo SDK, una segunda clave y una segunda factura es la parte que vale la pena construir una sola vez.

FAQ

¿Cuándo fue lanzado Claude Opus 4.8?

28 de mayo de 2026, cuarenta y uno días después de Opus 4.7, a precios sin cambios[1].

¿Cuánto cuesta Claude Opus 4.8?

5 $ por millón de tokens de entrada y 25 $ por millón de salida, con lecturas de caché a 0,50 $ y la API por lotes a mitad de precio[3]. El modo rápido es 10 $ / 50 $[1].

¿Cuál es la cosa más grande a atrapar cuando se migra desde Opus 4.7?

El nivel de esfuerzo predeterminado de la API se movió de medium a high. Si tu arnés dependía del antiguo default, obtienes razonamiento más profundo, latencia más alta y más tokens de salida sin cambiar ningún código[1].

¿Claude Opus 4.8 vence a GPT-5.5?

En cinco de las seis filas donde Anthropic los compara directamente, sí. GPT-5.5 gana codificación de terminal agentic en Terminal-Bench 2.1, 78,2% contra 74,6%[1].

¿Qué son Dynamic Workflows?

Una vista previa de investigación de Claude Code en la que Opus 4.8 actúa como un orquestador, divide un trabajo grande en segmentos independientes, envía a cientos de subagentes paralelos y fusiona resultados verificados usando el conjunto de pruebas del repositorio como la puerta[1].

¿Se verifica independientemente la mejora de honestidad?

No todavía. Las cifras de cuatro veces y diecisiete veces provienen de evaluaciones internas de Anthropic en lugar de puntos de referencia de terceros[1]. Son reducciones de tasa, no eliminaciones, así que la revisión humana de salida agentic aún se aplica.

¿Debo usar Opus 4.8 u Opus 5?

Opus 5 se cotiza al mismo 5 $ / 25 $ y es un cambio de paso en lugar de una actualización incremental. Opus 4.8 permanece relevante cuando tus evaluaciones ya caracterizan su comportamiento, o cuando necesitas pensar deshabilitado en niveles de esfuerzo alto, que Opus 5 rechaza.

¿Cómo llamo a Claude Opus 4.8 con el SDK de OpenAI?

Apunta el cliente de OpenAI a https://api.reapi.ai/v1, establece model a claude-opus-4-8 y envía una solicitud de chat normal. El punto final es compatible con OpenAI, así que no se necesita reescritura de SDK.

Igualando el nivel de esfuerzo al trabajo

La forma útil de leer esta versión es que Anthropic mantuvo el precio plano y gastó la versión en cosas que solo muestran arriba en producción: un modelo que señala sus propios errores, una primitiva de orquestación para trabajos demasiado grandes para una ventana de contexto, y un modo rápido que finalmente cuesta lo que los productos sensibles a la latencia pueden pagar. La tabla de referencias es real pero modesta. El cambio de comportamiento es la parte que altera cuánta supervisión necesita un agente.

Si estás migrando, el trabajo es pequeño y específico. Fija el nivel de esfuerzo explícitamente en lugar de heredar el nuevo default high, mueve cualquier código budget_tokens a pensamiento adaptativo, reproduce tareas de producción reales en esfuerzo igualado antes de confiar en cualquier comparación de coste, y pilota Dynamic Workflows en un trabajo limitado con un conjunto de pruebas en el que confías. Eso es cómo usar Claude Opus 4.8 sin descubrir el default de esfuerzo en tu factura.

Referencias

  1. Anthropic. Introducing Claude Opus 4.8 — benchmarks, honesty evaluations, Dynamic Workflows, effort defaults, and fast-mode pricing. Retrieved July 2026 from anthropic.com/news/claude-opus-4-8
  2. Anthropic. Models overview — context, output, modality, and capabilities. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/models/overview
  3. Anthropic. Pricing — token, cache, and batch rates. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/pricing

Lectura adicional