Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Cómo usar Claude Opus 5: comparativas, esfuerzo y costo
2026/07/27

Cómo usar Claude Opus 5: comparativas, esfuerzo y costo

Cómo usar Claude Opus 5: tabla de evaluaciones, escala de esfuerzo que determina tu factura, dos cambios rotos en la API y los pasos de migración.

Anthropic lanzó Claude Opus 5 el 24 de julio de 2026, describiéndolo como un salto cualitativo respecto a Claude Opus 4.8[6]. Tiene el mismo precio exacto que el modelo que lo antecede: $5 por millón de tokens de entrada y $25 por millón de salida[3]. Entonces, la pregunta de cómo usar Claude Opus 5 bien casi no tiene que ver con el precio de lista, que no cambió, y casi todo que ver con un dial que la mayoría de los equipos nunca toca.

Ese dial es el esfuerzo. En lugar de publicar un número por evaluación, Anthropic publicó curvas de puntuación versus costo en todos los cinco niveles de esfuerzo[1]. La diferencia entre el escalón más barato y el más caro en esas curvas es más amplia que cualquier cosa que una reescritura de prompt recuperará, y la orientación oficial es barrer la escalera contra tus propias evaluaciones en lugar de subirlo todo[2].

TL;DR

  • Mismo precio de lista, modelo diferente. $5 / $25 por millón de tokens, sin cambios desde Opus 4.8[2]. En reAPI el mismo modelo corre a $2.40 / $12.00, que es el 48% de la tasa publicada por Anthropic.
  • El pensamiento está activado por defecto ahora. En Opus 4.8, omitir el campo thinking significaba no pensar. En Opus 5 la misma solicitud piensa[2]. Como max_tokens limita el pensamiento más el texto de respuesta juntos, presupuestos ajustados transferidos se truncarán.
  • Desactivar el pensamiento está limitado al esfuerzo high. Enviar thinking: {"type": "disabled"} con xhigh o max devuelve un 400, verificado por solicitud[2].
  • Opus 5 no lo gana todo. La propia tabla de Anthropic muestra que pierde codificación agentiva en DeepSWE v1.1 ante GPT-5.6 Sol, 68.8% contra 72.7%[1].
  • No heredes la configuración de esfuerzo. Anthropic dice que low y medium ahora producen fuerte calidad con una fracción de los tokens y la latencia, y te dice que comiences en el high por defecto y te muevas en ambas direcciones contra tus propias evaluaciones[2].
  • Priority Tier no lo cubre, y se encuentra en su propio bucket de límite de velocidad en lugar del pool compartido de Opus[5][4].

Qué es Claude Opus 5

Anthropic posiciona Claude Opus 5 para codificación agentiva compleja y trabajo empresarial[2]. El identificador de API es claude-opus-5, sin sufijo de fecha para añadir.

PropiedadClaude Opus 5
ID del modelo APIclaude-opus-5
Ventana de contexto1M tokens, tanto el predeterminado como el máximo
Máxima salida128k tokens
Precio de lista$5 / $25 por millón de tokens de entrada / salida
Modo rápido$10 / $50, solo API de Claude
PensamientoActivado por defecto, adaptativo
Niveles de esfuerzolow, medium, high, xhigh, max, predeterminado high
Mínimo de caché de prompt512 tokens, reducido desde 1,024

No hay variante de contexto más pequeña[2]. La ventana de 1M es la que obtienes. Más allá de la API de Claude, el modelo está disponible en Amazon Bedrock como anthropic.claude-opus-5, en Google Cloud como claude-opus-5, y en Microsoft Foundry[2]. El modo rápido es la excepción: se ejecuta solo en la API de Claude, no en ninguna de las tres plataformas en la nube[2].

La tabla completa de evaluaciones oficial

Tabla de comparación publicada por Anthropic de Claude Opus 5 comparando Opus 5, Fable 5, Opus 4.8 y GPT-5.6 Sol en evaluaciones de codificación terminal agentiva, trabajo de conocimiento, resolución de problemas novedosos, búsqueda agentiva, razonamiento, uso de computadora, codificación agentiva, flujos de trabajo empresariales, legal, salud y biología

Esta es la comparación publicada por Anthropic, transcrita en su totalidad, incluyendo las filas en las que Opus 5 no gana[1]. Donde la columna de Fable 5 lleva un nombre de modelo diferente, eso es anotación propia de Anthropic.

EvaluaciónOpus 5Fable 5Opus 4.8GPT-5.6 Sol
Codificación terminal agentiva (Frontier-Bench v0.1)43.3%33.7%21.1%34.4%
Trabajo de conocimiento (GDPval-AA v2, Elo)1861174715931736
Resolución de problemas novedosos (ARC-AGI-3)30.2%1.5%7.8%
Búsqueda agentiva (BrowseComp)90.8%87.4%84.3%90.4%
Razonamiento multidisciplinario (HLE, sin herramientas)56.3%56.5%49.8%
Razonamiento multidisciplinario (HLE, con herramientas)64.7%63.9%57.9%
Uso de computadora (OSWorld 2.0)70.6%66.1%55.7%62.6%
Codificación agentiva (DeepSWE v1.1)68.8%69.7%59.0%72.7%
Codificación agentiva (FrontierCode v1.1, Main)53.4%53.5%46.5%47.5%
Flujos de trabajo empresariales (AutomationBench)26.0%17.4%17.0%18.1%
Legal (Legal Agent Benchmark, held-out)11.7%13.3%10.4%2.5%
Salud (HealthBench Professional)59.8%66.0% (Mythos 5)57.4%60.5%
Biología (BioMysteryBench, difícil)49.4%46.5%42.4%
Biología (BioMysteryBench, resuelta por humanos)90.1%89.0% (Mythos 5)88.5%

Una nota metodológica antes de que alguien cite estos números. En la gráfica acompañante que desglosa Frontier-Bench por nivel de esfuerzo, Anthropic afirma que esos resultados provienen de una ejecución interna en el arnés mini-SWE-agent con un backend de GKE, promediando la recompensa en cinco intentos por tarea, y que Opus 4.8 sirvió como fallback cuando los clasificadores de seguridad rechazaron una solicitud de Opus 5 o Fable 5[1]. Estas son evaluaciones ejecutadas por el vendedor. Léelas como una señal direccional, no como una auditoría neutral.

Dónde gana y dónde pierde

Opus 5 toma nueve de las catorce filas. Los márgenes en las victorias no son sutiles. Frontier-Bench va de 21.1% en Opus 4.8 a 43.3%, ligeramente más del doble. ARC-AGI-3 va de 1.5% a 30.2%, y el competidor más cercano en esa fila es GPT-5.6 Sol en 7.8%. AutomationBench se sitúa en 26.0% contra un grupo de 17% a 18%[1].

Pierde las otras cinco, y esas son más útiles para elegir un modelo que las victorias.

  • DeepSWE v1.1, codificación agentiva: 68.8% contra 72.7% de GPT-5.6 Sol. Esta es la pérdida más clara del tablero, y cae en la carga de trabajo para la que se comercializa Opus 5. Anthropic dejó la fila.
  • HealthBench Professional: 59.8%, por debajo de Mythos 5 con 66.0% y GPT-5.6 Sol con 60.5%.
  • Legal Agent Benchmark: 11.7% contra 13.3% de Fable 5. Ambos números son lo suficientemente bajos como para que el benchmark esté midiendo principalmente la distancia desde el objetivo.
  • HLE sin herramientas (56.3% contra 56.5%) y FrontierCode Main (53.4% contra 53.5%) son empates dentro del ruido, pero sí descartan la afirmación de que Opus 5 domina a Fable 5 en todo.

El patrón: Opus 5 gana donde una tarea se ejecuta durante mucho tiempo, usa herramientas y requiere mantener el estado en muchos pasos. Empieza o pierde en preguntas difíciles de una sola tirada.

La escalera de esfuerzo determina tu factura

Anthropic publica la escalera completa de puntuación versus costo en lugar de un número por evaluación, y leerla cambia cómo configuras el modelo[1].

Puntuación de codificación agentiva versus costo por intento en Frontier-Bench v0.1, trazando la escalera de esfuerzo para Claude Opus 5, Fable 5, Opus 4.8 y GPT-5.6 Sol en una escala de costo logarítmico

Tres cosas se derivan de ella.

El escalón superior no es el punto de partida recomendado. La instrucción de Anthropic es comenzar en el predeterminado, high, y ajustar en cualquier dirección según tus evaluaciones: baja donde la calidad se mantenga para ahorrar tokens y latencia, sube para el trabajo más exigente[2]. Observa dónde comienza esa oración. El punto de entrada recomendado es el medio de la escalera, no la parte superior, y el esfuerzo ahora tiene más peso porque Opus 5 convierte esfuerzo extra en mejores resultados más confiablemente que cualquier modelo Opus anterior[2].

Low y medium son más fuertes que antes. Anthropic llama explícitamente la atención sobre la eficiencia en esfuerzo bajo, diciendo que low y medium producen fuerte calidad con una fracción de los tokens y la latencia de configuraciones superiores[2]. Los valores de esfuerzo predeterminados transferidos de Opus 4.8 son el punto de partida incorrecto.

El esfuerzo es la palanca de costo, no el prompt. La orientación oficial es comenzar en el high predeterminado, luego moverte en cualquier dirección contra tus propias evaluaciones: baja donde la calidad se mantenga para ahorrar tokens y latencia, sube para el trabajo más exigente[2]. En xhigh o max, establece un max_tokens grande para que el modelo tenga espacio para pensar y actuar en sumagentes y llamadas de herramientas[2].

Dos cambios rotos bajo el capó

La superficie de solicitud se hereda principalmente de Opus 4.8. Los parámetros de muestreo aún se rechazan, los presupuestos de pensamiento fijos aún se rechazan y el prefill del último turno de asistente sigue fallando. Dos cosas sí cambiaron, y ambas rompen código transferido sin modificar.

El pensamiento se ejecuta cuando omites el parámetro. En Opus 4.8, una solicitud sin un campo thinking se ejecutaba sin pensar. En Opus 5, la misma solicitud piensa, con el modelo decidiendo cuándo y cuánto en cada turno[2]. El valor de wire no cambió; thinking: {"type": "adaptive"} sigue siendo válido y equivalente al predeterminado. Lo que cambió es qué sucede cuando no dices nada. Como max_tokens es un límite difícil en pensamiento más texto de respuesta juntos, Anthropic te dice que lo revises para cualquier carga de trabajo que se ejecutara sin pensar antes[2]. Un presupuesto ajustado solo para salida visible ahora se truncará a mitad de respuesta.

Apagar el pensamiento requiere esfuerzo high o inferior. thinking: {"type": "disabled"} emparejado con xhigh o max devuelve un 400. La verificación se ejecuta en cada solicitud, así que una sesión que tuvo éxito en high comienza a fallar en el momento en que una llamada posterior aumenta el esfuerzo mientras el pensamiento aún está desactivado[2].

Anthropic también documenta qué falla con el pensamiento apagado: el modelo puede escribir una llamada de herramienta en su salida de texto en lugar de emitir un bloque tool_use, o filtrar etiquetas XML internas en la respuesta visible[2]. El primer modo de fallo es el peligroso en un bucle de agente, porque el turno termina limpiamente y la llamada nunca se ejecuta. La recomendación oficial es mantener el pensamiento activado y controlar el costo con un nivel de esfuerzo más bajo en su lugar.

Tres adiciones vale la pena conocer:

  • Cambios de herramientas a mitad de conversación (encabezado beta mid-conversation-tool-changes-2026-07-01) te permiten añadir o quitar herramientas entre turnos mientras preservas el caché de prompt, en lugar de fijar una lista de herramientas para la vida de una sesión[2].
  • Un modo de fallback "default" (encabezado beta server-side-fallback-2026-07-01) aplica los modelos fallback recomendados por Anthropic por categoría de rechazo en lugar de una lista que mantengas[2].
  • El mínimo de caché de prompt se redujo a 512 tokens desde 1,024, así que los prompts previamente demasiado cortos para caché ahora crean entradas de caché sin cambios de código[2].

Lo que realmente mueve la factura

Aquí está la tarifa oficial completa[3]:

ArtículoPrecio por MTok
Entrada$5
Salida$25
Aciertos de caché y refrescos$0.50
Escritura de caché (5 minutos)$6.25
Escritura de caché (1 hora)$10
Entrada de Batch$2.50
Salida de Batch$12.50
Entrada de modo rápido$10
Salida de modo rápido$50

La API de Batch se ejecuta a la mitad de la tasa estándar en ambas dimensiones, y el modo rápido duplica ambas[3]. Anthropic describe Opus 5 como entregando inteligencia de frontera a la mitad del costo de Claude Fable 5[2], lo que se verifica contra la tarifa: Fable 5 se lista en $10 / $50[3].

Tres palancas importan más que la tasa por token.

Esfuerzo. El diferencial de costo por intento publicado en toda la escalera es lo suficientemente amplio como para que mover una ruta de xhigh a medium ahorres más que cualquier reescritura de prompt[1].

Verbosidad. Anthropic afirma que las respuestas predeterminadas y los entregables escritos se ejecutan más largos en Opus 5[2]. Los tokens de pensamiento se facturan como salida, al igual que la prosa extra. Bajar el esfuerzo reduce el pensamiento pero no reduce confiablemente la salida visible, así que escribe una instrucción explícita de brevedad.

Andamiaje de verificación que ahora puedes eliminar. Opus 5 verifica su propio trabajo sin ser le diga, y Anthropic dice que las instrucciones transferidas de modelos anteriores, como "incluye un paso de verificación final" o "usa un sumagente para verificar", causan sobre-verificación[2]. Eliminarlas reduce el gasto de tokens sin compensación de calidad, que es un tipo raro de optimización.

Límites de velocidad y Priority Tier

Dos hechos operacionales que atrapan a los equipos durante el lanzamiento.

Priority Tier no cubre Claude Opus 5. La documentación de nivel de servicio de Anthropic afirma que Priority Tier es soportado en todos los modelos de Claude disponibles excepto Claude Mythos 5, Claude Mythos Preview, Claude Opus 5 y Claude Sonnet 5[5]. Si tu planificación de capacidad asumía cobertura de Priority Tier, no se aplica aquí.

Opus 5 también tiene su propio bucket de límite de velocidad. El límite combinado de Opus se aplica al tráfico en Opus 4.8, 4.7, 4.6 y 4.5; Opus 5 no es parte de ese pool[4]. Eso es buena noticia durante una migración, ya que el tráfico de Opus 5 no consume el presupuesto del que dependen tus rutas Opus 4.8 existentes. El modo rápido tiene límites dedicados de nuevo separados de los límites de Opus estándar, y devuelve un 429 con un encabezado retry-after cuando se excede[4].

Cómo usar Claude Opus 5: lista de verificación de migración

La orientación de migración de Anthropic se reduce a un cambio de cadena de modelo más una revisión de los dos cambios de comportamiento[2]. En la práctica la lista es un poco más larga.

  1. Cambia la cadena de modelo a claude-opus-5.
  2. Audita cada ruta que desactiva el pensamiento. Mantén el pensamiento desactivado y baja el esfuerzo a high o inferior, o mantén el nivel de esfuerzo y elimina el campo thinking.
  3. Aumenta max_tokens en rutas que nunca establecen un campo thinking. Ahora piensan, y el presupuesto cubre ambos.
  4. Vuelve a ejecutar un barrido de esfuerzo contra tus propias evaluaciones. Comienza en el high predeterminado y muévete en ambas direcciones en lugar de heredar la configuración de Opus 4.8.
  5. Elimina instrucciones de verificación de prompts y pasos de verificación de arneses.
  6. Añade una instrucción explícita de brevedad a rutas orientadas al usuario.
  7. Recomprueba prompts cortos que habías descartado como no almacenables en caché contra el nuevo mínimo de 512 tokens.
  8. Maneja rechazos como respuestas, no como errores. Los clasificadores de seguridad pueden rechazar una solicitud y devolver una razón de parada en lugar de un error HTTP, así que el código que lee el primer bloque de contenido incondicionalmente se romperá.

Llamando a Claude Opus 5 junto con tus otros modelos

Todo lo anterior señala el mismo problema operacional. Este modelo tiene cinco niveles de esfuerzo, su propio bucket de límite de velocidad, sin Priority Tier, y una tabla de evaluaciones donde pierde codificación agentiva ante GPT-5.6 Sol y salud ante Mythos 5. La configuración correcta no es una configuración. Es una decisión de enrutamiento por carga de trabajo, y cambia cada vez que un vendedor envía.

Esa es la capa que vale la pena construir deliberadamente. Un pase de revisión de código y un trabajo de extracción masiva no tienen negocios ejecutándose con el mismo esfuerzo, y una ruta en la que Opus 5 pierde no tiene negocios permaneciendo en Opus 5 por hábito. Manejar eso con un cliente SDK por vendedor, una clave por vendedor y una superficie de facturación por vendedor es donde el costo del trabajo con múltiples modelos realmente se acumula.

reAPI expone Claude Opus 5 a través de un endpoint /v1/chat/completions compatible con OpenAI, así que el cliente que ya usas para llamadas GPT y Gemini lo llama también:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

resp = client.chat.completions.create(
    model="claude-opus-5",
    messages=[{"role": "user", "content": "Refactor this module and add tests."}],
    max_tokens=16000,
    stream=True,
)

Las tasas en la puerta de enlace son $2.40 por millón de tokens de entrada y $12.00 por millón de salida, que es el 48% de los $5 / $25 publicados por Anthropic. La superficie completa de solicitud, incluyendo output_config.effort y las reglas de pensamiento anteriores, se documenta en la página reapi.ai/docs/claude-opus-5, y las tasas actuales se encuentran en reapi.ai/models/claude-opus-5.

Nada de eso elimina la decisión de enrutamiento. Elimina el impuesto de integración en hacer uno.

FAQ

¿Es Claude Opus 5 mejor que Claude Fable 5?

En nueve de las catorce filas de la tabla publicada por Anthropic, sí, y a la mitad del precio de lista de Fable 5[3]. Pero Fable 5 aún toma HLE sin herramientas, FrontierCode Main y el Legal Agent Benchmark, y la fila de HealthBench Professional va a Mythos 5[1].

¿Cuesta Claude Opus 5 más que Opus 4.8?

No. Ambos se listan en $5 por millón de tokens de entrada y $25 por millón de salida[3]. Anthropic envió el salto de capacidad sin un cambio de precio[2].

¿Cuál es el cambio roto más grande de Opus 4.8?

El pensamiento está activado por defecto. Una solicitud que omitía el campo thinking se ejecutaba sin pensar en Opus 4.8 y piensa en Opus 5, lo que cambia tanto el costo como el comportamiento de max_tokens. Segundo es que thinking: {"type": "disabled"} ahora devuelve un 400 en esfuerzo xhigh o max[2].

¿Qué nivel de esfuerzo debo usar?

Comienza con el predeterminado, high, luego barre en ambas direcciones contra tus propias evaluaciones[2]. Anthropic enmarca max como el nivel superior para el razonamiento más profundo posible en lugar de un mejor predeterminado, y además señala que low y medium se mantienen con una fracción de los tokens y la latencia en este modelo[2].

¿Cuál es la ventana de contexto de Claude Opus 5?

1M tokens, que es tanto el predeterminado como el máximo. No hay variante de contexto más pequeña. La salida máxima es 128k tokens[2].

¿Está Claude Opus 5 cubierto por Priority Tier?

No. Priority Tier cubre todos los modelos de Claude disponibles excepto Mythos 5, Mythos Preview, Opus 5 y Sonnet 5[5]. Opus 5 también se sienta en su propio bucket de límite de velocidad en lugar del pool Opus 4.x combinado[4].

¿Aún puedo apagar el pensamiento?

Sí, en esfuerzo high o inferior. Anthropic desaconseja, documentando que el modelo puede escribir llamadas de herramienta en texto visible o filtrar etiquetas internas cuando el pensamiento está desactivado, y recomienda bajar el esfuerzo en su lugar[2].

¿Cómo llamo a Claude Opus 5 con el SDK de OpenAI?

Apunta el cliente de OpenAI a https://api.reapi.ai/v1, establece model en claude-opus-5 y envía una solicitud de chat normal. El endpoint es compatible con OpenAI, así que no es necesaria una reescritura de SDK.

Eligiendo un nivel de esfuerzo y siguiendo adelante

Lo interesante de este lanzamiento es que la página de precios es la parte menos informativa. El precio de lista no cambió, así que todo el delta está en el comportamiento: pensamiento activado por defecto, un 400 que no existía antes, un piso de caché cortado a la mitad, y una escalera de esfuerzo cuyo punto de entrada recomendado es el escalón medio en lugar del superior. Anthropic también publicó cinco filas de evaluación donde su nuevo buque insignia pierde, que vale más que las nueve donde gana.

Si estás migrando, el trabajo es pequeño y específico. Cambia la cadena de modelo, audita las rutas que desactivan el pensamiento, aumenta max_tokens donde el pensamiento es ahora implícito, elimina las instrucciones de verificación que escribiste para un modelo anterior, y barre esfuerzo contra tus propias evaluaciones en lugar de heredar una configuración. Eso es cómo usar Claude Opus 5 sin pagar por el escalón superior de una escalera que deja de subir.

Referencias

  1. Anthropic. Introducing Claude Opus 5 — benchmark comparison table and effort-level cost curves. Retrieved July 2026 from anthropic.com/news/claude-opus-5
  2. Anthropic. What's new in Claude Opus 5 — behavior changes, new features, availability, and migration. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/models/whats-new-opus-5
  3. Anthropic. Pricing — token, cache, batch, and fast-mode rates. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/pricing
  4. Anthropic. Rate limits — per-model buckets and fast-mode limits. Retrieved July 2026 from platform.claude.com/docs/en/api/rate-limits
  5. Anthropic. Service tiers — Priority Tier model coverage. Retrieved July 2026 from platform.claude.com/docs/en/api/service-tiers
  6. Anthropic. Release notes — Claude Opus 5 launch entry dated July 24, 2026. Retrieved July 2026 from platform.claude.com/docs/en/release-notes/overview

Lectura adicional