Seedance 2.5 is live — 30-second cinematic video with native audio & real-person references
Cómo usar Claude Sonnet 5: esfuerzo, coste y límites
2026/07/27

Cómo usar Claude Sonnet 5: esfuerzo, coste y límites

Cómo usar Claude Sonnet 5: comparación con Opus 4.8, escala de esfuerzo que define coste, codificador denso e infla facturas, y pasos de migración.

Anthropic lanzó Claude Sonnet 5 el 30 de junio de 2026 con un argumento inusualmente directo: inteligencia cercana a Opus en codificación y trabajo de agentes, al precio de Sonnet[1]. Los benchmarks oficiales respaldan la mayoría de las afirmaciones.

Saber cómo usar Claude Sonnet 5 bien se reduce principalmente a dos cosas que el anuncio no destaca. La escala de esfuerzo es la palanca que hace real la afirmación de coste, y un codificador más denso significa que el mismo prompt ahora cuesta aproximadamente un 30% más de tokens que en Sonnet 4.6, por lo que una migración que solo intercambie la cadena de modelo cambiará silenciosamente tu factura y puede truncar la salida[1].

Esta guía cubre los benchmarks, dónde Sonnet 5 iguala y dónde se queda atrás de Opus 4.8, los cuatro cambios en la API que rompen el código existente, el precio incluyendo el aumento de septiembre, y quién debería usarlo realmente.

Resumen

  • Casi Opus en trabajo de conocimiento. GDPval-AA v2 Elo de 1618 contra 1615 de Opus 4.8, un empate estadístico[1].
  • Aún se queda atrás en lo difícil. SWE-bench Pro 63.2% contra 69.2%, y USAMO 2026 79.5% contra 96.7%[1].
  • El precio introductorio se extiende hasta el 31 de agosto de 2026: $2 entrada / $10 salida por millón de tokens, aumentando a $3 / $15 el 1 de septiembre[1].
  • Primer Sonnet con la escala de esfuerzo completa: low, medium, high (por defecto), xhigh, max[1].
  • El codificador es aproximadamente un 30% más denso. Los precios por token no cambian, así que una solicitud idéntica cuesta más que en Sonnet 4.6. Reajusta la línea base antes de migrar[1].
  • budget_tokens y parámetros de muestreo ahora devuelven 400[1].

Qué es Claude Sonnet 5

Claude Sonnet 5 (claude-sonnet-5) reemplaza a Sonnet 4.6 como sustituto directo. Anthropic lo llama el modelo Sonnet más orientado a agentes jamás creado, diseñado para hacer planes, dirigir navegadores y terminales, y ejecutarse autónomamente durante largos períodos a un nivel que recientemente requería modelos más grandes y costosos[1].

Se lanzó como el modelo predeterminado para usuarios gratuitos y profesionales en claude.ai, y simultáneamente en la API de Claude, Amazon Bedrock, Google Cloud Vertex AI y Microsoft Foundry en vista previa. Tiene una ventana de contexto de 1M de tokens por defecto y salida máxima de 128K[1].

Benchmarks

Comparación de benchmark de Claude Sonnet 5 contra Sonnet 4.6 y Opus 4.8 en codificación de agentes, razonamiento, uso de computadora y trabajo de conocimiento

BenchmarkSonnet 5Sonnet 4.6Opus 4.8 (referencia)
Codificación de agentes (SWE-bench Pro)63.2%58.1%69.2%
Codificación de agentes (Terminal-Bench 2.1)80.4%67.0%82.7%
Razonamiento (HLE, sin herramientas)43.2%34.6%49.8%
Razonamiento (HLE, con herramientas)57.4%46.8%57.9%
Uso de computadora (OSWorld-Verified)81.2%78.5%83.4%
Trabajo de conocimiento (GDPval-AA v2, Elo)161813951615

Dos cosas destacan. Contra Sonnet 4.6 esta es una victoria limpia con saltos reales: Terminal-Bench sube 13.4 puntos y el Elo de trabajo de conocimiento aumenta 223. Y en trabajo de conocimiento Sonnet 5 nominalmente supera a Opus 4.8, 1618 contra 1615, lo que es un empate, mientras aterriza dentro de aproximadamente dos a seis puntos de la insignia en codificación de agentes y uso de computadora[1].

Esa brecha de "dentro de unos pocos puntos, a un tercio del coste" es toda la propuesta de valor.

Números más profundos de la tarjeta del sistema: 85.2% en el subconjunto clásico de 500 problemas SWE-bench Verified, 78.3% en SWE-bench Multilingüe en nueve idiomas, y 38.8 en FrontierCode v1 de Cognition, más del doble del 15.1 de Sonnet 4.6. La medición independiente de Cursor lo sitúa en 61.2% en CursorBench contra 49% de Sonnet 4.6 y 63.8% de Opus 4.8. BrowseComp alcanza 84.7% de agente único y 86.6% multiagente[1].

Un punto débil honesto: en USAMO 2026 Sonnet 5 obtiene 79.5%, un gran salto respecto al 55.0% de Sonnet 4.6 pero muy por detrás del 96.7% de Opus 4.8[1]. Las matemáticas de pruebas formales pesadas no son el trabajo de este modelo.

La escala de esfuerzo es la palanca de coste

Sonnet 5 es el primer modelo de nivel Sonnet que expone la escala completa: low, medium, high (el valor predeterminado), xhigh y max[1]. No es un botón cosmético. Es lo que hace real la afirmación de calidad Opus a precio Sonnet.

Rendimiento de búsqueda de agentes por nivel de esfuerzo en BrowseComp, trazando tasa de éxito contra coste por tarea para Claude Sonnet 5, Opus 4.8 y Sonnet 4.6

La curva de BrowseComp es la ilustración más clara. La precisión de Sonnet 5 sube de aproximadamente 60% en low a aproximadamente 85% en max, y alcanza precisión de clase Opus 4.8 a un coste por tarea notablemente menor. Opus 4.8 sigue siendo un poco más alta, pero Sonnet 5 llega la mayor parte del camino por mucho menos dinero, que es exactamente lo que un bucle de agente de alto volumen necesita[1].

El uso de computadora cuenta una historia más sobria.

Rendimiento de uso de computadora por nivel de esfuerzo en OSWorld-Verified, donde Opus 4.8 lidera Claude Sonnet 5 en todos los niveles de esfuerzo

En OSWorld-Verified, Opus 4.8 se mantiene por delante en todos los niveles de esfuerzo. Sonnet 5 sigue superando cómodamente a Sonnet 4.6 y sigue siendo mucho más barato, pero si el control preciso de GUI en píxeles es tu carga de trabajo principal la insignia mantiene una verdadera ventaja[1].

La regla práctica: xhigh para las tareas de codificación y agentes más difíciles de larga duración, high para la mayoría del trabajo, medium o low para trabajos sensibles a la latencia o simples. Ajusta por ruta en lugar de establecer max como predeterminado en todas partes.

Contra el nivel comparable en coste

La tarjeta del sistema publica números de competidores contra GPT-5.5 y Gemini 3.5 Flash, que es el nivel comparable en coste en lugar de la frontera absoluta. Léelo como "supera los modelos a su precio", no "supera todo"[1].

EvaluaciónSonnet 5GPT-5.5Gemini 3.5 Flash
SWE-bench Pro63.258.655.1
Terminal-Bench 2.180.483.476.2
HLE (sin herramientas)43.241.440.2
HLE (con herramientas)57.452.2n/a
OSWorld-Verified81.278.778.4
FrontierCode v138.825.5n/a
GDPval-AA v2 (Elo)161815091357
AutomationBench13.512.914.5
HealthBench Professional57.851.8n/a

Sonnet 5 gana la mayoría de comparaciones uno a uno contra GPT-5.5 y pierde la que se cita más: Terminal-Bench 2.1, donde GPT-5.5 conduciendo la CLI de Codex obtiene 83.4 contra 80.4. Contra Gemini 3.5 Flash el barrido es más amplio, con AutomationBench la única excepción. Ten en cuenta que los puntajes de AutomationBench son bajos en todos lados; estos son benchmarks no saturados, no resueltos[1].

Dónde iguala a Opus 4.8 y dónde se queda atrás

Iguala o supera: trabajo de conocimiento GDPval-AA v2 (1618 contra 1615), búsqueda de agentes en BrowseComp a precisión comparable por coste de tarea, Real-World Finance v2 (1219 contra 1222), y AA-Briefcase Elo de trabajo profesional (1393 contra 1352)[1].

Se queda atrás: SWE-bench Pro (63.2 contra 69.2), Terminal-Bench 2.1 (80.4 contra 82.7), OSWorld (81.2 contra 83.4), HLE sin herramientas (43.2 contra 49.8), CursorBench (61.2 contra 63.8), Toolathlon (54.3 contra 59.9), y USAMO 2026 (79.5 contra 96.7)[1].

El patrón es consistente. En trabajo de conocimiento abierto y búsqueda de agentes, Sonnet 5 es efectivamente de clase Opus. En codificación más difícil, uso de computadora y matemáticas formales, Opus 4.8 mantiene una verdadera pero modesta ventaja. Para cargas de trabajo que ejecutan muchas vueltas de agente donde el coste domina, Sonnet 5 es el predeterminado racional y Opus es la ruta de escalada para la cola difícil.

Cómo usar Claude Sonnet 5: cuatro cambios que rompen código antiguo

Sonnet 5 adopta la superficie de solicitud Opus 4.7/4.8, así que migrar es más que intercambiar una cadena[1].

El razonamiento adaptativo está activado de forma predeterminada. Sonnet 4.6 se ejecutaba sin pensar a menos que se le pidiera. Sonnet 5 piensa adaptativamente de forma predeterminada, decidiendo por solicitud cuánto razonamiento garantiza una tarea. Todavía puedes desactivarlo explícitamente cuando necesitas velocidad bruta.

budget_tokens se elimina. Los presupuestos de pensamiento manual ahora devuelven un 400. Controla la profundidad a través de niveles de esfuerzo.

Se rechazan parámetros de muestreo. temperature, top_p y top_k no predeterminados devuelven un 400. Dirígete con solicitud.

El codificador es aproximadamente un 30% más denso. Sonnet 5 comparte el codificador introducido con Opus 4.7, que convierte el mismo texto en aproximadamente 30% más tokens. Los precios por token no cambian, así que una solicitud equivalente puede costar más que en Sonnet 4.6, y un límite max_tokens ajustado para el codificador antiguo puede ahora truncar la salida en medio del pensamiento.

Ese último es la sorpresa cara. Vuelve a medir el gasto real en tus propios prompts en lugar de asumir que el precio de etiqueta se asigna limpiamente desde Sonnet 4.6.

Una adición de capacidad vale la pena mencionar: Sonnet 5 es el primer modelo de nivel Sonnet con un nivel de imagen de alta resolución, hasta 2576 píxeles en el borde largo y 4784 tokens visuales, contra el antiguo límite de 1568 píxeles. Se activa automáticamente, lo que importa para comprender documentos, gráficos y capturas de pantalla densas[1].

Precios

ElementoIntroductorio (hasta 31 ago, 2026)Estándar (desde 1 sep, 2026)
Entrada$2 / MTok$3 / MTok
Salida$10 / MTok$15 / MTok
Lectura de caché~$0.20 / MTok~$0.30 / MTok
Lote$1 / $550% de estándar

Contra Opus 4.8 a $5 / $25, Sonnet 5 es aproximadamente un tercio del coste a tasas introductorias y aproximadamente 60% a tasas estándar[1]. Combina el selector de esfuerzo y el almacenamiento en caché de prompts y la brecha se amplía para una carga de trabajo de agente bien ajustada.

Dos advertencias. El codificador más denso significa que debes recomputar el gasto real en lugar de confiar en la comparación de etiqueta de precio. Y Priority Tier no está disponible en Sonnet 5[1].

Comportamiento de seguridad que tu código debe manejar

Sonnet 5 es el primer modelo de nivel Sonnet que se envía con protecciones de ciberseguridad en tiempo real. Las solicitudes que tocan temas de cibernética y biología prohibidos o de alto riesgo pueden ser rechazadas, devueltas como un HTTP 200 exitoso con motivo de parada de rechazo en lugar de error[1].

Si construyes herramientas de seguridad o flujos de trabajo de ciencias de la vida donde solicitudes benignas pero adyacentes podrían activar un clasificador, maneja ese motivo de parada explícitamente en lugar de asumir que cada 200 lleva contenido utilizable. Anthropic también reporta tasas de alucinación y adulación más bajas que Sonnet 4.6, lo que importa dondequiera que la salida sea confiada aguas abajo sin una verificación humana[1].

Quién debería usar Claude Sonnet 5

Es el predeterminado racional para cargas de trabajo de agentes de alto volumen donde el coste por turno se suma: agentes de codificación, automatización de navegador y terminal, bucles de recuperación e investigación. Se ajusta a constructores de productos que incrustan un LLM en una característica de envío, y trabajo de documentos de contexto largo donde la ventana de 1M y el bajo precio por token hacen viable el procesamiento en masa.

Recurre a Opus 4.8 u Opus 5 en su lugar cuando la tarea está en la cola difícil: la codificación más exigente, el uso de computadora pixel-exacto, o matemáticas formales, donde la ventaja de pocos puntos de la insignia vale la prima.

Ejecutar un modelo de nivel Sonnet en reAPI

Para ser directo sobre la cobertura: Claude Sonnet 5 no está en la puerta de entrada de reAPI hoy. El modelo de nivel Sonnet disponible es Claude Sonnet 4.6, y los modelos de Claude en la puerta de entrada son Opus 5, Opus 4.8, Opus 4.7, Sonnet 4.6 y Fable 5.

Eso importa menos de lo que parece, por dónde los precios realmente aterrizan. Sonnet 5 se lista a $3 / $15 desde septiembre. En reAPI, Claude Opus 5 se ejecuta en $2.40 / $12.00 y Sonnet 4.6 igual. Así que el modelo de nivel superior cuesta menos en la puerta de entrada que el precio de lista estándar de Sonnet 5, y Opus 5 es el modelo que Anthropic describe como entregando inteligencia fronteriza a mitad del coste de Fable 5.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_REAPI_KEY",
    base_url="https://api.reapi.ai/v1",
)

resp = client.chat.completions.create(
    model="claude-opus-5",
    messages=[{"role": "user", "content": "Plan and run this multi-step refactor."}],
    max_tokens=16000,
    stream=True,
)

El punto final es compatible con OpenAI y la superficie /v1/messages de Anthropic nativa también está disponible. Las tasas y formas de solicitud están en reapi.ai/models, y la referencia de Opus 5 está en reapi.ai/docs/claude-opus-5.

Si tu evaluación requiere específicamente el comportamiento de Sonnet 5 en lugar de su punto de precio, llámalo directamente a través de Anthropic.

FAQ

¿Claude Sonnet 5 es mejor que Opus 4.8?

En trabajo de conocimiento abierto y búsqueda de agentes están efectivamente empatados, y Sonnet 5 supera ligeramente a Opus en GDPval-AA v2 (1618 contra 1615). En codificación más difícil, uso de computadora y matemáticas formales, Opus 4.8 mantiene una ventaja modesta[1].

¿Cuánto cuesta Claude Sonnet 5?

$2 por millón de tokens de entrada y $10 por millón de salida hasta el 31 de agosto de 2026, aumentando a $3 / $15 el 1 de septiembre. El almacenamiento en caché de prompts reduce las lecturas de contexto en caché en aproximadamente 90%, y la API de lotes reduce la tasa a la mitad[1].

¿Qué es el nivel de esfuerzo xhigh?

Una configuración de esfuerzo entre high y max, ajustada para tareas de agentes y codificación de larga duración. Sonnet 5 es el primer modelo de nivel Sonnet que soporta la escala completa[1].

¿Por qué subieron mis costes después de migrar desde Sonnet 4.6?

El codificador es aproximadamente un 30% más denso, así que el mismo texto se convierte en aproximadamente 30% más tokens a precios por token no cambiados. Recuenta tus prompts y sube max_tokens para que las salidas largas no se truncen[1].

¿Claude Sonnet 5 soporta una ventana de contexto de 1M tokens?

Sí, 1M por defecto a la tasa estándar por token sin recargo de contexto largo, y hasta 128K tokens de salida[1].

¿Qué se rompe al migrar desde Sonnet 4.6?

budget_tokens devuelve un 400, parámetros de muestreo no predeterminados devuelven un 400, el razonamiento adaptativo es ahora el predeterminado, y el codificador más denso cambia tanto el comportamiento de coste como de truncamiento[1].

¿Puede Claude Sonnet 5 controlar una computadora?

Sí. Soporta uso de herramientas, búsqueda web, búsqueda web, ejecución de código y uso de computadora, puntuando 81.2% en OSWorld-Verified contra 83.4% de Opus 4.8[1].

¿Está Claude Sonnet 5 disponible en reAPI?

Actualmente no. La puerta de entrada lleva Claude Opus 5, Opus 4.8, Opus 4.7, Sonnet 4.6 y Fable 5. Opus 5 en reAPI cuesta menos por token que la tasa de lista estándar de Sonnet 5.

Elegir entre un nivel y un punto de precio

Claude Sonnet 5 cumple su promesa central. Para codificación y trabajo de agentes aterriza lo suficientemente cerca de Opus 4.8 que, a un tercio del coste durante la ventana introductoria, se convierte en el predeterminado sensato y reserva la insignia para la cola difícil. Gana la mayoría de comparaciones uno a uno contra GPT-5.5 y Gemini 3.5 Flash, con excepciones honestas en Terminal-Bench, AutomationBench y matemáticas formales.

Dos cosas deciden si ese cálculo sobrevive al contacto con tu carga de trabajo. El aumento de precio de septiembre lo lleva de un tercio de Opus a aproximadamente 60%, y el codificador más denso significa que la comparación de etiqueta subestima el gasto real. Mide ambos en tus propios prompts antes de comprometerte. Esa es la forma de usar Claude Sonnet 5 sin descubrir el codificador en tu factura, y es también por qué el nivel de etiqueta importa menos que el número que realmente pagas por tarea completada.

References

  1. Anthropic. Introducing Claude Sonnet 5. Retrieved July 2026 from anthropic.com/news/claude-sonnet-5
  2. Anthropic. Models overview — specs and pricing for all current Claude models. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/models/overview
  3. Anthropic. Pricing — token, cache, and batch rates. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/pricing

Further reading