
Cuál es el mejor modelo Claude para programación y escritura
Fable 5 lidera SWE-Bench Pro, pero Opus 5 gana en tareas de terminal y trabajo de conocimiento con precio mucho más bajo. Compara benchmarks y costos.
«Cuál es el mejor modelo Claude para programación» tiene una respuesta diferente según si hablas de la puntuación de benchmark más alta, el mejor resultado por dólar, o el modelo que no te sorprenderá a las 2am. Son tres modelos distintos.
Los números publicados resuelven más de lo que la gente espera, incluyendo una fila donde la propia tabla de Anthropic muestra a su modelo insignia perdiendo.
TL;DR
- Puntuación de codificación agnóstica más alta: Claude Fable 5 al 80.3% en SWE-Bench Pro[1].
- Mejor defecto para la mayoría de equipos: Claude Opus 5, que Anthropic posiciona para codificación agnóstica compleja y trabajo empresarial[2].
- Opus 5 pierde una fila de codificación. GPT-5.6 Sol toma DeepSWE v1.1 al 72.7% contra 68.8% de Opus 5 en la propia tabla de Anthropic[3].
- En escritura, la clasificación se invierte hacia el trabajo de conocimiento, donde Opus 5 lidera GDPval-AA v2 en 1861[3].
- El nivel de esfuerzo importa más que la elección de modelo bajo la frontera:
lowymediumen Opus 5 se mantienen inusualmente bien[2]. - En reAPI, Opus 5 cuesta menos que Fable 5 por un amplio margen, lo que cambia el cálculo.
Los números de programación

Tres modelos están en seria competencia. Aquí está lo que Anthropic publicó para cada uno.
| Benchmark | Fable 5 | Opus 5 | Opus 4.8 |
|---|---|---|---|
| SWE-Bench Pro (codificación agnóstica) | 80.3% | n/a | 69.2% |
| FrontierCode Diamond (codificación más difícil) | 29.3% | 53.4%† | 13.4% |
| Terminal-Bench 2.1 | 88.0%* | n/a | 82.7% |
| Frontier-Bench v0.1 (terminal agnóstica) | 33.7% | 43.3% | 21.1% |
| DeepSWE v1.1 (codificación agnóstica) | 69.7% | 68.8% | 59.0% |
* Una fila marcada es una donde Anthropic advierte que el Fable 5 público diverge del hermano sin restricciones porque los clasificadores de seguridad se activan; espera que el modelo que realmente puedas llamar caiga más cerca de Opus 4.8 allí[1]. † FrontierCode v1.1 Main, un corte diferente del benchmark que el subconjunto Diamond en la columna de Fable 5, así que lee hacia abajo la columna en lugar de cruzar esta fila.
Dos conclusiones emergen de esa tabla.
Fable 5 es el líder en la tabla de codificación donde los benchmarks son directamente comparables, y por un margen real en SWE-Bench Pro[1].
Opus 5 gana el benchmark de terminal agnóstico más nuevo de manera decisiva, más que duplicando la puntuación de Frontier-Bench de Opus 4.8[3].
La fila que Anthropic incluyó
En DeepSWE v1.1, la propia tabla de comparación de Anthropic pone GPT-5.6 Sol al 72.7% contra el 68.8% de Opus 5[3]. Esa es la pérdida de codificación más clara en el tablero, y cae exactamente en la carga de trabajo para la que se comercializa Opus 5.
Vale la pena tomarla en serio en lugar de explicarla. Si tu evaluación se parece a DeepSWE, un competidor puntúa más alto en los números del propio vendedor. Si se parece a trabajo de terminal de largo horizonte, Opus 5 gana la misma tabla por nueve puntos sobre ese competidor.
La lección no es que un modelo sea mejor. Es que «mejor para programación» se resuelve diferente dependiendo de qué benchmark de programación coincida con tu trabajo.
Cuál para escritura
Haz la pregunta de escritura y la clasificación se reorganiza, porque la escritura vive más cerca del trabajo de conocimiento que del código.
| Benchmark | Opus 5 | Fable 5 | Opus 4.8 |
|---|---|---|---|
| GDPval-AA v2 (trabajo de conocimiento, Elo) | 1861 | 1747 | 1593 |
| Humanity's Last Exam, sin herramientas | 56.3% | 56.5% | 49.8% |
| Humanity's Last Exam, con herramientas | 64.7% | 63.9% | 57.9% |
Opus 5 lidera el trabajo de conocimiento por 114 Elo sobre Fable 5[3]. En razonamiento sin herramientas, los dos son estadísticamente equivalentes.
Para redacción, edición y síntesis, esa brecha de GDPval es la señal relevante, y apunta a Opus 5 en lugar del modelo que lidera la tabla de codificación.
La variable que supera la elección de modelo
Bajo la frontera, el nivel de esfuerzo mueve resultados más que cambiar modelos.
Anthropic describe a Opus 5 como convertir esfuerzo adicional en mejores resultados de manera más confiable que cualquier modelo Opus anterior, y por separado señala que low y medium producen calidad fuerte con una fracción de tokens y latencia[2]. La guía oficial es comenzar en el valor predeterminado high y barrer en ambas direcciones contra tus propias evaluaciones.
Eso tiene una consecuencia práctica para toda esta pregunta. Un equipo que elige el modelo «mejor» y deja el esfuerzo en un valor predeterminado heredado a menudo obtiene peores resultados, más lentamente, que un equipo en el nivel inferior que tuned el dial.
Lo que cuesta en reAPI
La elección de modelo es una decisión de costo tanto como de capacidad.
| Modelo | Entrada / salida por 1M tokens |
|---|---|
| Claude Fable 5 | $8.00 / $40.00 |
| Claude Opus 5 | $2.40 / $12.00 |
| Claude Opus 4.8 | $4.00 / $20.00 |
| Claude Sonnet 4.6 | $2.40 / $12.00 |
Fable 5 cuesta más de tres veces Opus 5 en la misma puerta de enlace. Eso replantea la pregunta de codificación: la ventaja de SWE-Bench Pro de Fable 5 es real, y estás pagando más de 3x por ella, en un modelo que además lleva retención obligatoria de 30 días y una capa de negativa de refusal[1].
Para la mayoría de equipos ese cálculo no se justifica. Para una migración de escala de repositorio donde una ejecución fallida cuesta más que los tokens, sí puede.
Eligiendo
Por defecto, elige Opus 5. Mejor puntuación de trabajo de conocimiento, decisivo en el benchmark de terminal agnóstico más nuevo, y el más barato de los tres en esta puerta de enlace.
Recurre a Fable 5 cuando la tarea es largo horizonte y difícil y lo has medido ganando en tu propio trabajo. La curva de FrontierCode es el argumento honesto: en los problemas más duros, esfuerzo extra sigue comprando precisión donde otros modelos se aplastan[1].
Quédate en Opus 4.8 cuando tus evaluaciones ya están calibradas para ello, o cuando necesitas pensar deshabilitado a nivel de esfuerzo alto, que Opus 5 rechaza[2].
Considera un modelo que no sea Claude si tu carga de trabajo se parece a DeepSWE. La propia tabla del vendedor lo dice.
from openai import OpenAI
client = OpenAI(api_key="YOUR_REAPI_KEY", base_url="https://api.reapi.ai/v1")
resp = client.chat.completions.create(
model="claude-opus-5",
messages=[{"role": "user", "content": "Refactor this module and add tests."}],
max_tokens=16000,
stream=True,
)Cambiar entre ellos es un cambio de cadena de modelo en una clave. Las tarifas están en reapi.ai/models.
FAQ
¿Cuál es el mejor modelo Claude para programación?
Fable 5 lidera los benchmarks de codificación directamente comparables, notablemente SWE-Bench Pro al 80.3%[1]. Opus 5 gana el benchmark de terminal agnóstico más nuevo y cuesta mucho menos, lo que lo hace el mejor defecto para la mayoría de equipos[3].
¿Cuál es el mejor modelo Claude para escritura?
Opus 5. Lidera el trabajo de conocimiento en GDPval-AA v2 en 1861 Elo, 114 puntos por delante de Fable 5[3].
¿Claude supera GPT en programación?
No en cada benchmark. La propia tabla de Anthropic muestra a GPT-5.6 Sol ganando DeepSWE v1.1 al 72.7% contra el 68.8% de Opus 5, mientras Opus 5 lidera la misma tabla en trabajo de terminal agnóstico[3].
¿Vale Fable 5 tres veces el precio?
Solo cuando la tarea es lo suficientemente difícil para que su curva de esfuerzo se pague por sí sola. También lleva retención obligatoria de 30 días y una capa de negativa de clasificador que Opus 5 no tiene[1].
¿Importa el nivel de esfuerzo más que la elección de modelo?
Bajo la frontera, a menudo sí. Opus 5 convierte esfuerzo extra en resultados de forma más confiable que modelos Opus anteriores, y sus configuraciones low y medium se mantienen inusualmente bien[2].
¿Qué modelo debo usar específicamente para revisión de código?
Opus 5, con una salvedad de la guía de Anthropic: sigue literalmente los filtros de severidad, así que pedir solo problemas de alta severidad deprime lo que reporta. Pide todo con etiquetas de confianza y filtra aguas abajo[2].
¿Es Sonnet lo suficientemente bueno para programación?
Para trabajo de alto volumen donde el costo por turno domina, a menudo sí. En reAPI Sonnet 4.6 cuesta lo mismo que Opus 5, lo que elimina el argumento de precio para elegirlo.
¿Cómo cambio entre ellos?
Una cadena de modelo en una clave, si los llamas a través de una puerta de enlace en lugar de cuentas por vendedor.
Haz coincidir el modelo con el benchmark que coincide con tu trabajo
La respuesta honesta a qué modelo Claude es mejor para programación es que la pregunta está subespecificada. Fable 5 lidera los benchmarks de codificación clásicos. Opus 5 lidera el de terminal agnóstico más nuevo, lidera trabajo de conocimiento directamente, y cuesta una tercera parte. Un competidor supera a ambos en una fila que Anthropic de todos modos publicó.
Así que elige el benchmark que se parece a tu trabajo real, y luego lee esa fila. Y antes de cambiar modelos en absoluto, barre el dial de esfuerzo en el que ya tienes, porque bajo la frontera eso mueve resultados más que el nombre del modelo.
References
- reAPI. How to use Claude Fable 5 — benchmark table, effort curve, refusal layer, and retention. reapi.ai/blog/how-to-use-claude-fable-5
- Anthropic. What's new in Claude Opus 5 — effort guidance, behavior changes, and capability improvements. Retrieved July 2026 from platform.claude.com/docs/en/about-claude/models/whats-new-opus-5
- reAPI. How to use Claude Opus 5 — the full published benchmark table. reapi.ai/blog/how-to-use-claude-opus-5
Further reading
- reAPI. How to use Claude Opus 4.8. reapi.ai/blog/how-to-use-claude-opus-4-8
- reAPI. How to use GPT-5.6. reapi.ai/blog/how-to-use-gpt-5-6
- reAPI. Model catalog. reapi.ai/models
Autor

Categorías
Más publicaciones

Precios de Wan 3.0 en reAPI: 480P, 720P y 1080P
Compara los precios de la API oficial de Wan 3.0 con las tarifas de reAPI, y calcula el coste de vídeos de 5, 10 y 30 segundos a 480P, 720P y 1080P.


Cómo usar GPT Image 2: renderizado de texto y modo Thinking
Cómo usar GPT Image 2: renderizado de texto al 99%, modo Thinking para referencias web, dónde pierde ante Nano Banana 2 y cambios en tus prompts.


CLAUDE.md: el archivo que hace mejores a los agentes de código
Qué es CLAUDE.md, por qué cuatro reglas virales funcionan, qué incluir en el archivo y cómo crear una plantilla de proyecto concisa que funcione.
