El 24 de julio de 2026, Anthropic lanzó Claude Opus 5. Llega unos dos meses después de Opus 4.8 y el número de versión salta una generación entera, del 4.8 al 5. La propia documentación de Anthropic lo describe como un salto cualitativo y no una mejora incremental sobre Opus 4.8.

Resumido en pocas palabras: el precio no se mueve ($5 de entrada / $25 de salida por millón de tokens) y, aun así, en los benchmarks agénticos iguala o supera al buque insignia Claude Fable 5, que cuesta $10 / $50; es decir, Opus 5 hace ese trabajo por la mitad de precio. Por otro lado, la API incorpora dos cambios que rompen la compatibilidad, y el código que se migra sin tocar nada puede acabar con errores 400 o respuestas truncadas. Este artículo contrasta el anuncio oficial y la documentación con varias informaciones de prensa y expone el rendimiento, el precio y las trampas de la migración desde el punto de vista de quien lo usa a diario.

CLAUDE OPUS 5 — 2026.07.24

El mismo precio, un salto evidente

— El planteamiento de Anthropic: rendimiento de frontera a la mitad del precio de Fable 5

ID DEL MODELO
claude-opus-5
Sin sufijo de fecha
PRECIO (POR MILLÓN DE TOKENS)
$5 / $25
Igual que Opus 4.8, la mitad que Fable 5
CONTEXTO / SALIDA
1M / 128K
1M es a la vez el valor por defecto y el máximo
OJO CON ESTO
2 cambios incompatibles
Thinking activo por defecto y límites para desactivarlo
Fuente: anuncio oficial de Anthropic y documentación de Claude Platform (24 de julio de 2026)

1. Opus 5 en tres líneas

1. RENDIMIENTO

Grandes avances en programación agéntica, uso del ordenador y tareas de larga duración. En el benchmark agéntico de terminal Frontier-Bench v0.1, Anthropic afirma que puntúa más del doble que Opus 4.8, y con un coste por tarea menor.

2. PRECIO

Sin subida. $5 de entrada / $25 de salida por millón de tokens, idéntico a Opus 4.8, y exactamente la mitad del buque insignia Fable 5 ($10 / $50).

3. RIESGO AL MIGRAR

Ahora el thinking está activo por defecto y solo puedes desactivarlo con effort high o inferior. Todo lo que corra con un max_tokens ajustado puede quedarse cortado a mitad de respuesta.

En una frase: Opus 5 hace casi el trabajo de Fable 5 al precio de Opus 4.8. Lo que también implica lo contrario: cuando necesitas la máxima capacidad bruta, Fable 5 y Mythos 5 siguen teniendo su sitio (ver las derrotas más abajo).

2. Especificaciones y dónde puedes usarlo

Empecemos por los datos. Estas son las especificaciones principales, según la lista oficial de modelos de Anthropic.

Concepto Claude Opus 5 Claude Opus 4.8 (anterior) Claude Fable 5 (insignia)
ID del modelo en la API claude-opus-5 claude-opus-4-8 claude-fable-5
Precio (entrada / salida) $5 / $25 $5 / $25 $10 / $50
Ventana de contexto 1M de tokens (por defecto y máximo) 1M de tokens 1M de tokens
Salida máxima 128K tokens 128K tokens 128K tokens
Corte de conocimiento fiable Mayo de 2026 Enero de 2026 Enero de 2026
Thinking Activo por defecto Desactivado por defecto (hay que activarlo) Siempre activo (no se puede desactivar)
Niveles de effort low / medium / high / xhigh / max low / medium / high / xhigh / max low / medium / high / xhigh / max

Fuente: Anthropic, "Models overview" y "What's new in Claude Opus 5" (datos de julio de 2026)

La línea que casi nadie lee pero que se nota cada día es el avance del corte de conocimiento. Opus 4.8 y Fable 5 se detienen en enero de 2026; Opus 5 llega hasta mayo de 2026. Son varios meses más de versiones de librerías y cambios recientes en especificaciones que puede responder de memoria. Aun así, sigue sin saber qué pasó "hoy": nunca dejes que afirme hechos de actualidad ni cambios de precio recientes sin una búsqueda web de por medio.

Dónde puedes ejecutarlo

API y nube

Claude API (claude-opus-5), Amazon Bedrock (anthropic.claude-opus-5), Google Cloud y Microsoft Foundry. Opus 4.8 sigue disponible.

Aplicaciones y herramientas de desarrollo

claude.ai, Claude Code y Claude Cowork. Es el modelo por defecto en el plan Max y el modelo más potente seleccionable en Pro.

Limitación del modo rápido

La variante de alta velocidad es una vista previa de investigación y funciona solo en la Claude API. Hoy no está disponible en Bedrock, Google Cloud ni Microsoft Foundry.

3. Precio: sin cambios y la mitad que Fable 5

El dato más práctico de este lanzamiento es que la capacidad sube y el precio no se mueve. La documentación de Anthropic lo dice sin rodeos: "$5 por millón de tokens de entrada y $25 por millón de tokens de salida, sin cambios respecto a Claude Opus 4.8".

Precio por millón de tokens (Claude API)

Claude Opus 5
$5 entrada / $25 salida
Escritura en caché $6.25 (5 min) / $10 (1 hora), lectura de caché $0.50
Claude Fable 5
$10 entrada / $50 salida
El buque insignia. Exactamente el doble que Opus 5
Modo rápido de Opus 5
$10 entrada / $50 salida
Unas 2.5 veces más rápido al doble de precio. Solo en la API

Fuente: Anthropic, "What's new in Claude Opus 5" y "Pricing" (julio de 2026). Las tarifas de caché siguen los multiplicadores oficiales (escritura 1.25x y 2x, lectura 0.1x)

Lo que conviene interiorizar es que el precio por token y el coste por tarea son cosas distintas. En su material sobre Opus 5, Anthropic abre con gráficas de coste por tarea, no de precio unitario. En el benchmark de uso del ordenador OSWorld 2.0, por ejemplo, el anuncio oficial afirma que supera la mejor puntuación de Fable 5 a alrededor de un tercio del coste. La mitad de precio unitario sumada a menos pasos desperdiciados se compone hasta abrir una brecha real mucho mayor.

Una advertencia: como el thinking ahora viene activo por defecto, el mismo prompt puede generar más tokens de salida y costar más. Si tenías algo funcionando barato en Opus 4.8 con el thinking desactivado y te limitas a cambiar el ID del modelo, la factura puede subir. Mide el campo usage con datos reales después de migrar.

4. Los benchmarks al detalle

El anuncio de Anthropic se apoya en gráficas más que en una tabla de cifras, así que lo que la página afirma en texto es sobre todo relativo: "más del doble", "dentro de un 0.5%". Por eso este artículo separa las comparaciones que Anthropic enuncia en su propio texto de las cifras que varios medios reportan de forma coincidente.

4-1. Comparaciones que Anthropic afirma directamente

Frontier-Bench v0.1

Trabajo agéntico en terminal y programación. Supera a todos los demás modelos evaluados y alcanza más del doble que Opus 4.8, con un coste por tarea menor.

CursorBench 3.2

Con effort max se queda a menos de un 0.5% de la mejor puntuación de Fable 5, y a aproximadamente la mitad de coste.

ARC-AGI 3

Mide la capacidad de resolver problemas genuinamente nuevos, y ahí puntúa el triple que el segundo clasificado.

OSWorld 2.0

Uso del ordenador. Lidera frente a la competencia en todos los tramos de precio y supera la mejor puntuación de Fable 5 a alrededor de un tercio del coste.

Zapier AutomationBench

A igualdad de coste, aproximadamente 1.5 veces la tasa de acierto del segundo. Anthropic asegura que incluso su nivel de effort más bajo supera el mejor resultado de los modelos rivales.

Ciencias de la vida

Por delante de Opus 4.8 en todas las evaluaciones que sigue Anthropic, con una mejora de más de 10 puntos en química orgánica (por ejemplo, deducir estructuras a partir de datos espectrales).

4-2. Cifras publicadas por la prensa

Los números de abajo proceden de the decoder (24 de julio de 2026) y de tech-ish (mismo día), que los leyeron de las gráficas de Anthropic. Solo se recogen los puntos en los que ambos medios coinciden. Ten en cuenta que estas cifras no aparecen escritas como números en el texto de la página oficial (marcadas con un punto amarillo de "fuente de prensa").

Benchmark Opus 5 Fable 5 GPT-5.6 Sol Opus 4.8
Frontier-Bench v0.1
Trabajo agéntico en terminal
43.3% 33.7% 34.4% alrededor del 21%🟡
ARC-AGI-3
Resolución de problemas nuevos
30.2% 7.8% 1.5%
GDPval-AA v2 (Elo)
Trabajo intelectual del mundo real
1,861 1,747 1,736 1,593
OSWorld 2.0
Agentes de uso del ordenador
70.6% 66.1%
DeepSWE v1.1
Programación agéntica
68.8% 69.7% 72.7%

El patrón no es sutil. Cuanto más tiempo tiene que trabajar el modelo por su cuenta, mayor es la diferencia: terminal, uso del ordenador, automatización de negocio, problemas inéditos. En cambio, en programación de tipo parche único (DeepSWE) pierde frente a GPT-5.6 Sol. Es la misma forma que ya trazamos en nuestra comparativa con GPT-5.6 Sol, repetida un escalón más arriba.

5. Dónde sigue perdiendo

Los artículos de lanzamiento suelen enumerar solo los aciertos, así que hagamos deliberadamente lo contrario. Abajo están las debilidades que la propia Anthropic reconoce en el anuncio, más las cifras que señalaron los periodistas.

Ciberseguridad ofensiva

Ha recortado distancias con Mythos 5 a la hora de encontrar vulnerabilidades, pero Anthropic afirma sin ambages que queda muy por detrás escribiendo exploits. El modelo defensivo especializado sigue siendo la familia Mythos.

Biología autónoma de largo recorrido

Las ciencias de la vida mejoraron en general, pero la documentación señala que sigue por detrás de Mythos 5 en tareas de investigación biológica autónoma de larga duración.

Programación de una sola pasada🟡

En DeepSWE v1.1 obtiene un 68.8%, por detrás del 72.7% de GPT-5.6 Sol. En Humanity's Last Exam es prácticamente un empate: 56.3% frente al 56.5% de Fable 5 (fuente de prensa).

El effort max no siempre es lo mejor🟡

the decoder apunta que en Frontier-Bench y en el Coding Agent Index el effort max puntuó por debajo de niveles inferiores. Gastar más no siempre compra más.

Qué significa esto en la práctica: poner max effort por defecto puede subir tu factura y bajar tu puntuación. La propia documentación sugiere empezar en high o xhigh y probar a bajar hasta medium con tu propio conjunto de evaluación. Trata el effort como algo que se ajusta, no como una constante que se fija una vez.

6. Dos cambios que rompen código (thinking activo, límites de effort)

Si llamas a la API directamente, esta es la sección que no debes saltarte. Los dos puntos que Anthropic enumera como "cambios de comportamiento" pueden romper cosas si tu código se migra sin modificaciones.

Cambio 1: el thinking está activo por defecto

En Opus 4.8, omitir thinking significaba que se ejecutaba sin razonamiento. En Opus 5, omitirlo significa que el thinking se ejecuta: el mismo comportamiento que escribir thinking: {"type": "adaptive"}.

# El mismo código que en Opus 4.8 corría sin thinking...
client.messages.create(
    model="claude-opus-5",
    max_tokens=1024,          # ahora limita thinking + respuesta juntos
    messages=[...],
)
# En Opus 5 primero razona, así que la respuesta puede cortarse

max_tokens es un techo para los tokens de razonamiento más el texto de la respuesta, en conjunto. Todo lo que dimensionara max_tokens justo a la medida de la respuesta esperada verá ahora ese presupuesto devorado por el razonamiento y acabará truncado. Al migrar tienes que elegir entre desactivar el thinking de forma explícita o dar más margen a max_tokens.

Cambio 2: el thinking solo se puede desactivar con effort high o inferior

Y esa opción de "desactivarlo" ahora viene con un límite. Combinar thinking: {"type": "disabled"} con effort xhigh o max devuelve un error 400. Como la comprobación se hace por petición, el código que sube el effort a mitad de proceso falla de la peor manera: funciona al principio y de repente empieza a dar error.

✅ Permitido

Thinking desactivado + effort low/medium/high

❌ Error 400

Thinking desactivado + effort xhigh/max

🔧 Recomendado

Dejar el thinking activo y bajar el effort para controlar el coste

Anthropic va más allá y documenta qué sale mal cuando sí ejecutas con el thinking desactivado. Sin razonamiento, Opus 5 a veces escribe las llamadas a herramientas como texto del cuerpo —con lo que la herramienta nunca se ejecuta aunque el turno parezca correcto— y puede filtrar etiquetas XML internas en la salida. Si estás construyendo agentes, mantener el thinking activo y bajar el effort es el camino más seguro.

7. Cómo elegir entre los cinco niveles de effort

Opus 5 admite los cinco niveles, low / medium / high / xhigh / max, y el valor por defecto tanto en la API como en Claude Code es high. Para la parte de configuración en Claude Code, consulta nuestra guía sobre el ajuste de effort.

Effort Para qué sirve Notas
low / medium Procesamiento rutinario, clasificación, subagentes de trabajo, rutas sensibles a la latencia Aquí es donde Anthropic insiste en que "Opus 5 se mantiene fuerte incluso con effort bajo". Vale la pena probarlo primero
high (por defecto) Trabajo general que exige inteligencia de verdad La opción segura cuando dudas. El punto de equilibrio entre calidad y coste
xhigh El punto de partida recomendado para programación y cargas agénticas Da margen de sobra a max_tokens (empieza en torno a 64K tokens)
max Problemas difíciles donde acertar importa más que la factura El razonamiento más profundo, pero no siempre el mejor resultado (ver sección 5)

8. Otras novedades

Cambio de herramientas a mitad de conversación (beta)

Cambiar la lista de herramientas a mitad de conversación invalidaba toda la caché del prompt. Opus 5 permite añadir o quitar herramientas conservando la caché (cabecera beta mid-conversation-tool-changes-2026-07-01). Eso pesa mucho en el coste de agentes de larga duración.

El mínimo cacheable se reduce a la mitad

La longitud mínima de prompt cacheable baja de 1,024 a 512 tokens. Prompts que en Opus 4.8 eran demasiado cortos para cachearse pasan a serlo sin tocar una línea de código.

Modo de reserva "default"

Cuando los filtros de seguridad rechazan una petición, en lugar de enumerar tú mismo modelos alternativos puedes dejar que se aplique automáticamente el enrutado recomendado por Anthropic (cabecera beta server-side-fallback-2026-07-01).

Modo rápido

Una vista previa de investigación que ofrece unas 2.5 veces la velocidad de salida al doble de precio. Solo en la Claude API: no está disponible en Bedrock, Google Cloud ni Microsoft Foundry.

9. Otra personalidad y ajustes en los prompts

Esto lo notarás probablemente antes que cualquier benchmark. La documentación enumera cuatro cambios de comportamiento que verás sin tocar una sola línea de código.

Cambio Qué hacer
Las respuestas y los artefactos son más largos
Respuestas al usuario, archivos Markdown que genera
Pide brevedad de forma explícita. Bajar el effort no acorta la prosa, así que tiene que salir del prompt
Narra más lo que va haciendo Elimina andamiajes antiguos como "resume el progreso cada N pasos". Si sigue siendo ruidoso, dile que por defecto guarde silencio entre llamadas a herramientas
Delega en subagentes con facilidad
Opus 4.8 era reticente a hacerlo
Quita los empujones de "delega más" que escribiste para 4.8. Limita el paralelismo de forma explícita para que el coste no se dispare
Verifica su propio trabajo sin que se lo pidas "Añade un paso de verificación al final" y "que un subagente lo verifique" ahora provocan verificación excesiva: bórralos (Anthropic lo dice de forma explícita)

Migrar es restar, no sumar. El texto que añadiste al prompt para compensar las carencias de un modelo anterior —insistirle en que verifique, en que delegue, forzarle informes de progreso— se convierte en un efecto secundario en Opus 5. Quítalo todo primero, observa el comportamiento en bruto y después vuelve a añadir solo lo que eches en falta.

10. Quién debería migrar ya

Migra ya
  • Ejecutas agentes de programación de larga duración
  • Construyes agentes de uso del ordenador o de automatización de negocio
  • Estás en Fable 5 y el coste te duele (casi el mismo rendimiento a mitad de precio)
  • Sigues en Opus 4.8 (claramente mejor al mismo precio)
Prueba antes de migrar
  • Trabajos rutinarios que corren barato con el thinking desactivado y un max_tokens bajo
  • Pasos posteriores que dependen de la longitud o el estilo de la salida
  • Prompts llenos de instrucciones de verificación y delegación
Sin prisa
  • Sobre todo generación de parche único (poca ganancia, a veces pérdida)
  • Dependes del modo rápido a través de Bedrock y similares
  • Pruebas de seguridad ofensiva o investigación biológica de largo recorrido (lidera Mythos)

Pasos de migración (para quien usa la API)

  1. Cambia el ID del modelo de claude-opus-4-8 a claude-opus-5
  2. Busca todos los sitios donde desactivas el thinking (thinking: disabled); con effort en xhigh o max eso ahora es un error 400, así que baja el effort o vuelve a activar el thinking
  3. Revisa max_tokens allí donde no establezcas thinking (añade margen para los tokens de razonamiento)
  4. Borra de tus prompts los empujones a verificar, a delegar y los informes de progreso forzados
  5. Añade una instrucción de concisión y luego vuelve a calcular tu línea base de coste midiendo usage con datos reales
  6. Barre el effort entre medium / high / xhigh y elige el punto óptimo con tu propio conjunto de evaluación

Conclusiones

Claude Opus 5 es de esos lanzamientos que el usuario puede disfrutar sin peros: un salto evidente al mismo precio. La diferencia es máxima en agentes que trabajan de forma autónoma durante largos periodos, y Anthropic construye su argumento a partir del coste por tarea: rendimiento de frontera a la mitad del precio de Fable 5.

Al mismo tiempo, la API trae dos cambios que no puedes ignorar (thinking activo por defecto; el thinking solo se desactiva con effort high o inferior). Y la clave para migrar bien es que hay que quitar texto del prompt en lugar de añadirlo. Las instrucciones escritas para parchear las carencias de un modelo anterior son justo lo que vuelve a Opus 5 verboso y excesivamente prudente.

Por último, recuerda que la cifra de un benchmark solo es el valor medido en esa tarea concreta. Opus 5 pierde frente a GPT-5.6 Sol en DeepSWE y hay ámbitos donde el effort max no es el mejor ajuste. Vuelve a medirlo con tu propia carga de trabajo: al final, ese es el único número que zanja algo.

Preguntas frecuentes

P. ¿Opus 5 es más caro que Opus 4.8?

R. El precio por token es idéntico ($5 de entrada / $25 de salida por millón de tokens). Pero, como el thinking viene activo por defecto, los tokens de salida pueden aumentar, así que tu factura real puede subir. Mide usage después de migrar.

P. ¿Uso Fable 5 u Opus 5?

R. Por eficiencia de coste, Opus 5: la mitad de precio unitario y por delante en muchos benchmarks agénticos. Para el razonamiento más difícil y la investigación de largo recorrido, Fable 5 sigue liderando. El marco de decisión de nuestra guía Fable 5 frente a Opus se aplica igual.

P. ¿Puedo usarlo con el plan gratuito?

R. Opus 5 es el modelo por defecto en el plan Max y el modelo más potente seleccionable en Pro. La estructura de planes cambia, así que comprueba la disponibilidad actual en la página de precios de Anthropic.

P. He migrado y ahora recibo un error 400.

R. Comprueba primero si estás enviando thinking: {"type": "disabled"} junto con effort xhigh o max. Opus 5 rechaza esa combinación. Baja el effort a high o menos, o elimina el parámetro thinking (volviendo al valor por defecto, activo).

P. Las respuestas son demasiado largas. ¿Bajar el effort las acortará?

R. No. El effort controla sobre todo la profundidad del razonamiento; no reduce de forma fiable la salida que ve el usuario. La solución correcta es pedir brevedad de forma explícita en el prompt.

Nota: las cifras de este artículo proceden del anuncio de Anthropic "Introducing Claude Opus 5", de la documentación oficial "What's new in Claude Opus 5" y "Models overview", además de la cobertura de the decoder y tech-ish (todo del 24 de julio de 2026). Los valores marcados con 🟡 no aparecen como números en el texto oficial y fueron leídos de las gráficas por periodistas, así que tienen menos certeza. Las especificaciones y los precios pueden cambiar; confirma en la documentación oficial cualquier dato decisivo.