La forma en que Claude «piensa» ha cambiado drásticamente en el último año. El antiguo pensamiento extendido (extended thinking) funcionaba haciendo que una persona especificara cuántos tokens podía dedicar el modelo a razonar. La generación actual lo sustituye por el pensamiento adaptativo (adaptive thinking): el propio modelo decide si piensa y con qué profundidad. Y con Claude Opus 5, el pensamiento viene activado por defecto, así que hasta la vieja premisa de «si no configuro nada, no hay pensamiento» pertenece al pasado.

Este artículo repasa qué separa realmente el pensamiento extendido del pensamiento adaptativo, cómo difiere el comportamiento modelo a modelo y las trampas que atrapan a quienes migran su código: errores 400, salidas truncadas y facturas que suben sin hacer ruido. Todo está fundamentado en la documentación oficial de Anthropic.

THINKING: EXTENDED → ADAPTIVE

De «la profundidad la fija el humano» a «decide el modelo»

El relevo generacional en tres pasos

PENSAMIENTO EXTENDIDO (ANTIGUO)
budget_tokens: 10000
Una persona especifica el presupuesto de pensamiento
PENSAMIENTO ADAPTATIVO (ACTUAL)
type: "adaptive"
Si pensar y cuánto es decisión del modelo
OPUS 5 Y POSTERIORES
Pensamiento activado por defecto
La profundidad se ajusta ahora con effort
Fuente: documentación de Anthropic, «Thinking» y «Extended thinking» (a agosto de 2026)

1. Qué es el pensamiento (thinking)

El pensamiento es la fase en la que Claude elabora el problema con sus propias palabras antes de empezar a redactar la respuesta final. Reformula la pregunta, prueba varios enfoques, verifica resultados intermedios y abandona los caminos que no se sostienen; todo ese proceso se genera como bloques de contenido thinking que preceden a la respuesta. El beneficio es mayor en las tareas donde la calidad del trabajo intermedio decide la calidad de la respuesta: matemáticas, programación, análisis y trabajo agéntico de larga duración.

Pero no es gratis. Como afirma sin rodeos la documentación «Thinking» de Anthropic, los tokens que Claude dedica a razonar se facturan como tokens de salida y cuentan para max_tokens, y la facturación es la misma incluso en las configuraciones donde el texto del pensamiento nunca se te devuelve (ver sección 6). Diseñar tu configuración de pensamiento es tanto una cuestión de coste y latencia como una cuestión de calidad.

2. La era del pensamiento extendido: budget_tokens lo fijabas tú

La primera encarnación fue el pensamiento extendido. Adjuntas thinking: {"type": "enabled", "budget_tokens": N} a la petición y Claude razona contra ese presupuesto antes de responder. Una persona especifica cuánto pensar, en cada petición. Según la documentación oficial, las reglas son:

  • Mínimo 1,024 tokens. La API rechaza valores menores
  • Debe ser menor que max_tokens: el pensamiento cuenta dentro de ese límite, así que hay que dejar sitio para la respuesta
  • El presupuesto es un objetivo, no un tope estricto. El uso real varía según la tarea, y Claude a menudo termina de pensar mucho antes de agotarlo
  • Para presupuestos de pensamiento por encima de 32,000, Anthropic recomienda el procesamiento por lotes para evitar timeouts

El problema de este diseño es evidente: el presupuesto adecuado difiere según la tarea, y un humano no puede adivinarlo de antemano. Una pregunta simple puede malgastar el presupuesto que le asignaste; un problema difícil puede quedarse corto con él. Y cambiar el valor del presupuesto invalida tu caché de prompts, algo que la documentación demuestra con un ejemplo medido.

3. El giro al pensamiento adaptativo: decide el modelo

Eso es lo que sustituye el pensamiento adaptativo, introducido en 2026. La configuración es una sola línea: thinking: {"type": "adaptive"}. Si pensar, y con qué profundidad, es una decisión del propio Claude según lo difícil que parezca la petición. Las entradas fáciles reciben una respuesta inmediata sin pensamiento; los problemas difíciles reciben un razonamiento profundo.

La migración siguió el calendario descrito en la documentación «Extended thinking» de Anthropic: budget_tokens quedó obsoleto en Claude Opus 4.6 / Sonnet 4.6 (ahí todavía funciona) y los modelos desde Claude Opus 4.7 en adelante lo rechazan con un error 400. Apunta el código antiguo a un modelo nuevo y se detiene con esto:

# Antiguo: pensamiento extendido (error 400 en Opus 4.7 y posteriores)
"thinking": {"type": "enabled", "budget_tokens": 10000}
→ 400: "thinking.type.enabled" is not supported ...

# Nuevo: pensamiento adaptativo (la profundidad se fija vía effort)
"thinking": {"type": "adaptive"},
"output_config": {"effort": "high"}

La reescritura en sí es pequeña: borrar budget_tokens, cambiar a adaptive y ceder el control de la profundidad a effort. Pero, como advierte la documentación, se trata de un cambio de comportamiento, no solo de sintaxis. Con un presupuesto fijo, Claude pensaba en cada petición; con el pensamiento adaptativo, en los niveles de effort bajos puede saltarse el pensamiento por completo ante entradas fáciles.

4. Cómo maneja cada modelo el pensamiento, de un vistazo

La parte delicada es que «¿viene activado por defecto?» y «¿se puede desactivar?» cambian según el modelo. Aquí está la documentación oficial condensada en una tabla.

Modelo Si no configuras nada Desactivar el pensamiento budget_tokens
Claude Fable 5 / Mythos 5 Pensamiento activado (siempre) No es posible (400) No es posible (400)
Claude Opus 5 Pensamiento activado (adaptativo) Solo con effort high o inferior
Combinado con xhigh / max: 400
No es posible (400)
Claude Sonnet 5 Pensamiento activado (adaptativo) Permitido No es posible (400)
Claude Opus 4.8 / 4.7 Sin pensamiento (se activa con adaptive explícito) Permitido No es posible (400)
Claude Opus 4.6 / Sonnet 4.6 Sin pensamiento (se activa con adaptive explícito) Permitido Obsoleto (aún funciona)
Sonnet 4.5 / Haiku 4.5 y anteriores Sin pensamiento — (desactivado ya es el estado por defecto) Obligatorio (el único modo de pensamiento; adaptive devuelve 400)

Fuente: Anthropic, «Thinking» y «Extended thinking» (a agosto de 2026)

Dos cosas importan en la práctica. Primera: el valor por defecto pasó a «pensamiento activado» con la generación Opus 5. Si ejecutabas un trabajo barato en Opus 4.8 con el pensamiento desactivado y cambias solo el ID del modelo, los tokens de salida crecen en la parte del pensamiento y las respuestas se cortan en max_tokens o la factura sube (lo tratamos en detalle en nuestra guía sobre los cambios incompatibles de Opus 5). Segunda: solo los modelos antiguos siguen usando budget_tokens. Mientras te quedes en Sonnet 4.5 o anteriores no hay nada que migrar; reescribe cuando pases a un modelo más nuevo.

5. La profundidad ahora se ajusta con effort

Desaparecido el «presupuesto», la profundidad del pensamiento se ajusta mediante output_config: {"effort": ...}: cinco niveles, low / medium / high / xhigh / max, con high como valor por defecto de la API. Effort moldea más que la profundidad del pensamiento: también afecta a cuánto se consolidan las llamadas a herramientas y a cuánto preámbulo recibes, es decir, al gasto total de tokens.

low / medium

Trabajos rutinarios, clasificación, subagentes. Puede saltarse el pensamiento en entradas fáciles = rápido y barato

high (por defecto) a xhigh

high para el trabajo general; xhigh es el punto de partida que Anthropic recomienda para programación y agentes

max

Para problemas donde acertar importa más que el coste. No siempre da el mejor resultado, así que no lo dejes fijado

Qué significa cada uno de los cinco niveles, el deslizador de Claude Code y cómo persisten los ajustes se explican en nuestra guía sobre el ajuste effort. Una nota de caché de la documentación: en modo adaptativo, el valor de effort se inserta en el prompt, así que cambiarlo invalida la caché de prompts, la misma figura que «cambiar el presupuesto rompe la caché» en la era del pensamiento extendido. No lo alternes de un lado a otro a mitad de conversación.

6. El pensamiento se cobra aunque no puedas verlo

Cómo se ve el pensamiento desde fuera lo controla el campo display. Admite dos valores:

  • "summarized": el bloque thinking lleva un resumen legible del razonamiento. Valor por defecto en Claude Opus 4.6 / Sonnet 4.6 y anteriores
  • "omitted": el bloque thinking vuelve con una cadena vacía dentro. Valor por defecto en Fable 5 / Mythos 5 / Opus 5 / Sonnet 5 / Opus 4.8 / 4.7

Aquí viven dos trampas. Primera: cuanto más nuevo es el modelo, más se inclina el valor por defecto hacia «no mostrarlo». Mueve a un modelo nuevo una aplicación que retransmitía el razonamiento a sus usuarios y la experiencia se convierte en un largo silencio seguido de una respuesta repentina. Si quieres que sea visible, dilo explícitamente: thinking: {"type": "adaptive", "display": "summarized"}. Segunda: display cambia solo la visibilidad; la facturación es idéntica. La documentación es explícita: con omitted se te siguen cobrando todos los tokens de pensamiento; lo que ahorras es latencia, no coste. Y en ninguna configuración recibes la cadena de pensamiento en bruto: lo que muestra summarized es un resumen.

Medir lo que te cuesta el pensamiento: el campo de la respuesta usage.output_tokens_details.thinking_tokens indica cuántos tokens de salida facturados fueron razonamiento interno. En streaming, solo aparece en el evento message_delta final. «No veo el pensamiento» nunca significa «no está ocurriendo»: revisa este campo después de migrar.

Una cosa más que importa en la práctica: el manejo de los bloques de pensamiento. En conversaciones multiturno y con uso de herramientas, devuelve los bloques de pensamiento de la respuesta anterior completamente intactos. Editarlos provoca un 400: el error «invalid signature in thinking block» con el que se topan los usuarios de Claude Code nace exactamente de este mecanismo.

7. Las trampas de desactivar el pensamiento

«Nos importa la velocidad, desactivemos el pensamiento» es una decisión legítima, pero en Opus 5 viene con condiciones. Según la documentación oficial:

✅ Permitido

Pensamiento desactivado + effort low / medium / high

❌ Error 400

Pensamiento desactivado + effort xhigh / max (se comprueba en cada petición)

🔧 Recomendado

No lo desactives: baja effort a low / medium en su lugar

Incluso cuando la petición pasa, hay efectos secundarios. Anthropic documenta que, con el pensamiento desactivado, Opus 5 puede escribir las llamadas a herramientas como texto del cuerpo (la herramienta nunca se ejecuta aunque el turno parezca haber ido bien) y puede filtrar etiquetas XML internas en la salida. Si construyes agentes, mantener el pensamiento activado y bajar effort es el camino seguro, y además recorta el coste prácticamente en la misma dirección.

8. Pensar entre llamadas a herramientas: interleaved thinking

El pensamiento no es solo «una vez, antes de la respuesta». Con el pensamiento intercalado (interleaved thinking), Claude también razona entre llamadas a herramientas, sopesando cada resultado antes de decidir el siguiente movimiento: revisa el plan tras leer los resultados de una búsqueda, elige el siguiente comando tras leer la salida del anterior. Es la maquinaria detrás del buen comportamiento agéntico.

Aquí también hay una diferencia generacional. En el viejo mundo del pensamiento extendido esto requería la cabecera beta interleaved-thinking-2025-05-14; con el pensamiento adaptativo es automático y la cabecera resulta innecesaria (la documentación indica que «el pensamiento adaptativo se intercala automáticamente» y dice que puedes eliminar la cabecera tras migrar). Pasarse al pensamiento adaptativo simplifica tu código en un ajuste más.

9. Cuando necesitas velocidad: fast mode

Si quieres la calidad del pensamiento pero menos espera, la opción es el fast mode (modo rápido). Según la documentación de Claude Code sobre fast mode, esto no es una degradación a otro modelo: ejecuta el mismo Claude Opus en una configuración que prioriza la velocidad. La salida es hasta unas 2.5x más rápida y el precio se duplica ($10 de entrada / $50 de salida por millón de tokens, tanto en Opus 5 como en Opus 4.8). Está disponible solo en Opus 5 y Opus 4.8; el fast mode para Opus 4.7 se retiró el 24 de julio de 2026.

En Claude Code: /fast

Escribe /fast en la CLI para alternarlo (la extensión de VS Code no lo soporta). La guía oficial: activado para la iteración rápida interactiva, desactivado cuando el coste importa más que la latencia.

En la API: research preview

Solo en la Claude API: no está disponible en Amazon Bedrock, Google Cloud ni Microsoft Foundry. Ten en cuenta además que cambiar de velocidad invalida la caché de prompts.

El pensamiento, effort y el fast mode juegan papeles distintos: pensamiento = el mecanismo de si se razona, effort = con qué profundidad se razona, fast mode = a qué velocidad se entrega ese mismo razonamiento. Antes de recurrir a «va lento, fuera el pensamiento», recuerda que tienes otras dos cartas en la mano: bajar effort o activar el fast mode.

Resumen

  • El pensamiento extendido (budget_tokens) es la vía antigua. Obsoleto en Opus 4.6 / Sonnet 4.6, error 400 desde Opus 4.7 en adelante, y sigue siendo el único modo de pensamiento en los modelos antiguos (Sonnet 4.5 / Haiku 4.5, etc.)
  • El pensamiento adaptativo es la vía actual. El modelo decide si pensar y cuánto; la profundidad se ajusta con effort (cinco niveles, high por defecto)
  • Opus 5 / Sonnet 5 / Fable 5 traen el pensamiento activado por defecto. Fable 5 no puede desactivarlo; Opus 5 solo con effort high o inferior
  • El pensamiento se paga aunque sea invisible. El valor por defecto de la nueva generación es display: "omitted" (bloques de pensamiento vacíos). Mídelo con usage.output_tokens_details.thinking_tokens
  • Desactivar el pensamiento tiene efectos secundarios (llamadas a herramientas como texto, fuga de etiquetas). Bajar effort es más seguro que desactivarlo
  • El pensamiento intercalado es automático con adaptive: la cabecera beta ya no hace falta
  • ¿Necesitas velocidad? Fast mode (unas 2.5x, precio 2x, Opus 5/4.8; se alterna con /fast en Claude Code)

FAQ

Q. Configuré budget_tokens y recibí un error 400.

A. Los modelos desde Opus 4.7 en adelante (incluidos Opus 5 / Sonnet 5 / Fable 5) no aceptan thinking: {"type": "enabled", "budget_tokens": N}. Reescríbelo como thinking: {"type": "adaptive"} y controla la profundidad con output_config: {"effort": ...}. Si te quedas en modelos antiguos como Sonnet 4.5 / Haiku 4.5, no hace falta reescribir nada.

Q. Tras pasarme al pensamiento adaptativo, las respuestas se cortan a media frase.

A. Los tokens de pensamiento cuentan para max_tokens. Opus 5 en particular trae el pensamiento activado por defecto, así que el código que dimensionaba max_tokens muy justo para un modelo anterior ahora pierde presupuesto en el pensamiento y trunca la respuesta. Dale más margen a max_tokens o baja el effort.

Q. Los bloques de pensamiento vuelven vacíos. ¿Se ha roto algo?

A. Es la especificación. En Opus 5 / Sonnet 5 / Fable 5 / Opus 4.8 / 4.7, el valor por defecto de display es "omitted" (bloques de pensamiento vacíos). Para ver el resumen, establece explícitamente thinking: {"type": "adaptive", "display": "summarized"}. La facturación es idéntica en ambos casos.

Q. Si desactivo el pensamiento, ¿me ahorro ese dinero?

A. Te ahorras los tokens de pensamiento en sí. Pero en Opus 5 no puede combinarse con effort xhigh/max (error 400) y, aun cuando funciona, Anthropic documenta efectos secundarios: llamadas a herramientas escritas como texto plano y etiquetas internas que se filtran en la salida. Para cargas de trabajo de agentes, mantener el pensamiento activado y bajar effort a low / medium recorta el coste con más seguridad.

Q. ¿Tengo que configurar el pensamiento en Claude Code (o en las apps de chat)?

A. No: Claude Code y claude.ai gestionan el pensamiento por ti, así que no hay parámetros de API que ajustar. Lo que sí puedes tocar es el ajuste effort y /fast (el interruptor del fast mode); la mecánica de activar/desactivar el pensamiento nunca sale a la superficie.

Nota: las especificaciones y cifras de este artículo se basan en la documentación de Anthropic «Thinking», «Extended thinking» y la documentación de Claude Code «Fast mode» (todas a agosto de 2026). Las especificaciones cambian; comprueba la redacción vigente en los documentos oficiales antes de construir sobre ellas.