Índice
El error Prompt is too long de Claude Code indica que la entrada enviada supera el límite de contexto. La interfaz interactiva actual puede mostrar Context limit reached. Primero, distingue un historial largo que puede compactarse de una entrada inicial que ya es demasiado grande. A continuación aparecen mensajes de ejemplo; las cifras son ilustrativas.
Prompt is too long
# Ejemplo de mensaje de error de la API:
prompt is too long: 233153 tokens > 200000 maximum
La entrada no incluye solo lo que acabas de escribir: también pueden contribuir el historial, los archivos leídos, los resultados de herramientas y las instrucciones. En 233153 tokens > 200000 maximum, la entrada tiene 233 153 tokens frente a un máximo de 200 000. La ventana de contexto abarca tanto la entrada como la salida generada para esta respuesta; este error significa que la entrada por sí sola ya supera el límite. La recuperación es distinta de la de un usage limit alcanzado por agotar la cuota del plan durante un periodo.
Usa /compact si el historial es largo, reduce la entrada si el primer mensaje es demasiado grande y resuelve primero cualquier causa indicada de fallo de compactación. Esas son las vías básicas de recuperación. La compactación automática está activada de forma predeterminada, pero no garantiza evitar todos los desbordamientos. A partir de la documentación oficial de errores de Claude Code y las especificaciones de la API consultadas el 21 de septiembre de 2026, este artículo explica las causas, los pasos de recuperación y las condiciones de 200K y 1M. El uso directo de la API se trata por separado.
El mismo error de longitud puede exigir reducciones diferentes
Resume el historial anterior. Si la ventana vuelve a llenarse justo después de compactar, divide las lecturas grandes.
No hay una conversación anterior que resumir. Reduce primero el texto pegado, los adjuntos, las instrucciones y la carga de las herramientas.
Resuelve primero la causa indicada, como un fallo de autenticación o un modelo no disponible. Repetir la compactación no basta para corregirla.
Usa /context para ver el desglose de la ventana y /usage para el consumo durante un periodo o las cuotas del plan. Ambos implican tokens, pero miden cosas distintas.
1. Qué significa este error
La ventana de contexto limita cuánta información puede consultar y generar un modelo en una respuesta. Se mide en tokens, no en caracteres, e incluye la entrada, la salida de esta respuesta y los tokens de razonamiento. La entrada leída de la caché de la API sigue ocupando espacio. La caché cambia el precio o el procesamiento; no hace que esa entrada ocupe cero. Consulta la especificación de ventanas de contexto de Anthropic.
Dentro de ese límite, Prompt is too long aparece cuando la entrada enviada ya no cabe por sí sola en la ventana. Incluso una pregunta corta puede formar parte de una solicitud grande si va acompañada de historial o archivos. Por eso, acortar solo la última pregunta puede no ayudar. Para los fundamentos, consulta ¿Qué es una ventana de contexto?
Al acercarse al límite, Claude Code elimina resultados antiguos de herramientas y resume la conversación si hace falta. Aun así, un texto enorme pegado, la compactación automática desactivada o un error de autenticación durante la compactación pueden detenerlo. Releer el mismo archivo enorme justo después del resumen puede volver a llenar la ventana. No diagnostiques la causa solo por si la compactación automática está activada. Lee el error completo y comprueba qué se cargó inmediatamente antes.
2. ¿Qué llena la ventana de contexto?
Este desglose sigue la explicación del funcionamiento de Claude Code. El registro guardado de una conversación no es idéntico a lo que se envía actualmente al modelo. Eliminar resultados antiguos de herramientas o resumir modifica el contenido de la ventana activa.
| Componente | Qué entra en la ventana | Qué revisar |
|---|---|---|
| Historial de conversación | Intercambios enviados en la solicitud actual. La compactación sustituye algunas partes por un resumen | /compact para la misma tarea; /clear para otra tarea sin relación |
| Archivos y resultados de herramientas | Contenido de archivos leídos, resultados de búsquedas, salida de comandos y material similar | Acota búsquedas, lee solo las líneas pertinentes o delega la investigación detallada a un subagente |
| MCP | Nombres de herramientas e instrucciones del servidor. Por defecto, Tool Search carga las definiciones detalladas cuando hacen falta | Comprueba la carga real con /context y desactiva servidores no utilizados mediante /mcp |
| CLAUDE.md y memoria | Instrucciones aplicables y memoria cargada. No todos los archivos de memoria automática están siempre presentes | Mantén breves las reglas permanentes y separa las explicaciones que solo requieren tareas concretas |
| Skills | Normalmente, descripciones al inicio y cuerpos al utilizarlas. Los ajustes también pueden aplazar las descripciones | Revisa candidatas innecesarias para invocación automática y cuerpos de skills demasiado largos |
| Instrucciones del sistema | Instrucciones de funcionamiento aportadas por Claude Code o el entorno de conexión | Empieza por las instrucciones, los adjuntos y las herramientas que controlas |
Afirmar que conectar MCP siempre carga al inicio la definición detallada de cada herramienta no describe la configuración predeterminada actual. Las definiciones pueden cargarse por adelantado si Tool Search está desactivado, se configura la precarga o la conexión no lo admite. Comprueba las condiciones de tu conexión en la tabla oficial de configuración de Tool Search. Consultar /context es más útil que estimar la carga solo por el número de servidores.
Los subagentes investigan en una ventana independiente y pueden devolver resultados sin incorporar toda la salida intermedia de herramientas a la conversación principal. Sin embargo, el resumen o las conclusiones devueltos sí ocupan la ventana principal. Pedirles que reproduzcan toda la investigación reduce la ventaja. Especifica la salida necesaria, por ejemplo: «Devuelve solo archivos y líneas relevantes, conclusiones y preguntas sin resolver». Los principios de diseño se explican en ingeniería de contexto.
Usa /context para la ocupación de la ventana actual y /usage para el consumo de tokens y el uso del plan. El coste que muestra este último es una estimación, no una factura definitiva. En entornos compatibles, /skill-doctor también permite examinar la carga de las skills, pero tiene condiciones de disponibilidad. Si no lo encuentras, empieza por /context. Consulta los pasos de medición en ¿Qué está consumiendo tu contexto? y las condiciones de disponibilidad en la lista oficial de comandos.
3. Tamaños de contexto: 200K y 1M
200K significa 200 000 tokens; 1M, un millón. No obstante, comprueba por separado la capacidad del modelo, la que Claude Code utiliza para tu conexión, el umbral de compactación automática y las condiciones de precio. Usa /status para comprobar el modelo y la cuenta actuales, y /model para ver las opciones disponibles.
Separa la capacidad de las condiciones de uso
Modelos como Sonnet 4.5. Claude Code también puede tratar un modelo compatible con 1M como de 200K debido a la conexión o a un ajuste que desactive 1M.
En la API de Anthropic figuran la familia Fable, Sonnet 5 y Opus 4.7 o posterior. Algunos usan 1M por defecto; no siempre es necesario añadir [1m].
Fuente: configuración de modelos y contexto ampliado de Anthropic. El momento en que comienza la compactación automática depende de los ajustes y del modelo.
En las suscripciones, Opus 1M está incluido en Max, Team y Enterprise, mientras que Opus 1M en Pro y Sonnet 4.6 1M en suscripciones requieren créditos de uso. Sonnet 5 conectado directamente a la API de Anthropic se trata de otra manera: 1M es el valor predeterminado en todos los planes, sin créditos de uso adicionales ni selección de [1m]. Las pasarelas y los ajustes que desactivan 1M introducen excepciones; no decidas solo por el nombre del modelo.
«Precio estándar» para 1M significa que superar 200K no añade un recargo por token debido al contexto largo. No significa entrada adicional ilimitada por el mismo precio total. Procesar más tokens aumenta el consumo. Que 1M esté incluido en tu plan o se facture mediante créditos es otra cuestión distinta.
La relación entre caracteres y tokens también depende del modelo y del contenido. En lugar de suponer que cada modelo nuevo añade un porcentaje fijo, utiliza el recuento de tokens del modelo de destino al trabajar con la API. Algunas tareas requieren más ventana, pero eliminar primero registros irrelevantes e instrucciones duplicadas facilita valorar la capacidad necesaria.
4. Cómo recuperarse ahora
Elige la recuperación según lo ocurrido: un historial que crece o un archivo grande añadido a la entrada. Las siguientes opciones están ordenadas por prioridad.
Pasos para liberar espacio en la ventana
/compact Céntrate en el fallo de autenticación. Así reduces la carga conservando el contexto./context; después, desactiva servidores MCP innecesarios y acorta CLAUDE.md. Separa los procedimientos detallados para leerlos solo cuando hagan falta./model para seleccionar un modelo con contexto 1M. Haz primero la limpieza de los pasos 1–4. No desactives la compactación automática; conserva su activación predeterminada.Usa 1 para un historial largo y 2 para una tarea nueva sin relación. Ante una entrada inicial demasiado grande, usa 3 y 4. Si se indica una causa del fallo de compactación, corrígela primero.
Si /compact falla con Error during compaction: Conversation too long, la explicación oficial es que no queda espacio suficiente para el resumen generado. Vacía el cuadro de entrada, pulsa Esc dos veces y elige en la lista un turno anterior a la entrada grande para rebobinar la conversación. Pulsar dos veces no retrocede automáticamente varios turnos. Si eliges una acción que también rebobine el código, comprueba su alcance. Reintenta la compactación; si sigue sin haber suficiente espacio, usa /clear y empieza con una entrada menor. Consulta las condiciones en los controles de teclado oficiales.
Si a automatic compaction failed le sigue un fallo de autenticación o un modelo no disponible, resuelve esa causa antes de intentar liberar la ventana. Not enough messages to compact. significa que hay muy poca conversación anterior para resumir: reduce adjuntos o texto pegado en vez de repetir la compactación. Si la ventana se llena justo después de compactar, limita los registros o archivos grandes recientes a las partes necesarias.
Si llamas directamente a la API
/compact y /clear son operaciones de Claude Code, no comandos de control enviados a la Messages API. Al usar la API, inspecciona los messages, system, tools y adjuntos que envías, y estima la entrada con la API de recuento de tokens del modelo de destino. Reduce la propia solicitud: resume historial antiguo, limita documentos a las secciones relevantes o elimina definiciones innecesarias. Evita recortes que rompan la correspondencia entre llamadas a herramientas y resultados. También existe compactación del lado de la API para conversaciones largas, pero sus modelos compatibles y ajustes son independientes de los comandos de Claude Code.
Tras recuperarte, comprueba que una solicitud pequeña obtenga respuesta y reincorpora gradualmente la información necesaria. Reenviar la misma entrada enorme y esperar no aumenta la capacidad. Para la limpieza habitual, consulta cómo ahorrar tokens en Claude Code.
5. Distinguir errores parecidos
Una entrada excesiva, un límite de salida configurado, alcanzar la ventana durante la generación y el consumo durante un periodo son problemas diferentes. Comprueba el texto del error o el stop_reason de la API, en lugar de decidir solo porque la respuesta parezca cortada.
| Síntoma | Significado | Respuesta principal |
|---|---|---|
| Prompt is too long / N tokens > M maximum | Tema de este artículo: la entrada supera la ventana de contexto | /compact, /clear, delegar lecturas grandes a un subagente o usar un modelo 1M |
| La respuesta termina antes (stop_reason: max_tokens) | La salida alcanzó el ajuste max_tokens de la solicitud | En la API, comprobar el ajuste de salida y el límite del modelo; o pedir que continúe |
| stop_reason: model_context_window_exceeded | La entrada más la salida alcanzó el límite de la ventana durante la generación | Reducir la entrada para dejar espacio a la salida |
| usage limit reached | Se agotó la cuota de uso del plan, algo independiente de la ventana de tokens | Esperar al restablecimiento; consulta cómo gestionar los límites de uso |
| Usage credits required for 1M context | Problema de acceso: el contexto 1M elegido no está incluido en tu plan; no es un exceso de entrada ni una cuota agotada | Activar créditos y reiniciar, o usar /model para volver a la ventana estándar |
Según la especificación de la API de Anthropic, Claude 4.5 y posteriores aceptan una solicitud si la entrada por sí sola cabe, aunque la entrada más el max_tokens solicitado supere la ventana. Alcanzar el límite durante la generación produce model_context_window_exceeded, así que una respuesta corta no demuestra por sí sola que se detuviera por max_tokens. Para otros problemas, consulta los errores habituales de Claude Code.
6. Lista de prevención
Antes de trabajar: inspecciona lo cargado con /context. Acota los documentos grandes con búsquedas o rangos de líneas en lugar de pegarlos completos. Al repartir la investigación, especifica también el alcance de las conclusiones que debe devolver el subagente.
Durante el trabajo: normalmente, deja activada la compactación automática. Si recuerdas haberla desactivado, revisa /config y los ajustes aplicados. Comprueba también si cada compactación va seguida de releer el mismo material. Compactar manualmente con más frecuencia no siempre es mejor: importan tanto cuándo ejecutar /compact como indicar qué decisiones conservar.
Entre tareas: antes de otra tarea sin relación, guarda la información necesaria en archivos y usa /clear para una conversación nueva. La anterior queda guardada, pero reanudar el mismo historial enorme para recuperarte puede reintroducir la causa. Conserva en las instrucciones permanentes de CLAUDE.md solo las reglas necesarias siempre.
Conexiones personalizadas: si utilizas una pasarela o un ID de modelo personalizado, comprueba que la ventana que asume Claude Code coincida con la capacidad real de la conexión. Aumentar una cifra en la configuración no amplía la ventana real del modelo. Revisa los ajustes oficiales para modelos personalizados con tu administrador.
Resumen
Prompt is too long significa que no cabe la entrada completa, incluidos historial y adjuntos, no solo la última frase escrita. Elige según la situación: /compact para un historial largo, reducir una entrada inicial excesiva o resolver la causa de un error de compactación.
Por defecto, las definiciones detalladas de MCP se cargan bajo demanda. Inspecciona el contenido actual con /context en vez de juzgar la carga solo por el número de servidores. Para 1M, comprueba modelo, conexión y plan; distingue capacidad, precios y umbrales de compactación automática. Al usar directamente la API, inspecciona la solicitud y el motivo de parada en lugar de depender de comandos de Claude Code.
Preguntas frecuentes
P. ¿«Prompt is too long» y «usage limit reached» son lo mismo?
R. No. El primero significa que la entrada supera el límite de contexto de una solicitud; el segundo se refiere a la cuota de uso del plan. Para una entrada excesiva, reduce lo que envías. /clear no restablece la cuota de tu plan.
P. ¿Por qué ocurre con la compactación automática activada?
R. Entre las causas posibles están una entrada enorme, falta de conversación anterior que resumir, fallo de compactación o que la ventana se llene otra vez justo después de resumir. No reduzcas el diagnóstico a dos posibilidades: lee el error completo y revisa las lecturas recientes. Si aparece una causa como un fallo de autenticación, resuélvela primero.
P. /compact también falla con «Conversation too long».
R. La explicación oficial es que no queda espacio suficiente para el resumen. Vacía la entrada, pulsa Esc dos veces, elige un turno anterior en la lista para rebobinar la conversación y reintenta. Si no libera suficiente espacio, registra lo importante y empieza con una entrada menor después de /clear. Comprueba el alcance antes de elegir una acción que rebobine el código.
P. ¿Cambiar a un modelo 1M lo solucionará?
R. Puede ayudar si la entrada necesaria cabe en la nueva ventana, pero la disponibilidad depende del modelo, la conexión y el plan. El precio estándar por token de 1M no significa el mismo coste total al procesar más. Reducir primero el historial innecesario y las salidas enormes facilita valorar la capacidad necesaria.
P. ¿Cómo veo qué está ocupando la ventana?
R. En Claude Code, usa /context. Es distinto del consumo acumulado o las cuotas del plan en /usage. Algunas definiciones MCP se cargan bajo demanda; no juzgues la carga solo por el número de conexiones. En la API, estima la solicitud con la API de recuento de tokens del modelo de destino.