L’erreur Prompt is too long de Claude Code signifie que l’entrée envoyée dépasse la limite de contexte. L’interface interactive actuelle peut afficher Context limit reached à la place. Distinguez d’abord un historique long pouvant être compacté d’une entrée initiale déjà trop volumineuse. Voici des exemples de messages ; les chiffres sont illustratifs.

Prompt is too long

# Exemple de message d’erreur de l’API :
prompt is too long: 233153 tokens > 200000 maximum

L’entrée ne comprend pas seulement le texte saisi : historique, fichiers lus, résultats d’outils et instructions peuvent tous y contribuer. Dans 233153 tokens > 200000 maximum, elle contient 233 153 tokens pour un maximum de 200 000. La fenêtre de contexte englobe l’entrée et la sortie générée pour cette réponse ; cette erreur signifie que l’entrée seule dépasse déjà la limite. La reprise diffère d’un usage limit atteint en épuisant le quota du forfait sur une période.

Utilisez /compact pour un historique long, réduisez l’entrée si le premier message est trop volumineux et résolvez d’abord toute cause signalée d’échec de compaction. Voilà les principales voies de reprise. La compaction automatique est activée par défaut, mais ne garantit pas d’éviter tous les dépassements. Fondé sur la documentation officielle des erreurs de Claude Code et les spécifications API consultées le 21 septembre 2026, cet article explique causes, étapes de reprise et conditions de 200K et 1M. L’utilisation directe de l’API est traitée séparément.

La même erreur de longueur peut demander des réductions différentes

Au cours d’une longue conversation

Résumez l’historique précédent. Si la fenêtre se remplit à nouveau juste après la compaction, fractionnez les lectures volumineuses.

Entrée initiale déjà trop volumineuse

Il n’y a pas de conversation antérieure à résumer. Réduisez d’abord les textes collés, pièces jointes, instructions et données des outils.

La compaction elle-même échoue

Résolvez d’abord la cause indiquée, telle qu’un échec d’authentification ou un modèle indisponible. Répéter la compaction ne suffira pas.

Utilisez /context pour la répartition de la fenêtre et /usage pour la consommation sur une période ou les quotas du forfait. Les deux concernent les tokens, mais mesurent des choses différentes.

1. Ce que signifie cette erreur

La fenêtre de contexte limite la quantité d’information qu’un modèle peut consulter et générer en une réponse. Elle se mesure en tokens, pas en caractères, et inclut l’entrée, la sortie de cette réponse et les tokens de raisonnement. L’entrée lue depuis le cache de l’API occupe toujours la fenêtre. Le cache modifie la tarification ou le traitement ; il ne réduit pas cette entrée à un espace nul. Consultez la spécification des fenêtres de contexte d’Anthropic.

Dans cette limite, Prompt is too long survient lorsque l’entrée envoyée ne tient déjà pas à elle seule dans la fenêtre. Même une question courte peut appartenir à une grosse requête si elle s’accompagne d’historique ou de fichiers. Raccourcir seulement la dernière question peut donc ne pas aider. Pour les bases, consultez Qu’est-ce qu’une fenêtre de contexte ?

À l’approche de la limite, Claude Code supprime d’anciennes sorties d’outils et résume la conversation si nécessaire. Mais un collage massif, la désactivation de la compaction automatique ou une erreur d’authentification pendant la compaction peuvent encore le bloquer. Relire le même fichier énorme juste après le résumé peut remplir à nouveau la fenêtre. Ne diagnostiquez pas la cause uniquement selon que la compaction automatique est activée ou non. Lisez l’erreur complète et vérifiez ce qui a été chargé juste avant.

2. Qu’est-ce qui remplit la fenêtre de contexte ?

La répartition suivante suit l’explication du fonctionnement de Claude Code. Le journal sauvegardé d’une conversation n’est pas identique à ce qui est actuellement envoyé au modèle. Supprimer d’anciens résultats d’outils ou résumer modifie le contenu de la fenêtre active.

ComposantCe qui entre dans la fenêtreCe qu’il faut revoir
Historique de conversationÉchanges envoyés dans la requête actuelle. La compaction remplace certaines parties par un résumé/compact pour la même tâche ; /clear pour une autre tâche sans rapport
Fichiers et résultats d’outilsContenu des fichiers lus, résultats de recherche, sorties de commandes et éléments similairesCiblez les recherches, ne lisez que les lignes utiles ou déléguez l’enquête détaillée à un sous-agent
MCPNoms des outils et instructions des serveurs. Par défaut, Tool Search charge les définitions détaillées au besoinVérifiez l’occupation réelle avec /context et désactivez les serveurs inutilisés via /mcp
CLAUDE.md et mémoireInstructions applicables et mémoire chargée. Tous les fichiers de mémoire automatique ne sont pas toujours présentsGardez les règles permanentes courtes et séparez les explications propres à certaines tâches
SkillsHabituellement, descriptions au démarrage et corps à l’utilisation. Des réglages peuvent aussi différer les descriptionsRevoyez les candidates inutiles à l’invocation automatique et les corps de skills trop longs
Instructions systèmeInstructions de fonctionnement fournies par Claude Code ou l’environnement de connexionCommencez par les instructions, pièces jointes et outils que vous contrôlez

Affirmer que connecter MCP charge toujours au démarrage la définition détaillée de chaque outil ne décrit pas le comportement par défaut actuel. Les définitions peuvent être chargées d’emblée si Tool Search est désactivé, si un préchargement est configuré ou si la connexion ne le prend pas en charge. Vérifiez les conditions de votre connexion dans le tableau officiel de configuration de Tool Search. Consulter /context est plus utile qu’estimer l’occupation au seul nombre de serveurs.

Les sous-agents enquêtent dans une fenêtre distincte et peuvent renvoyer des résultats sans apporter toutes les sorties intermédiaires des outils à la conversation principale. Toutefois, leurs résumés ou conclusions occupent toujours la fenêtre principale. Leur demander de reproduire toute l’enquête réduit l’intérêt. Précisez la sortie attendue, par exemple : « Renvoyez uniquement les fichiers et lignes pertinents, les conclusions et les questions non résolues. » Les principes de conception sont présentés dans l’ingénierie du contexte.

Utilisez /context pour l’occupation de la fenêtre actuelle et /usage pour la consommation de tokens et l’utilisation du forfait. Le coût affiché par ce dernier est une estimation, pas une facture définitive. Dans les environnements compatibles, /skill-doctor peut aussi examiner l’occupation des skills, mais sa disponibilité dépend de conditions. Si vous ne le trouvez pas, commencez par /context. Consultez les étapes de mesure dans Qu’est-ce qui utilise votre contexte ? et les conditions de disponibilité dans la liste officielle des commandes.

3. Tailles de contexte : 200K et 1M

200K signifie 200 000 tokens ; 1M, un million. Vérifiez toutefois séparément la capacité du modèle, celle qu’utilise Claude Code pour votre connexion, le seuil de compaction automatique et les conditions tarifaires. Utilisez /status pour vérifier le modèle et le compte actuels, et /model pour voir les choix disponibles.

Séparez capacité et conditions d’utilisation

Exemples avec 200K

Des modèles comme Sonnet 4.5. Claude Code peut aussi traiter un modèle capable de 1M comme un modèle à 200K en raison de la connexion ou d’un réglage désactivant 1M.

Exemples avec 1M

Sur l’API Anthropic, citons la famille Fable, Sonnet 5 et Opus 4.7 ou ultérieur. Certains utilisent 1M par défaut ; ajouter [1m] n’est pas toujours nécessaire.

Source : configuration des modèles et contexte étendu d’Anthropic. Le point de déclenchement de la compaction automatique varie selon les réglages et le modèle.

Pour les abonnements, Opus 1M est inclus dans Max, Team et Enterprise, tandis qu’Opus 1M sur Pro et Sonnet 4.6 1M avec un abonnement nécessitent des crédits d’utilisation. Sonnet 5 connecté directement à l’API Anthropic est traité autrement : 1M est la valeur par défaut sur tous les forfaits, sans crédits supplémentaires ni sélection de [1m]. Les passerelles et les réglages désactivant 1M introduisent des exceptions ; ne décidez pas au seul nom du modèle.

« Tarification standard » pour 1M signifie que dépasser 200K n’ajoute pas de supplément par token lié au contexte long. Cela ne signifie pas une entrée supplémentaire illimitée au même prix total. Traiter davantage de tokens augmente la consommation. Savoir si 1M est inclus dans votre forfait ou facturé par crédits est une autre question.

Le rapport entre caractères et tokens varie aussi selon le modèle et le contenu. Au lieu de supposer que chaque nouveau modèle ajoute un pourcentage fixe, utilisez le comptage de tokens du modèle cible avec l’API. Certaines tâches nécessitent une fenêtre plus grande, mais supprimer d’abord les journaux inutiles et les instructions en double aide à évaluer la capacité nécessaire.

4. Comment reprendre maintenant

Choisissez la reprise selon ce qui s’est passé : historique qui s’allonge ou gros fichier ajouté à l’entrée. Les options suivantes sont classées par priorité.

SOLUTIONS

Étapes pour libérer de la place dans la fenêtre

1. /compact (s’il existe un historique)
Résumez l’historique pour libérer de la place. Vous pouvez indiquer un objectif, comme /compact Concentre-toi sur le bug d’authentification. Cela réduit la charge tout en préservant le contexte.
2. /clear (en passant à une autre tâche)
Donnez à la conversation un nouveau départ. Notez d’abord les décisions nécessaires. Cela ne supprime pas les fichiers du projet.
3. Sortez les lectures volumineuses de la conversation principale
Lisez les gros fichiers par plages de lignes, ou demandez à un sous-agent d’enquêter dans sa propre fenêtre et de ne renvoyer que les conclusions.
4. Réduisez les contenus chargés à répétition
Consultez la répartition avec /context, puis désactivez les serveurs MCP inutiles et raccourcissez CLAUDE.md. Séparez les procédures détaillées pour qu’elles ne soient lues qu’au besoin.
5. Utilisez un modèle 1M si la tâche le nécessite
Pour une tâche exigeant une grande fenêtre, comme travailler sur une vaste base de code, utilisez /model pour choisir un modèle avec contexte 1M. Faites d’abord le nettoyage des étapes 1–4. Ne désactivez pas la compaction automatique ; conservez son activation par défaut.

Utilisez 1 pour un historique long et 2 pour une nouvelle tâche sans rapport. Pour une entrée initiale trop volumineuse, utilisez 3 et 4. Si une cause d’échec de compaction est signalée, corrigez-la d’abord.

Si /compact échoue avec Error during compaction: Conversation too long, l’explication officielle est qu’il manque de la place pour le résumé généré. Videz la zone de saisie, appuyez deux fois sur Esc, puis choisissez dans la liste un tour antérieur à la grosse entrée pour revenir en arrière dans la conversation. Appuyer deux fois ne remonte pas automatiquement plusieurs tours. Si vous choisissez une action qui restaure aussi le code, vérifiez sa portée. Réessayez ensuite la compaction ; si cela ne libère toujours pas assez de place, utilisez /clear et repartez avec une entrée plus petite. Consultez les conditions dans les commandes clavier officielles.

Si automatic compaction failed est suivi d’un échec d’authentification ou d’un modèle indisponible, corrigez cette cause avant de tenter de libérer la fenêtre. Not enough messages to compact. signifie qu’il y a trop peu de conversation antérieure à résumer : réduisez les pièces jointes ou le texte collé au lieu de répéter la compaction. Si la fenêtre se remplit juste après, limitez les derniers gros journaux ou fichiers aux parties utiles.

Si vous appelez directement l’API

/compact et /clear sont des opérations de Claude Code, pas des commandes de contrôle envoyées à la Messages API. Avec l’API, examinez les messages, system, tools et pièces jointes envoyés, puis estimez l’entrée avec l’API de comptage de tokens du modèle cible. Réduisez la requête elle-même : résumez l’ancien historique, limitez les documents aux sections pertinentes ou retirez les définitions inutiles. Évitez les coupures qui cassent l’association entre appels d’outils et résultats. Une compaction côté API existe aussi pour les longues conversations, mais ses modèles compatibles et ses réglages sont distincts des commandes de Claude Code.

Après la reprise, vérifiez qu’une petite requête reçoit une réponse, puis ajoutez progressivement les informations nécessaires. Renvoyer la même entrée énorme et attendre n’augmente pas la capacité. Pour le nettoyage courant, consultez économiser des tokens dans Claude Code.

5. Distinguer les erreurs similaires

Une entrée trop volumineuse, une limite de sortie configurée, une fenêtre saturée pendant la génération et l’utilisation sur une période sont des problèmes distincts. Vérifiez le texte de l’erreur ou le stop_reason de l’API, au lieu de conclure simplement parce que la réponse semble coupée.

SymptômeSignificationRéponse principale
Prompt is too long / N tokens > M maximumSujet de cet article : l’entrée dépasse la fenêtre de contexte/compact, /clear, déléguer les grosses lectures à un sous-agent ou utiliser un modèle 1M
La réponse s’arrête tôt (stop_reason: max_tokens)La sortie a atteint le réglage max_tokens de la requêteAvec l’API, vérifier le réglage de sortie et la limite du modèle ; ou demander une suite
stop_reason: model_context_window_exceededEntrée et sortie ont atteint la limite de la fenêtre pendant la générationRéduire l’entrée pour laisser de la place à la sortie
usage limit reachedLe quota d’utilisation du forfait est épuisé, indépendamment de la fenêtre de tokensAttendre la réinitialisation ; voir gérer les limites d’utilisation
Usage credits required for 1M contextProblème d’accès : le contexte 1M choisi n’est pas inclus dans le forfait ; ce n’est ni une entrée excessive ni un quota épuiséActiver les crédits et redémarrer, ou utiliser /model pour revenir à la fenêtre standard

Selon la spécification API d’Anthropic, Claude 4.5 et les versions ultérieures acceptent une requête si l’entrée seule tient dans la fenêtre, même si l’entrée plus le max_tokens demandé la dépassent. Atteindre la limite pendant la génération produit model_context_window_exceeded ; une réponse courte ne prouve donc pas à elle seule un arrêt dû à max_tokens. Pour d’autres problèmes, voir les erreurs courantes de Claude Code.

6. Liste de prévention

Avant de travailler : examinez ce qui est chargé avec /context. Ciblez les gros documents par recherche ou plages de lignes au lieu de les coller en entier. Quand vous répartissez l’enquête, précisez aussi l’étendue des conclusions attendues du sous-agent.

Pendant le travail : laissez normalement la compaction automatique activée. Si vous vous souvenez l’avoir désactivée, vérifiez /config et les réglages appliqués. Vérifiez aussi si chaque compaction est suivie d’une relecture des mêmes données. Compacter manuellement plus souvent n’est pas forcément mieux : quand lancer /compact et quelles décisions conserver comptent tous deux.

Entre les tâches : avant une tâche sans rapport, sauvegardez les informations nécessaires dans des fichiers et utilisez /clear pour une nouvelle conversation. La précédente est conservée, mais reprendre le même énorme historique pour débloquer la situation peut réintroduire la cause. Ne gardez dans les instructions permanentes de CLAUDE.md que les règles nécessaires à chaque fois.

Connexions personnalisées : avec une passerelle ou un ID de modèle personnalisé, vérifiez que la fenêtre supposée par Claude Code correspond à la capacité réelle de la connexion. Augmenter un chiffre dans la configuration n’agrandit pas la fenêtre réelle du modèle. Examinez les réglages officiels des modèles personnalisés avec votre administrateur.

Résumé

Prompt is too long signifie que l’entrée complète, historique et pièces jointes compris, ne tient pas — pas seulement la dernière phrase saisie. Choisissez selon la situation : /compact pour un historique long, réduction d’une entrée initiale excessive ou résolution de la cause d’une erreur de compaction.

Les définitions détaillées de MCP sont chargées à la demande par défaut. Examinez le contenu actuel avec /context au lieu d’estimer l’occupation au seul nombre de serveurs. Pour 1M, vérifiez modèle, connexion et forfait ; séparez capacité, prix et seuils de compaction automatique. Avec l’API directe, examinez la requête et le motif d’arrêt plutôt que de dépendre des commandes de Claude Code.

Questions fréquentes

Q. « Prompt is too long » et « usage limit reached » sont-ils identiques ?
R. Non. Le premier indique une entrée dépassant la limite de contexte d’une requête ; le second concerne le quota du forfait. Si l’entrée est trop volumineuse, réduisez ce que vous envoyez. /clear ne rétablit pas votre quota.

Q. Pourquoi cela arrive-t-il avec la compaction automatique activée ?
R. Les causes possibles comprennent une entrée énorme, l’absence de conversation antérieure à résumer, un échec de compaction ou une fenêtre de nouveau remplie juste après le résumé. Ne réduisez pas le diagnostic à deux possibilités : lisez l’erreur complète et vérifiez les lectures récentes. Si une cause comme un échec d’authentification est signalée, corrigez-la d’abord.

Q. /compact échoue aussi avec « Conversation too long ».
R. L’explication officielle est qu’il manque de la place pour le résumé. Videz la saisie, appuyez deux fois sur Esc, choisissez un tour antérieur dans la liste pour remonter la conversation, puis réessayez. Si cela ne libère pas assez de place, notez l’essentiel et repartez avec une entrée plus petite après /clear. Vérifiez la portée avant de choisir une action qui restaure le code.

Q. Passer à un modèle 1M résoudra-t-il le problème ?
R. Cela peut aider si l’entrée nécessaire tient dans la nouvelle fenêtre, mais les conditions varient selon le modèle, la connexion et le forfait. Le tarif standard par token de 1M ne signifie pas un coût total identique pour davantage de traitement. Réduire d’abord l’historique inutile et les grosses sorties aide à évaluer la capacité nécessaire.

Q. Comment voir ce qui occupe la fenêtre ?
R. Dans Claude Code, utilisez /context. Cela diffère de la consommation cumulée ou des quotas du forfait dans /usage. Certaines définitions MCP sont chargées à la demande ; ne jugez pas l’occupation au seul nombre de connexions. Avec l’API, estimez la requête grâce à l’API de comptage de tokens du modèle cible.