Dès que vous utilisez Claude Code pour de bon, vous rencontrerez tôt ou tard le « plafond d'utilisation atteint ». Ce chapitre traite des pratiques qui tiennent cela à distance.
Mais l'objectif n'est pas l'économie en soi. Il s'agit de créer un état où il reste du quota au moment décisif. Économiser au point de perdre en résultat serait prendre le problème à l'envers, alors nous parlerons aussi, à la fin, de l'endroit où tracer la ligne.
Pourquoi la consommation augmente
L'unité de consommation, c'est le token. Ce que beaucoup comprennent mal ici, c'est que le compte ne se décide pas par « la longueur de l'instruction envoyée » seule.
Tous les fichiers que Claude est allé lire de lui-même se chargent dans l'entrée. Lui faire lire un gros fichier en entier fait grimper le compte d'un coup.
À chaque échange, tout l'historique précédent part avec. Une longue conversation renchérit le prix unitaire de chaque aller-retour.
Le mouvement qui corrige jusqu'à ce que les tests passent consomme un aller-retour à chaque échec. C'est l'envers de sa force.
Parmi ces trois, celui sur lequel vous avez le plus de prise est le FACTOR 2. Les fichiers lus sont dictés par le travail et le nombre de tentatives par la difficulté, mais la longueur de l'historique se change par la manière de travailler.
« Une instruction courte coûte moins » est une idée fausse. Si l'instruction est trop courte pour que l'intention passe, Claude explore davantage, produit une implémentation à côté, et recommence. Au bout du compte, les allers-retours se multiplient et la facture monte. Ce qui coûte peu, ce n'est pas une instruction courte, c'est une instruction qui passe du premier coup.
Il y a plus d'un type de quota
Le chapitre 4 l'a déjà effleuré, mais c'est ici le point le plus important pour l'exploitation. Un quota à cycle court et un quota à cycle long existent séparément.
Le court se rétablit assez vite, donc en attendant vous pouvez reprendre le travail. Le long met des jours à revenir, et l'épuiser vous immobilise plusieurs jours. Ce moment où « c'était revenu tout à l'heure et c'est déjà bloqué » correspond au court seul qui est revenu tandis que le long restait épuisé.
Le comportement des quotas lui-même est traité dans Corriger usage limit reached, et le résultat mesuré du phénomène où le quota hebdomadaire revient plus tôt que prévu est réuni dans La vérité sur la réinitialisation anticipée du plafond hebdomadaire.
Expédiez d'abord les travaux lourds d'avant échéance, et repoussez les expérimentations exploratoires aux moments où le quota est confortable.
Épuiser le quota long en tâtonnements, et se retrouver immobilisé le jour du travail qui compte. Il ne reste plus qu'à attendre le rétablissement.
L'effort : choisir entre la vitesse et la finesse
Claude Code dispose d'un réglage qui choisit la quantité de réflexion. Le faire réfléchir profondément augmente la précision, mais aussi le temps et la consommation.
Ici, « toujours au maximum » comme « toujours au minimum » vous font perdre. La bonne réponse est de basculer selon la difficulté de la tâche.
Remplacements répétitifs, mise en forme, ajout de tests, implémentation dont l'orientation est déjà fixée. Les travaux qui ne laissent aucune place à la réflexion.
Bug dont la cause échappe, choix de conception, modification dont la portée est illisible. Les travaux où l'erreur entraîne un gros retour en arrière.
Le contenu du réglage et son usage sont traités dans Qu'est-ce que l'effort ? Arbitrer entre rapide et fin. Le critère de jugement, c'est la comparaison avec le coût du retour en arrière. Si réfléchir en profondeur fait passer du premier coup, cela revient moins cher que trois reprises en mode léger.
Replier le contexte est aussi une décision de coût
Le chapitre 3 abordait la question sous l'angle « on replie parce qu'on ne se souvient plus », mais il y a un second motif de replier. Un long historique repart à chaque fois, donc continuer à travailler sans replier fait enfler indéfiniment la consommation de chaque aller-retour.
Cela dit, replier a aussi son coût. Replier trop fait perdre jusqu'aux prémisses nécessaires, oblige à tout réexpliquer, et revient finalement plus cher. Les critères sont réunis dans Faut-il lancer /compact à la main ?.
Quand replier
Bon : juste après la fin d'un travail
avant de passer à un autre ensemble de fichiers
Mauvais: en plein milieu (les prémisses que vous alliez utiliser disparaissent)
« c'est devenu un peu long » (aucun jugement en jeu)
Les usages qui partent le plus facilement en pure perte
L'essentiel de la consommation naît d'allers-retours qui n'aboutissent à rien. Voici les formes les plus courantes.
Sans tests, impossible de contrôler le « c'est fait », donc vous regardez, vous signalez, et les reprises se multiplient.
Sur des milliers de lignes, quelques dizaines sont utiles. Ne donner que le passage concerné produit le même résultat pour moins cher.
Même des travaux sans rapport s'empilent dans le même historique, et vous les transportez ensuite indéfiniment.
Les conventions propres au projet, posées dans la mémoire persistante du chapitre 6, n'ont plus à être réécrites.
Connaître sa propre consommation
Avant de réduire, il faut d'abord savoir à quoi et combien vous dépensez. Économiser à l'intuition revient presque toujours à rogner là où cela ne change rien.
Deux choses à regarder : de combien la conversation en cours a enflé et combien de quota il reste. La première sert à décider de replier, la seconde à décider si vous pouvez commencer ce travail aujourd'hui.
Le quota restant. Il décide si vous pouvez lancer un travail lourd. S'il reste peu, basculez sur du travail léger ou attendez le rétablissement.
L'enflure de la conversation. Elle décide si vous repliez avant de passer au travail suivant. Inutile de la regarder en plein milieu.
L'important, c'est de ne pas augmenter la fréquence des vérifications. Consulter le solde toutes les cinq minutes ne réduit pas la consommation. Le regarder aux frontières entre deux travaux suffit.
Les économies qui se retournent contre vous
Certaines façons d'économiser produisent l'effet inverse. On les rencontre toutes régulièrement.
Les prémisses ne passent pas, il produit une implémentation à côté, et les reprises se multiplient. Ce qu'il faut rogner, ce n'est pas l'explication mais la quantité collée.
Replier en plein travail fait disparaître jusqu'aux prémisses que vous alliez utiliser. Tout réexpliquer coûte plus cher.
Faire réfléchir superficiellement sur un bug de cause inconnue lui fait essayer encore et encore des hypothèses fausses. Le temps et la consommation augmentent tous les deux.
Bricoler alors que tout est à l'arrêt ne permet pas de vérifier l'effet. Attendez le rétablissement, puis essayez un réglage à la fois.
Ce qui augmente quand une équipe l'utilise
La consommation qui ne vous dérangeait pas en solo refait surface sous une autre forme quand on l'étend à une équipe.
Le cas le plus fréquent, c'est celui où chacun explique de son côté les mêmes prémisses. Les conventions du projet, les règles de nommage, les endroits à ne pas toucher : si chacun les réécrit à chaque fois, la duplication se multiplie par le nombre de personnes. La bonne réponse est de les poser dans la mémoire persistante du chapitre 6 et de les partager par le dépôt.
L'autre cas, c'est celui où quelqu'un consomme le quota en usage exploratoire et quelqu'un d'autre se retrouve à l'arrêt en plein travail sérieux. Le comportement change selon qu'il s'agit d'un quota individuel ou d'un quota d'organisation, alors vérifiez au moins ce point avant le déploiement.
Mettre en ordre le patrimoine commun est plus efficace que d'imposer des règles. Dire « économisez les tokens » ne fait que disperser les jugements de chacun, tandis que quand la mémoire persistante et les moyens de vérification sont réunis dans le dépôt, les allers-retours de tout le monde diminuent naturellement.
En pratique : sept gestes pour consommer moins
Rangés du plus efficace au moins efficace. Les deux premiers règlent l'essentiel.
Plus l'historique est court, moins l'aller-retour coûte. C'est ce qui agit le plus.
S'il peut contrôler et corriger seul, les allers-retours avec vous diminuent.
Désignez le répertoire ou les fichiers visés. Toute la part d'exploration disparaît.
Le travail répétitif n'a pas besoin du maximum. Ne lésinez pas sur les passages difficiles.
Si vous expliquez quelque chose à chaque fois, c'est que cela doit être écrit une fois pour toutes (chapitre 6).
Juste après la fin d'un travail. Replier en plein milieu oblige à tout réexpliquer.
Sortir les enquêtes dans un autre contexte garde l'historique principal propre (chapitre 6).
L'optimisation des coûts pour la programmation avec l'IA en général est réunie, dans une perspective plus large, dans Le grand guide de l'optimisation des coûts en programmation avec l'IA.
Où tracer la ligne pour ne pas trop économiser
Pour finir, ce que ce chapitre tient le plus à dire. L'économie n'est pas l'objectif.
À force de surveiller le quota, on traverse même les travaux difficiles en réglage léger, et on corrige encore et encore une implémentation à côté : cela augmente à la fois la consommation et le temps. C'est le cas typique du gaspillage entrepris au nom de l'économie.
Jugez sur « la taille du retour en arrière ». Un travail dont l'erreur se répare en quelques minutes : léger et rapide. Un travail dont l'erreur fait fondre une demi-journée : faites-le réfléchir en profondeur dès le départ. Le quota, c'est ce que l'on met de côté pour le second cas.
Et une dernière chose. Se reposer quand tout est à l'arrêt fait aussi partie de l'exploitation. Plutôt que de trafiquer les réglages au moment où vous atteignez le plafond, attendre le rétablissement et reprendre en pleine forme vous fait finir plus vite.
Résumé
- La consommation se décide par les fichiers lus, l'historique de conversation et le nombre de tentatives. Ce sur quoi vous avez prise, c'est surtout l'historique
- « Instruction courte = moins cher » est faux. Ce qui coûte peu, c'est une instruction qui passe du premier coup
- Il y a deux quotas, un à cycle court et un à cycle long. Épuisez le long et vous êtes immobilisé plusieurs jours
- Faites varier l'effort selon la difficulté. Toujours au maximum comme toujours au minimum vous font perdre
- Replier est une question de mémoire et en même temps une question de coût. Mais replier en plein milieu coûte plus cher
- Les deux gestes les plus efficaces sont de découper la conversation et de donner d'abord un moyen de vérifier
- L'économie n'est pas l'objectif. Jugez sur la taille du retour en arrière, et gardez du quota pour les passages difficiles