Mis à jour le 26 septembre 2026 : nous avons retiré les chiffres du titre et du visuel d'ouverture — « réduire à 20-30 % du coût non optimisé », « -60 à 90 % grâce au cache », « 30 000 $/mois ramenés à 6 000-9 000 $ », « huit travaux sur dix se contentent d'un modèle moins cher » — faute de pouvoir en indiquer la source. À leur place figurent des exemples que l'on peut calculer à partir des prix unitaires et des multiplicateurs publiés sur les pages tarifaires officielles d'Anthropic et d'OpenAI, formule à l'appui. Nous avons aussi corrigé le seuil de rentabilité du cache (une lecture suffit avec le cache de 5 minutes, deux avec celui d'une heure) et le prix de la sortie (5× l'entrée), et ajouté un chapitre sur le traitement par lots. Les modifications sont récapitulées en fin d'article.

Passer d'un forfait fixe comme ChatGPT Plus (20 $ par mois) à une facturation au token — Claude Code avec une clé d'API, ou une application d'IA que vous avez développée — peut faire changer votre facture d'ordre de grandeur selon l'usage. La facturation à l'usage n'a pas de plafond.

La bonne nouvelle, c'est que les mesures qui comptent le plus se résument à trois : la mise en cache des prompts, le choix du modèle et le budget de sortie. L'effet de chacune est fixé par des multiplicateurs publiés dans les grilles tarifaires officielles : vous pouvez donc le calculer pour votre propre usage. Cet article s'appuie sur la documentation officielle d'Anthropic et d'OpenAI pour présenter ces multiplicateurs et la façon de faire le calcul.

3 LEVIERS

Les économies se calculent à partir des prix officiels

— d'après les grilles tarifaires officielles d'Anthropic et d'OpenAI au 26 septembre 2026

LEVIER 1 CACHE
0,1×
L'entrée relue depuis le cache coûte 0,1× le prix de base (0,05× sur Claude Opus 5.5). L'écriture coûte 1,25× avec le cache de 5 minutes et 2× avec celui d'une heure (Anthropic, officiel).
LEVIER 2 CHOIX DU MODÈLE
1/4
D'Opus 5.5 à Haiku 4.5, l'entrée passe de 4 $ à 1 $ et la sortie de 20 $ à 5 $ (par million de tokens, Anthropic, officiel). Avec Sonnet 5, la moitié.
LEVIER 3 BUDGET DE SORTIE
5×
La sortie coûte 5× l'entrée (sur tous les modèles Claude actuels et les trois modèles GPT-6). Chaque token de sortie supprimé en vaut cinq d'entrée.

Exemple : envoyez dix fois à Opus 5.5 le même préfixe de 100 000 tokens, à moins de 5 minutes d'intervalle, et le coût d'entrée passe de 4,00 $ sans cache à 0,68 $ avec le cache de 5 minutes (une écriture à 0,50 $, plus neuf lectures à 0,18 $).
Ce qui peut attendre coûte moitié prix, en entrée comme en sortie, via l'API de traitement par lots, et les multiplicateurs du cache s'y ajoutent.
Sources : Claude Platform Docs, « Pricing » et OpenAI API Pricing (consultés le 26 septembre 2026 ; calculs de la rédaction)

1. Pourquoi votre facture d'IA gonfle silencieusement

Les outils d'IA proposent deux modèles de facturation : les formules personnelles (forfait fixe) et la facturation à l'API (à l'usage). C'est principalement la seconde qui fait exploser la facture.

  • Formules personnelles : ChatGPT Plus 20 $/mois, Claude Pro 20 $/mois (17 $/mois en paiement annuel), Max à partir de 100 $/mois. Coût fixe : même un usage intensif a un plafond (avec des limites d'usage).
  • Facturation API : par token, à l'usage. Claude Code avec une clé d'API et les applications d'IA que vous développez entrent dans cette catégorie. Le total du mois peut varier fortement selon l'usage.

La facturation à l'usage gonfle parce que (1) les tokens de sortie coûtent 5× ceux d'entrée, (2) plus votre contexte s'allonge, plus vous le renvoyez en entier à chaque requête, (3) les sous-agents sont invoqués encore et encore en coulisse et (4) une fois en boucle, rien ne s'arrête — tout cela se cumule. Une fois la mécanique comprise, chaque point est corrigible.

2. Détail des coûts — entrée, sortie, cache, batch

En prenant comme exemple les tarifs API de Claude Opus (Opus 5.5 en septembre 2026 ; il se situe sous Fable, le haut de gamme, et c'est le niveau qu'Anthropic recommande pour commencer), voici où part l'argent.

ÉlémentPrix unitaire (par million de tokens)Description
Tokens d'entrée4 $Ce que vous envoyez : prompt + historique de conversation + fichiers, etc.
Tokens de sortie20 $Ce que l'IA renvoie. 5× l'entrée.
Écriture en cache (5 min)5 $ (1,25× l'entrée)Stocker un préfixe dans le cache. Chaque lecture dans les 5 minutes le prolonge sans surcoût.
Écriture en cache (1 h)8 $ (2× l'entrée)Tient au-delà de 5 minutes d'inactivité, au prix d'une écriture plus chère.
Lecture du cache0,20 $ (0,05× l'entrée)0,1× sur la plupart des modèles, 0,05× sur Opus 5.5. La star du show des économies.
Traitement par lotsEntrée 2 $, sortie 10 $ (moitié prix)Traitement asynchrone des requêtes qui peuvent attendre. Se cumule avec les multiplicateurs du cache.
Appels d'outilsComptés en entréeLes définitions d'outils font partie du contexte. Fournir un outil ajoute aussi un prompt système dédié (286 tokens sur Opus 5.5).

En bref, un préfixe présent dans le cache se relit au dixième du prix d'entrée, voire moins. Les multiplicateurs d'écriture (1,25× pour 5 minutes, 2× pour une heure) et la sortie à 5× l'entrée sont identiques sur tous les modèles Claude actuels ; seul le multiplicateur de lecture varie selon le modèle (0,025× sur Fable 5.1). À noter aussi : Claude Opus 4.7 et les modèles suivants utilisent un nouveau tokeniseur qui, selon Anthropic, produit environ 30 % de tokens en plus pour le même texte — à garder en tête quand on compare les prix d'une génération à l'autre. Source : Claude Platform Docs, « Pricing » (consulté le 26 septembre 2026).

3. Choix de la formule et impact sur les économies

Dès que vous pouvez prévoir votre usage, basculez d'abord sur la bonne formule.

UsageFormule recommandéeCible mensuelleMises en garde
Loisir, apprentissage, quelques fois par semaineClaude Free / ChatGPT Free0 $Limites d'usage ; pas pour les données pro.
Personnel, quelques heures par jourClaude Pro / ChatGPT Plus20 $Formule personnelle ; pas pour les données pro.
Usage personnel intensifClaude MaxÀ partir de 100 $5× ou 20× l'usage de Pro ; pour qui fait tourner Claude Code pendant des heures.
Travail en équipeClaude Team / ChatGPT BusinessSiège standard Claude Team : 20 $ (annuel) à 25 $/utilisateurOK pour les données pro ; données non utilisées pour l'entraînement.
Grande organisationEnterpriseDevis commercialSSO, journaux d'audit, SLA.
Développement intégrant l'IAAPI directe (Anthropic / OpenAI)À l'usageUtilisez le cache et le batch.

Sources : page des tarifs de Claude et OpenAI Help, « What is ChatGPT Plus? » (consultés le 26 septembre 2026).

Si vous utilisez Claude Code de longues heures chaque jour et que vous butez souvent sur les limites de Pro, envisagez la formule Max. Comme c'est un forfait, la facture ne peut pas s'emballer comme avec une clé d'API. Cursor démarre à 20 $ par mois avec la formule individuelle Pro, et propose Pro+ et Ultra au-dessus.

4. Mise en cache des prompts — le levier le plus rentable

Si vous appelez l'API directement et renvoyez sans cesse le même préfixe, il n'y a presque aucune raison de se passer de la mise en cache des prompts. Ce qui est lu depuis le cache est facturé à une petite fraction du prix d'entrée de base.

Comment ça marche

Lorsque vous réutilisez le même prompt système ou les mêmes documents sur plusieurs requêtes, le premier appel les écrit dans le cache (1,25× l'entrée avec le cache de 5 minutes). Chaque appel suivant relit le cache à 0,1× l'entrée (0,05× sur Opus 5.5, 0,025× sur Fable 5.1). Un préfixe trop court n'est toutefois pas mis en cache : le minimum est de 512 tokens sur Opus 5.5, 1 024 sur Sonnet 5 et 4 096 sur Haiku 4.5 (Claude Platform Docs, « Prompt caching »).

Seuil de rentabilité : une lecture avec le cache de 5 minutes, deux avec celui d'une heure

En prenant le prix d'entrée comme base 1, comparons le coût d'envoi d'un même préfixe (calcul d'après les multiplicateurs officiels d'Anthropic) :

  • Cache de 5 minutes : écriture 1,25 + une lecture 0,1 = 1,35. L'envoyer deux fois sans cache coûte 2 : une seule lecture suffit à rentabiliser l'écriture.
  • Cache d'une heure : écriture 2 + deux lectures 0,2 = 2,2. L'envoyer trois fois sans cache coûte 3 : deux lectures suffisent (avec une seule lecture, on est à 2,1, légèrement au-dessus des 2 sans cache).

La page tarifaire d'Anthropic dit la même chose : le cache est rentable après une lecture pour la durée de 5 minutes et après deux pour la durée d'une heure. Opus 5.5 lit à 0,05× : à nombre de lectures égal, l'écart se creuse encore.

Exemple : un préfixe de 100 000 tokens envoyé 10 fois

ModèleSans cacheCache de 5 minutesÉcart
Claude Opus 5.5 (entrée 4 $, écriture 5 $, lecture 0,20 $)0,1 × 4 $ × 10 = 4,00 $0,1 × 5 $ + 0,1 × 0,20 $ × 9 = 0,68 $Environ 83 % de moins
Claude Sonnet 5 (entrée 2 $, écriture 2,50 $, lecture 0,20 $)0,1 × 2 $ × 10 = 2,00 $0,1 × 2,50 $ + 0,1 × 0,20 $ × 9 = 0,43 $Environ 79 % de moins

Seule l'entrée du préfixe (prompt système, documents de référence, etc.) est comptée ; 100 000 tokens = 0,1 en unités d'un million. On suppose que les dix requêtes arrivent à moins de 5 minutes d'intervalle, que la première écrit le cache et que les neuf autres le lisent. Tarifs : Claude Platform Docs, « Pricing » (consulté le 26 septembre 2026). La sortie et la partie variable de chaque requête ne sont pas incluses.

Les modèles GPT-6 d'OpenAI fonctionnent de façon comparable. L'entrée en cache coûte 0,1× et l'écriture 1,25×, et le guide d'OpenAI fait le même calcul : écrire un préfixe une fois puis le réutiliser une fois coûte 1,35×, contre 2× pour le traiter deux fois sans cache. Le cache dure 30 minutes après sa dernière utilisation et il est activé par défaut sur les modèles compatibles (OpenAI, « Prompt caching »).

La durée de vie par défaut est de 5 minutes

Sur l'API d'Anthropic, la durée de vie (TTL) du cache des prompts est de 5 minutes par défaut. Chaque lecture la prolonge sans surcoût, mais au-delà de 5 minutes sans utilisation, il expire et la requête suivante le réécrit (1,25 × le prix d'entrée). Vous pouvez choisir une durée d'une heure, mais l'écriture coûte alors 2 × le prix d'entrée (source : Claude Platform Docs, « Prompt caching »).

Claude Code repose sur le même mécanisme. Dans l'usage inclus d'un abonnement Claude, il donne à la conversation principale la durée d'une heure, mais avec une clé d'API, ou une fois la limite du forfait dépassée et les crédits d'usage entamés, elle retombe à 5 minutes. Depuis la v2.1.242, vous pouvez choisir vous-même 5m ou 1h avec le réglage promptCacheTtl (source : Claude Code Docs, « Prompt caching », consulté le 26 septembre 2026). Si vous travaillez avec des pauses, celle des deux qui s'applique change le nombre de réécritures du cache.

Choisir entre 5 minutes et une heure

Les repères de la documentation officielle :

  • Un préfixe réutilisé plus souvent que toutes les 5 minutes : gardez le cache de 5 minutes. Chaque lecture le prolonge gratuitement, inutile de payer l'écriture plus chère d'une heure.
  • Un préfixe réutilisé à des intervalles de 5 minutes à une heure (attente de la réponse d'un utilisateur, appel qui suit une tâche de plus de 5 minutes) : le cache d'une heure est adapté.
  • En combinant les deux : placez le cache d'une heure avant celui de 5 minutes — le même ordre que de mettre en tête le prompt système et les définitions d'outils, qui ne changent pas.

Pour vérifier que le cache fonctionne, regardez cache_read_input_tokens (lectures) et cache_creation_input_tokens (écritures) dans le usage de la réponse. Si les lectures restent à zéro, c'est que le préfixe change quelque part à chaque requête ou qu'il n'atteint pas le minimum de tokens.

5. Gestion du contexte — /compact et fractionnement

Utilisez Claude Code ou Cursor un certain temps et, en plein milieu d'une longue conversation, vous vous retrouverez à renvoyer à chaque tour une grande quantité de conversation passée. Ce n'est pas la sortie qui enfle — c'est l'entrée (= la conversation passée).

Tactique 1 : utilisez activement /compact

Claude Code dispose d'une commande /compact. Elle résume la conversation jusque-là pour libérer du contexte (Claude Code Docs, « Commands »), et vous pouvez lui indiquer ce que le résumé doit conserver. Utilisez-la aux pauses naturelles du travail.

Tactique 2 : fractionnez les sessions par tâche

Ne faites pas « implémenter la fonctionnalité A », « corriger le bug B » et « générer le doc C » dans une seule longue conversation — ouvrez de nouvelles sessions. Fermez la session quand chaque tâche est terminée. Si vous avez besoin de mémoire à long terme, écrivez-la dans un fichier mémoire.

Tactique 3 : nettoyez le bruit avec les Hooks

Le Claude Agent SDK / Claude Code fournit des Hooks, qui permettent de transformer la sortie d'un outil avant qu'elle n'atteigne l'IA. Exemple : compresser un long log npm install à un simple « succès/échec » via un Hook. Plus le log est long, plus l'entrée de chaque tour s'allège.

6. Choix du modèle — routage selon la tâche

« Toujours Opus » est une stratégie de millionnaire. Le travail routinier, comme la classification ou l'extraction, passe souvent très bien avec Sonnet ou Haiku. Le prix dépend du niveau du modèle (haut, intermédiaire, léger) ; voici les tarifs officiels au 26 septembre 2026 (par million de tokens). D'une version à l'autre, le rapport — plus le niveau est élevé, plus c'est cher, et le niveau léger coûte une fraction du haut — n'a pas changé.

ModèleEntréeSortieExcellence
Claude Opus 5.5 (haut)4 $20 $Conception complexe, raisonnement, longues tâches autonomes
Claude Sonnet 5 (intermédiaire)2 $10 $Codage quotidien, analyse, synthèse
Claude Haiku 4.5 (léger)1 $5 $Classification, extraction, conversion courte, réponse en temps réel
GPT-6 Sol (modèle équilibré d'OpenAI)2 $10 $Code complexe et travail agentique
GPT-6 Luna (modèle à bas coût d'OpenAI)0,10 $0,50 $Travail léger, ciblé et en grand volume

Sources : Claude Platform Docs, « Pricing » et OpenAI API Pricing (consultés le 26 septembre 2026 ; tarifs OpenAI pour contexte court). Au-dessus se trouvent Fable 5.1 d'Anthropic (10 $ / 50 $) et le modèle phare d'OpenAI, GPT-6 Astra (10 $ / 50 $). Les modèles actuels de chaque éditeur figurent dans la liste des modèles actuels et de leurs dates de coupure.

Passer d'Opus, haut de gamme, à Haiku, le modèle léger, ramène le prix par token au quart (en septembre 2026). Pour un travail de classification qui consomme 2 millions de tokens d'entrée et 200 000 de sortie par jour, les tarifs officiels donnent :

  • Opus 5.5 : 2 × 4 $ + 0,2 × 20 $ = 12 $
  • Sonnet 5 : 2 × 2 $ + 0,2 × 10 $ = 6 $
  • Haiku 4.5 : 2 × 1 $ + 0,2 × 5 $ = 3 $
  • Haiku 4.5 en traitement par lots : 3 $ × 0,5 = 1,50 $ (chapitre 8)

La qualité tient ou non selon le travail : comparez donc les résultats sur la même entrée avant de passer à un modèle moins cher (FAQ, Q4). Repères :

  • Utilisez Opus pour : refactorisations complexes, conceptions sur de nombreux fichiers, raisonnement profond, exploration d'un domaine inconnu
  • Utilisez Sonnet pour : codage quotidien, analyse, synthèse, revue, ajout de tests
  • Utilisez Haiku pour : classification, extraction, conversion de format, suggestions en temps réel, génération de messages de commit

7. Maîtriser votre budget de sortie

Les tokens de sortie coûtent 5× ceux d'entrée, aussi bien sur les modèles Claude actuels que sur GPT-6 Astra, Sol et Luna. Une réponse d'Opus 5.5 avec 2 000 tokens d'entrée et 1 000 de sortie coûte 0,008 $ + 0,020 $ = 0,028 $. Plafonnez la sortie à 500 tokens et elle revient à 0,018 $, soit environ 36 % de moins (calcul d'après les tarifs officiels).

Trois approches

  • Ajustez max_tokens à la tâche : dans la Messages API d'Anthropic, max_tokens est un paramètre obligatoire, et le nombre indiqué devient le plafond de la sortie (référence de l'API, « Messages »). Ne laissez pas une grande valeur par habitude ; mettez-en une adaptée à l'usage, comme max_tokens: 1000.
  • Ajoutez « réponds brièvement » ou « cinq puces » à votre prompt : l'IA écoute. Supprime les introductions, résumés et conclusions superflus.
  • Sortie structurée (mode JSON) : le JSON est plus court que la prose. Si votre application consomme le résultat, c'est la voie à suivre.

Pour les situations où vous n'avez pas besoin d'une « belle longue réponse » (classification, extraction, décisions), couper court s'avère plus rentable.

8. Traitement par lots — moitié prix pour ce qui peut attendre

Le travail qui n'exige pas de réponse immédiate — classification en masse la nuit, résumés en série, campagnes d'évaluation — coûte moitié prix, en entrée comme en sortie, via une API de traitement par lots. La Message Batches API d'Anthropic accepte jusqu'à 100 000 requêtes par lot ; la plupart se terminent en moins d'une heure, mais un lot peut prendre jusqu'à 24 heures (Claude Platform Docs, « Batch processing »). La Batch API d'OpenAI est elle aussi à -50 %, avec un délai d'exécution de 24 heures (OpenAI, « Batch API »).

D'après la page tarifaire d'Anthropic, les multiplicateurs du cache se cumulent avec la remise des lots. Une lecture de cache sur Haiku 4.5 dans un lot revient par exemple à 1 $ × 0,1 × 0,5 = 0,05 $ par million de tokens.

9. Le piège du multi-agent — 15× de tokens

La tendance 2026, les configurations multi-agents (orchestrateur + sous-agents en parallèle), est puissante, mais Anthropic a publié les données de sa propre fonction Research : les agents consomment environ 4× plus de tokens qu'un chat ordinaire, et les systèmes multi-agents environ 15× (Anthropic, « How we built our multi-agent research system », juin 2025). Ces 15× se mesurent par rapport au chat, et non à un agent unique.

Critères de décision pour les économies

  • Tâches claires et séquentielles (édition d'un seul fichier, synthèse, revue de code) → un agent unique suffit
  • Parallélisme qui réduit significativement le temps réel → le multi-agent se justifie
  • « Multi-agent par défaut » est économiquement faux. Commencez par un agent unique et ne fractionnez que les goulots d'étranglement réellement visibles.

Détails : voir Qu'est-ce qu'un multi-agent ?

10. Surveillance et alertes de facturation

Pour qu'une facture à l'usage ne vous prenne pas par surprise, la surveillance routinière + les alertes sont indispensables.

Utilisateurs API

  • Vérifiez la consommation quotidienne de tokens dans la Claude Console / le tableau de bord OpenAI
  • Définissez une limite d'usage : arrêt au-delà de 200 $/mois, par exemple. Sans limite = danger.
  • Alertes de facturation : e-mail à 50 $, Slack à 100 $ — seuils étagés.

Utilisateurs de Claude Code

  • Utilisez /usage pour vérifier le coût de la session en cours et l'usage de votre forfait (/cost est désormais un alias de /usage)
  • Prenez l'habitude de vérifier /usage à la fin de chaque journée

Administrateurs d'organisation

  • Rapports d'usage par utilisateur (console d'admin Anthropic Team / Enterprise)
  • Détection d'anomalies (signaler les personnes qui consomment bien plus que d'habitude)
  • Partage trimestriel à l'échelle de l'entreprise des « gaspillages »

11. Sept gaspillages courants

SchémaCe qui ne va pasCorrectif
Rejoindre tous les fichiers à chaque tourLe cache ne s'enclenche pas ; l'entrée gonflePlacez les docs invariants dans le préfixe et mettez-les en cache
Poser la même question à ChatGPT et à ClaudeVous payez deux fois la même entrée sur des formules distinctesChoisissez-en un
Continuer une longue conversation sans /compactL'historique complet est envoyé à chaque tour/compact aux pauses naturelles
Utiliser Opus pour une simple classification ou extractionVous payez 4× le prix de Haiku pour le même résultatAdaptez le modèle à la tâche
Répéter « plus poli » / « un peu plus long »Les tokens de sortie s'empilentIndiquez la longueur souhaitée d'emblée
Définir de nombreux outils inutilesLes définitions d'outils voyagent dans le contexteNe définissez que ce que vous utiliserez
Recourir au multi-agent à la légèreEnviron 15× les tokens d'un chat (un agent seul, environ 4×)Uniquement quand le besoin est clair

Synthèse

  • Les trois leviers d'optimisation des coûts d'IA : mise en cache des prompts, choix du modèle, budget de sortie. L'effet de chacun est fixé par des multiplicateurs officiels, et ces multiplicateurs se combinent.
  • Lecture du cache = 0,1× l'entrée (0,05× sur Opus 5.5). Le cache de 5 minutes est rentable après une lecture, celui d'une heure après deux. Un préfixe de 100 000 tokens envoyé dix fois à Opus 5.5 passe de 4,00 $ à 0,68 $.
  • Choix du modèle : d'Opus 5.5 à Haiku 4.5, le prix par token tombe au quart ; avec Sonnet 5, à la moitié (en septembre 2026).
  • Budget de sortie : la sortie coûte 5× l'entrée. Définissez max_tokens explicitement et demandez « bref ».
  • Traitement par lots : ce qui peut attendre coûte moitié prix en entrée et en sortie, et se cumule avec la remise du cache.
  • Gestion du contexte : /compact aux pauses naturelles, fractionnement par tâche, compression de la sortie avec les Hooks.
  • Piège du multi-agent : environ 15× les tokens d'un chat. À utiliser uniquement avec un besoin clair.
  • Surveillance : limites d'usage, alertes de facturation et vérification /usage doivent toutes devenir des habitudes.

FAQ

Q1. J'utilise Claude Code tous les jours — Pro à 20 $ ou Max, le meilleur choix ?

Si vous butez souvent sur les limites de Pro, envisagez Max. Le centre d'aide d'Anthropic conseille aux utilisateurs Pro qui atteignent souvent les limites et ont besoin de plus de capacité pour de gros dépôts d'envisager Max 5x (Claude Help Center, « Using Claude Code with your Pro or Max plan »). Si vous n'atteignez pas les limites, restez sur Pro.

Q2. Faut-il une configuration particulière pour utiliser la mise en cache des prompts ?

Sur l'API d'Anthropic, il faut indiquer cache_control — une seule fois au niveau supérieur de la requête (mise en cache automatique) ou sur des blocs précis (points de rupture explicites). Chez OpenAI, elle est activée par défaut sur les modèles compatibles. Claude Code utilise le cache automatiquement. Voir la documentation officielle d'Anthropic pour les détails.

Q3. ChatGPT vs. Claude — lequel est le plus rentable ?

Ça dépend du cas d'usage. Au seul prix unitaire, Claude Sonnet 5, de niveau intermédiaire, et GPT-6 Sol sont à égalité : 2 $ en entrée et 10 $ en sortie. Pour les questions-réponses courtes et les tâches routinières en grand volume, le modèle à bas coût d'OpenAI (GPT-6 Luna en septembre 2026, 0,10 $ en entrée) coûte dix fois moins que Haiku 4.5 (1 $ en entrée). Pour les longs travaux qui renvoient le même préfixe, les lectures de cache pèsent, ce qui remet aussi Opus 5.5 (0,05×) dans la course. « Souscrire aux deux et choisir le bon outil » est aussi pratique.

Q4. Comment juger que « Haiku suffit » ?

Faites une expérience en trois étapes. (1) Faites-le marcher sur Opus. (2) Envoyez le même prompt à Sonnet et comparez la qualité. (3) Si Sonnet semble comparable, essayez aussi Haiku. Plus la tâche est routinière, plus l'écart tend à être faible. Réservez Opus aux cas qui demandent réellement un jugement profond ou du raisonnement.

Q5. Les particuliers doivent-ils attaquer l'API directement ?

Ça dépend. Si vous faites surtout du codage interactif, la formule Max garde la facture fixe et reste la plus simple. Pour intégrer l'IA dans votre propre application, le traitement par lots ou l'automatisation, il vous faut l'API directe. Beaucoup de gens font les deux.

Q6. Quel seuil dois-je fixer pour les alertes de facturation ?

Il n'y a pas de bonne réponse unique, mais une façon d'étager consiste à placer une première alerte à 1,5× votre dépense mensuelle habituelle et un arrêt à 3×. Si vous dépensez habituellement 30 $/mois, alerte à 50 $ et arrêt à 100 $. Au début, réglez de petites alertes quotidiennes pour prendre la mesure de votre consommation, puis assouplissez.

Q7. On nous a dit « le budget IA de l'entreprise est devenu trop gros ». Par où commencer ?

Trois choses dans l'ordre. (1) Regardez l'usage par utilisateur et repérez où se concentre la consommation. (2) Échangez avec les plus gros consommateurs sur leur flux de travail et identifiez les gaspillages. (3) Diffusez un guide interne sur « cache, choix du modèle, budget de sortie » à toute l'entreprise et faites un point mensuel sur les progrès.

Corrections apportées à la version précédente

Le 26 septembre 2026, nous avons corrigé les points suivants.

Version précédenteAujourd'hui
Trois leviers ramènent la facture à 20-30 % du coût non optimisé (titre, ouverture, image)Retiré, faute de source citable. Remplacé par des exemples calculés à partir des prix et multiplicateurs officiels.
-60 à 90 % grâce au cache, -50 à 80 % grâce au choix du modèle, -30 à 60 % grâce au budget de sortie, 30 000 $/mois ramenés à 6 000-9 000 $Idem. Remplacé par des exemples comme « un préfixe de 100 000 tokens envoyé dix fois : 4,00 $ → 0,68 $ ».
Huit travaux sur dix se contentent d'un modèle moins cherRetiré ; pas de source.
Le cache de 5 minutes est rentable après deux lecturesIl l'est après une lecture (écriture 1,25 + lecture 0,1 = 1,35 < 2).
Le cache d'une heure est rentable après cinq lecturesIl l'est après deux lectures (2 + 0,2 = 2,2 < 3).
Les tokens de sortie coûtent 5-6× plus que ceux d'entrée5× (sur tous les modèles Claude actuels et les trois modèles GPT-6).
Un taux de succès du cache inférieur à 60 % laisse de la marge ; visez 80 % et plus en productionRetiré ; pas de source. Remplacé par la vérification des tokens lus et écrits dans usage.
/compact réduit 200 000 tokens à 5 000Chiffres retirés ; pas de source.