Migrer vers Claude Fable 5.1 ne se résume pas à remplacer l'identifiant du modèle. La documentation officielle indique noir sur blanc que trois de ces changements sont cassants (What's new in Claude Fable 5.1). Et pour deux d'entre eux, l'endroit où l'erreur apparaît est loin de sa cause — le genre de problème qui passe inaperçu.

⚠️ Le n° 3 est imposé sur les comptes créés à partir du 31 août 2026. Sur les comptes antérieurs, l'API se contente d'enregistrer l'incohérence et ne la répercute sur le comportement que si on le lui demande explicitement.

Autrement dit, le « chez nous ça marche » dépend de la date de création du compte. Un environnement de test créé récemment peut échouer là où la production, elle, passe.

1. D'abord le positionnement — ce n'est pas une relève du modèle phare

Se tromper ici, c'est se tromper sur la décision de migrer elle-même. Fable 5.1 est le successeur de Fable 5 ; il ne remplace pas Opus 5.

La documentation officielle est explicite — « pour la plupart des charges de travail, commencez par Claude Opus 5 ». Fable 5.1 s'adresse au « raisonnement exigeant et au travail agentique de longue haleine », ou au cas où « Opus 5 évalué à un effort élevé ne suffit toujours pas ».

  Claude Fable 5.1 Claude Opus 5
Positionnement Raisonnement exigeant, travail agentique de longue durée Commencez ici (codage agentique complexe et usage en entreprise)
Tarif (par million de tokens) Entrée $10 / sortie $50 Entrée $5 / sortie $25
Lecture de cache $0.25 (0.025 fois l'entrée de base) 0.1 fois l'entrée de base
Date de coupure des connaissances Juin 2026 Mai 2026
Contexte / sortie maximale 1M / 128k 1M / 128k
Fin de disponibilité pas avant 1er septembre 2027 24 juillet 2027

Fable 5 n'a pas disparu. Il figure toujours dans la liste officielle des modèles comme legacy (toujours proposé). La migration n'est pas imposée aujourd'hui — mais, comme on va le voir, elle fait baisser les coûts.

Mythos 5.1 offre les mêmes performances, seuls les garde-fous diffèrent. Son accès est réservé aux participants de Project Glasswing.

📌 Côté abonnement : les quotas d'usage ont été remis à zéro le jour de la sortie. Le compte officiel @ClaudeDevs a annoncé qu'en même temps que la mise à disposition de 5.1, il avait réinitialisé les quotas de 5 heures et hebdomadaires de tous les utilisateurs. Il ne s'agit pas de la tarification de l'API, mais des quotas d'usage des abonnements, dans Claude Code et ailleurs ; et c'est un geste temporaire calé sur une grande annonce, pas un élément permanent de la spécification. Combien de fois ce type de remise à zéro s'est déjà produit, et où s'arrêtent les faits confirmés pour laisser place aux affirmations non vérifiées, c'est l'objet de notre enquête sur les réinitialisations anticipées de la limite hebdomadaire. Notez aussi que les limites hebdomadaires elles-mêmes sont révisées le 14 septembre 2026 : à vérifier également si vous planifiez en fonction de votre quota.

2. Changement cassant n° 1 — l'appel d'outil forcé renvoie une 400

Celui-ci provoque une erreur immédiate, c'est donc le plus facile à repérer.

tool_choice: type "tool" and "any" are not supported for this model.

Passer {"type": "any"} ou {"type": "tool", "name": "..."} à tool_choice renvoie une 400 invalid_request_error. Les valeurs {"type": "auto"} (par défaut) et {"type": "none"} ne changent pas. La même validation s'applique au point d'entrée de comptage de tokens.

💡 La raison est expliquée de façon convaincante. Ce modèle réfléchit en permanence, et forcer un appel d'outil fait sauter cette réflexion. Le modèle en vient à écrire ce qu'il a pensé dans les arguments de l'outil, et la qualité de ces arguments baisse — d'où la fermeture de cette voie.

Que faire à la place

Pour faire respecter un schéma

Rester en tool_choice: auto avec strict: true (strict tool use), ou basculer vers les structured outputs

Pour garantir l'usage d'un outil

Écrire dans le prompt quand l'utiliser (« pour la météo, réponds avec l'outil get_weather »). L'éditeur affirme que « Fable 5.1 suit de façon fiable les instructions d'outil explicites »

3. Changement cassant n° 2 — les blocs de réflexion sont liés au modèle

C'est à partir d'ici que ça devient délicat. Les blocs de réflexion enregistrent désormais quel modèle les a produits, et leur conservation ne fonctionne plus que dans un seul sens.

✅ Le sens qui tient

Une conversation qui passe d'une génération précédente (Opus 5, Fable 5 et antérieurs) vers Fable 5.1 se poursuit en conservant son raisonnement

❌ Le sens qui perd

En passant de Fable 5.1 vers une génération précédente, le raisonnement des tours concernés est perdu. Les générations précédentes ne savent pas lire les blocs de réflexion de Fable 5.1

⚠️ Le plus dangereux, c'est que par défaut la perte est silencieuse. Quand une requête contient des blocs illisibles, l'API les jette avant même de les montrer au modèle. Ce qui est jeté n'entre pas dans input_tokens et n'est pas facturé — autrement dit, cela n'apparaît pas non plus sur la facture.

Les architectures touchées sont celles qui changent de modèle en cours de conversation. Routeurs, bascules de secours, sélection dynamique du modèle pour optimiser les coûts. Toutes peuvent se retrouver dans un état où « tout a l'air de fonctionner », mais où seul le raisonnement disparaît.

Pour pouvoir s'en apercevoir, ajoutez l'en-tête bêta thinking-binding-controls-2026-08-01. Les suppressions sont alors signalées dans le tableau input_transformations de premier niveau. Sans cet en-tête, aucun signalement.

4. Changement cassant n° 3 — modifier un tour passé casse la suite

Des trois, c'est celui qui touche le plus largement le code existant. Modifier ce qui se trouve avant un bloc de réflexion de Fable 5.1 — le prompt system, les tools, les messages antérieurs — fait échouer la requête suivante.

The block is bound to a different conversation

Les cas qui invalident tous les blocs de réflexion suivants

  • Modifier, réordonner ou supprimer un tour passé tout en gardant les tours qui suivent
  • Insérer un texte propre à la requête dans un tour passé, puis le retirer à la requête suivante (rappels ou lignes d'état)
  • Reconstruire le prompt system ou le tableau tools au sein d'une même conversation
  • Une URL d'image ou de document qui renvoie des octets différents lors d'une requête ultérieure (c'est la suite d'octets qui est examinée, pas l'URL : un lien signé qui tourne ne pose aucun problème tant que le fichier est le même)

Ce qui, à l'inverse, ne casse rien

  • Retirer des blocs de réflexion depuis le début et de façon continue (du plus ancien au plus récent)
  • Élaguer l'historique par la compaction côté serveur ou l'édition de contexte
  • Déplacer les marqueurs cache_control
  • Changer l'effort d'une requête à l'autre

Attention : retirer un seul bloc de réflexion ailleurs qu'au début invalide tout ce qui suit.

⚠️ Son application dépend de la date de création du compte. Ce contrôle est imposé sur les comptes créés à partir du 31 août 2026. Sur les comptes antérieurs, l'API se contente d'enregistrer l'incohérence et ne la répercute sur le comportement que si l'on a défini thinking.block_binding.prefix_mismatch_behavior.

Un environnement de test créé récemment peut donc échouer là où la production passe, et l'inverse est vrai aussi.

Comment savoir si votre code est concerné

La documentation officielle donne une marche à suivre concrète. Lancez une session avec prefix_mismatch_behavior: "drop_block" et journalisez input_transformations. Si vous modifiez l'historique, vous y verrez apparaître reason: "prefix_binding_mismatch".

À noter : Claude Code, claude.ai, Claude Managed Agents et le Claude Agent SDK sont conçus pour ne pas casser cette partie préfixe. Seul le code qui assemble lui-même le tableau messages est concerné.

5. Lecture de cache divisée par quatre — de combien ça baisse vraiment

Ni l'entrée ni la sortie n'ont augmenté. Seule la lecture de cache a changé.

Poste Par million de tokens
Entrée de base $10
Écriture de cache (5 minutes) $12.50
Écriture de cache (1 heure) $20
Lecture de cache $0.25
Sortie $50
Traitement par lots Entrée $5 / sortie $25

L'effet dépend du nombre de fois où l'on relit un préambule mis en cache. Sur les autres modèles Claude, la lecture de cache vaut 0.1 fois l'entrée de base ; sur Fable 5.1 et Mythos 5.1, elle vaut 0.025 fois. Plus une exécution agentique est longue et relit le même préambule, plus l'écart se creuse.

Les gains annoncés officiellement sont d'environ 25% sur une charge de travail typique, et jusqu'à environ 45% sur un travail à forte composante agentique. L'écriture de cache et la longueur minimale de cache, fixée à 512 tokens, n'ont pas changé.

6. Sept comportements qui changent sans toucher au code

C'est là que les oublis de migration se produisent. À spécification d'API identique, ce qui sort est différent. L'éditeur en liste sept.

Moins d'appels d'outils en parallèle

Là où Fable 5 groupait ses envois, il arrive qu'il n'y ait plus qu'un appel par tour. La qualité de la réponse ne baisse pas, mais les tokens, les allers-retours et le temps réel augmentent

Moins de commentaires sur l'avancement

C'est net surtout à effort élevé. Une interface qui repose sur ce commentaire en direct paraît muette

À effort low, il répond de mémoire

Il appelle moins souvent les outils de recherche et de récupération. Montez l'effort sur les tours qui exigent des informations fraîches

La prose devient plus dense

Les phrases peuvent être plus longues et les ruptures de paragraphe moins nombreuses

Moins de mise en forme

Il emploie moins qu'avant le gras, les titres et les listes à puces. Les consignes « ne mets pas en forme » écrites pour les anciens modèles agissent trop fort

Les citations ne sont pas toujours signalées

En résumant un document, il reprend volontiers un passage de l'original sans qu'on voie qu'il s'agit d'une citation

Il réécrit tout pour une petite correction

Le résultat est le même, mais il consomme des tokens de sortie et du temps en plus

Une parade côté prompt est fournie officiellement pour chacun. Pour les appels en parallèle, ajoutez une ligne du type « groupe les lectures indépendantes en un seul envoi » ; si vous avez besoin de suivre l'avancement, demandez explicitement une prise de parole au début, en cours de route et à la fin.

7. Les fonctionnalités ajoutées

L'éditeur recense cinq ajouts. L'un d'eux est la baisse du prix de la lecture de cache ; son impact étant considérable, il a droit à un chapitre 5 à part entière. On regarde ici les quatre autres.

Changement d'effort en cours de conversation (bêta)

Permet de moduler l'efficacité sans casser le cache de prompts. On monte sur les étapes difficiles, on descend sur la routine

Message système limité à un tour (bêta)

clear_at: "next_user_message". C'est le remplacement sûr de l'insertion-puis-retrait interdite par le n° 3, et il ne réécrit pas l'historique

Recevoir l'avancement sous forme de texte (bêta)

display: "updates". Le raisonnement reste masqué et l'on ne reçoit dans le corps du message que l'avancement entre les appels d'outils

Provenance du contenu

Un filigrane statistique dans le texte généré. Aucun token ni caractère caché en plus, aucune information sur l'utilisateur ou l'organisation. Pour les images et les vidéos, c'est C2PA

Regardez bien la deuxième. Face à l'écriture « insérer un rappel puis le retirer » que le changement cassant n° 3 interdit, un remplacement qui remplit le même rôle arrive en même temps. La migration ne dit pas « arrêtez », elle dit « passez par ici ».

8. Procédure de migration — cinq points à vérifier

Une fois l'identifiant du modèle remplacé, l'éditeur énumère les cinq points suivants.

model = "claude-fable-5"    # Before
model = "claude-fable-5-1"  # After
  Ce qu'il faut vérifier
1 Retirer any et tool de tool_choice. Pour imposer un schéma, passer à strict tool use ou aux structured outputs
2 Renvoyer les blocs de réflexion tels quels et n'ajouter qu'en fin d'historique. Ce qui était inséré puis retiré passe au message système limité à un tour ; les modifications de system et de tools passent par la fonctionnalité de changement en cours de conversation
3 Réajuster l'effort à partir de la valeur par défaut (high). Envisager aussi de le changer en cours de conversation
4 Regarder si la boucle de l'agent ne se limite pas à un appel par tour
5 Relancer les évaluations. La gestion des refus, la bascule de secours et le comptage de tokens ne changent pas

Rien n'a changé du côté des refus. stop_reason: "refusal" continue d'être renvoyé, et les modèles de repli reconnus pour Fable 5.1 sont Opus 4.8 et Opus 5. Un refus arrivé avant toute sortie n'est pas facturé, et le coût de cache de prompts lié au changement de modèle est restitué sous forme de crédit de repli.

📌 La conservation des données est de 30 jours, et la conservation zéro donnée n'est en principe pas accessible (sauf accord explicite d'Anthropic). Comme Fable 5 et Mythos 5, ce modèle relève de la catégorie Covered Model. Selon vos exigences, ce point peut à lui seul décider de l'adoption.

En résumé

  • Ce n'est pas une relève du modèle phare. L'éditeur écrit noir sur blanc « pour la plupart des usages, partez d'Opus 5 », et réserve Fable 5.1 au raisonnement exigeant et au travail agentique de longue durée
  • Il y a trois changements cassants. L'appel d'outil forcé qui renvoie une 400 ; les blocs de réflexion liés au modèle ; l'invalidation en cas de modification d'un tour passé
  • Le deuxième échoue en silence. Les blocs illisibles sont jetés et n'apparaissent même pas sur la facture. Il faut un en-tête bêta pour s'en apercevoir
  • Le troisième s'applique selon la date de création du compte (imposé à partir du 31 août 2026). Test et production peuvent se comporter différemment
  • Aucune hausse de tarif. Seule la lecture de cache est divisée par quatre (0.025 fois l'entrée de base). L'effet dépend du nombre de relectures du même préambule
  • Sept comportements changent sans qu'on touche au code. La baisse des appels d'outils en parallèle pèse directement sur le coût et sur le temps

FAQ

Q1. Faut-il migrer tout de suite ?

Rien ne presse. Fable 5 reste proposé en legacy, et il est annoncé que sa fin de disponibilité n'arrivera pas avant le 1er septembre 2027. Le vrai moteur de la migration, c'est le coût — la lecture de cache est divisée par quatre, donc plus une exécution est longue et relit le même préambule, plus elle devient rentable. À l'inverse, si vos appels sont courts et ponctuels, l'écart est faible.

Q2. Si je me sers seulement de Claude Code, suis-je concerné par les changements cassants ?

Pas par le n° 3. L'éditeur précise noir sur blanc que Claude Code, claude.ai, Claude Managed Agents et le Claude Agent SDK sont conçus pour ne pas casser cette partie préfixe. Ce qui est concerné, c'est le code qui assemble lui-même le tableau messages.

Q3. J'ai un mécanisme qui change de modèle dynamiquement. Que dois-je corriger ?

C'est le cœur du n° 2. Passer de Fable 5.1 à une génération précédente fait perdre le raisonnement de ce tour. Et par défaut, il est jeté en silence, sans apparaître sur la facture. La première chose à faire est d'ajouter l'en-tête bêta thinking-binding-controls-2026-08-01, de journaliser input_transformations et de mesurer si des suppressions ont réellement lieu.

Q4. Opus 5 ou Fable 5.1, lequel choisir ?

Le plus raisonnable est de reprendre la formule officielle — commencez par essayer Opus 5, puis passez à Fable 5.1 « quand un effort élevé ne suffit toujours pas ». Le tarif est le double de celui d'Opus 5 en entrée comme en sortie, et seule la lecture de cache est au contraire moins chère. Le détail de la répartition est traité dans le guide de choix.

Q5. J'aimerais supprimer des blocs de réflexion pour économiser du contexte

Il y a une condition sur la façon de les supprimer. Les retirer depuis le début, du plus ancien au plus récent et sans trou, ne pose pas de problème ; en revanche, en retirer un au milieu invalide tous les blocs de réflexion qui suivent. Si vous passez par l'édition de contexte ou la compaction côté serveur, ce n'est pas considéré comme une modification.

Q6. Il paraît qu'un filigrane est ajouté : cela influe-t-il sur la sortie ?

L'éditeur affirme que non — ni le sens, ni la qualité, ni la lisibilité ne changent, aucun token ni caractère caché n'est ajouté, et aucune information sur l'utilisateur ou l'organisation n'y figure. Aucune modification des requêtes ou des réponses n'est nécessaire. Pour les images et les vidéos, des Content Credentials C2PA sont apposés via la Files API.

Q7. Puis-je utiliser Mythos 5.1 ?

Les performances sont les mêmes que celles de Fable 5.1, mais l'accès est réservé aux participants de Project Glasswing. La différence tient aux garde-fous : sur Terminal-Bench 4.0 par exemple, Fable 5.1 obtient 55.8% contre 60.9% pour Mythos 5.1 — un écart présenté comme la conséquence d'un modèle identique dont seuls les garde-fous diffèrent.

Articles liés