« safeguards flagged this message » signifie qu'un classifieur de sécurité associé au modèle Claude a réagi au contenu de votre conversation et a empêché ce modèle de répondre. Ce n'est ni un bug de Claude Code ni une panne réseau. Le message peut apparaître non seulement pendant un travail de cybersécurité ou de biologie, mais aussi sur des demandes ordinaires comme une salutation ou une tâche de planification, et Anthropic reconnaît lui-même que des faux positifs peuvent se produire.
Le message commence par le nom du modèle qui a été arrêté. Dans les Issues GitHub ouvertes entre le 22 et le 29 septembre 2026, le texte signalé à l'écran était surtout l'un des deux suivants (les retours à la ligne ne sont pas exactement ceux de l'écran).
API Error: Opus 5.5's safeguards flagged this message (https://www.anthropic.com/legal/aup). This sometimes happens with safe, normal conversations. Claude Code can't respond to this message with Opus 5.5.
Double press esc to edit your last message, or try a different model with /model.
Send feedback with /feedback or learn more: https://support.claude.com/en/articles/8106465
Details: `[reasoning_extraction]`
API Error: Opus 5.5's safeguards flagged this session (https://www.anthropic.com/legal/aup). You may be seeing this for the first time on an Opus model: Opus 5.5 is more capable and has stronger safeguards as a result, which can sometimes flag non-cybersecurity work. We're improving these safeguards to reduce the amount of incorrectly flagged messages. Claude Code can't respond to your last message with Opus 5.5.
Double press esc to edit your last message, or try a different model with /model.
Send feedback with /feedback or learn more: https://support.claude.com/en/articles/8106465
Details: `[cyber]`
Les titres des Issues parlent souvent de « Message flagged by safeguards », mais ce qui s'affiche réellement à l'écran, c'est le texte ci-dessus. La partie Opus 5.5 devient Fable 5.1, Opus 5, Opus 4.8, etc., selon le modèle que vous utilisiez.
Regardez d'abord la dernière ligne, « Details: »
Ce qui fonctionne dépend du classifieur qui vous a arrêté
Jugé comme une tentative d'extraire le raisonnement interne du modèle
Jugé comme un travail pouvant servir à une cyberattaque
Jugé comme pouvant relever d'usages dangereux de la biologie
Un programme de vérification existe pour les organismes de recherche
Jugé comme relevant d'autres domaines de la politique d'utilisation, ou du développement d'IA de pointe
Sommaire
- 1. Ce que signifie le message : un classifieur qui a lu la conversation l'a arrêtée
- 2. Le texte varie selon le modèle et la version
- 3. Les catégories de Details, et la bascule ou non vers un autre modèle
- 4. Avez-vous fait quelque chose de mal ? Ce qu'Anthropic dit des faux positifs
- 5. Cas signalés depuis le 22 septembre
- 6. Que faire quand vous êtes arrêté
- 7. Le Cyber Verification Program (CVP) aide-t-il ?
- 8. Facturation des requêtes arrêtées et travail inachevé
- 9. Ce qui est confirmé et ce qui ne l'est pas
- 10. En résumé
- FAQ
1. Ce que signifie le message : un classifieur qui a lu la conversation l'a arrêtée
D'après la documentation officielle de l'API Claude « Refusals and fallback », Fable 5.1, Fable 5, Opus 5.5, Opus 5 et Sonnet 5.5 sont équipés de classifieurs de sécurité qui peuvent refuser des requêtes. En cas de refus, l'API ne renvoie pas une erreur mais une réponse normale (HTTP 200), avec la raison d'arrêt stop_reason: "refusal" et le domaine du refus dans stop_details.category. Claude Code reçoit cette réponse et l'affiche sous la forme d'un message commençant par « API Error: ».
Le point important, c'est que le classifieur ne regarde pas seulement la dernière phrase que vous avez envoyée. L'article du centre d'aide qui explique les garde-fous d'Opus 5.5 indique que les classifieurs examinent tout ce que le modèle lit. Cela comprend la mémoire, le contenu des connecteurs, les résultats de recherche web et les fichiers : vous pouvez donc être arrêté par un contenu que vous n'avez jamais tapé vous-même.
Vos instructions
Le dernier message que vous avez envoyé, ainsi que tout l'échange qui le précède.
Ce que Claude a lu
Les fichiers ouverts, la sortie des commandes, les résultats de recherche web et le contenu provenant de MCP ou des connecteurs.
Le contexte joint dès le départ
Les informations sur l'espace de travail que Claude Code ajoute à la première requête, comme le contenu de CLAUDE.md et le git status.
La sortie du modèle lui-même
L'arrêt peut aussi survenir en pleine réponse. Dans ce cas, ce qui a déjà été diffusé est également traité comme incomplet.
Sur le troisième point, la documentation de configuration des modèles de Claude Code indique explicitement qu'un classifieur peut se déclencher sur la première requête d'une session, avant même que vous ayez envoyé quoi que ce soit d'inhabituel. Comme la première requête comprend le contenu de CLAUDE.md et le git status, un dépôt contenant des éléments de sécurité ou de biologie peut déclencher le classifieur par ces seules informations : c'est l'explication donnée. Le quatrième point correspond à ce que dit la documentation de l'API : un refus peut arriver avant la sortie ou au milieu de celle-ci, et dans les deux cas la sortie partielle doit être écartée comme incomplète.
2. Le texte varie selon le modèle et la version
Le même mécanisme produit plusieurs textes différents. L'exemple actuel donné dans la référence officielle des erreurs est le suivant.
API Error: Opus 4.8's safeguards flagged this message. Our intentionally broad safeguards allow us to deliver more capabilities faster, but can sometimes flag legitimate cybersecurity work. Apply to the Cyber Verification Program to reduce these interruptions. Send feedback with /feedback or learn more: https://support.claude.com/en/articles/14604842-real-time-cyber-safeguards-on-claude
La référence des erreurs précise ensuite que sur Opus 5.5 et Sonnet 5.5, le message commence par <model>'s safeguards flagged this session. Les deux messages cités en haut de cet article ont été collés dans des Issues ouvertes le 22 septembre 2026 ou après. Dans ce que nous avons lu, le message flagged this session était accompagné de [cyber] ou [bio], tandis que le message This sometimes happens with safe, normal conversations était le plus souvent accompagné de [reasoning_extraction].
| Début du message | Où il a été constaté | Ce qui suit |
|---|---|---|
<model>'s safeguards flagged this message. Our intentionally broad safeguards… | Référence officielle des erreurs (signalé dans les Issues avec [cyber]) | Une invitation à postuler au CVP (en cas de bascule, le modèle de repli est aussi indiqué, comme dans Switched to Opus 4.8.) |
<model>'s safeguards flagged this session | Référence officielle des erreurs (Opus 5.5 et Sonnet 5.5), et Issues sur les v2.1.280–2.1.283 | Une explication : vous voyez peut-être ce message pour la première fois sur un modèle Opus, car il est plus performant et a donc des garde-fous plus stricts |
<model>'s safeguards flagged this message (…aup). This sometimes happens… | Issues sur les v2.1.278–2.1.284 (aucun exemple dans la référence officielle) | Indique que cela « arrive parfois avec des conversations normales et sans danger » et propose de modifier avec Échap ou d'utiliser /model |
<model> has safety measures that flagged this message for a cybersecurity topic | Référence officielle des erreurs (ancien texte, v2.1.203–2.1.218) | Un lien vers le centre d'aide (avant la v2.1.203, un lien vers le formulaire de demande d'exception) |
<model> can't help with this. Start a new session to continue. | Référence officielle des erreurs (refus au titre de la Usage Policy) | Un refus issu du contrôle de la Usage Policy (sur Amazon Bedrock, l'Agent Platform de Google Cloud et Microsoft Foundry, les signalements cyber utilisent aussi ce texte) |
La référence des erreurs indique que les classifieurs eux-mêmes tournent côté serveur et existaient avant la v2.1.203 ; ce que les mises à jour ultérieures de Claude Code ont changé, c'est uniquement le texte du message. Ce n'est pas la mise à jour de Claude Code qui a fait que vous vous faites arrêter.
Ce qui a changé dans la v2.1.284
Le CHANGELOG de la v2.1.284, publiée le 28 septembre 2026, comporte deux entrées liées à ce message.
- L'avis affiché quand les garde-fous d'un modèle Sonnet signalent un message a été modifié pour expliquer pourquoi cela s'est produit et proposer de modifier le message puis de le renvoyer.
- La bascule de modèle déclenchée par les garde-fous a été modifiée pour les sessions qui fixent un modèle Opus avec
ANTHROPIC_DEFAULT_OPUS_MODELoumodelOverrides. Sur l'API Anthropic, c'est désormais l'API qui choisit le modèle de repli selon le type de signalement, au lieu d'utiliser le modèle fixé.
Au 29 septembre, le texte du nouvel avis pour Sonnet ne figurait pas dans la référence officielle des erreurs, et il n'avait été collé dans aucune des Issues que nous avons lues.
3. Les catégories de Details, et la bascule ou non vers un autre modèle
Le mot indiqué dans Details: à la fin du message correspond à la valeur de stop_details.category renvoyée par l'API. La documentation de l'API liste cinq catégories. Notez que toutes les catégories sauf reasoning_extraction portent une note précisant qu'elles peuvent aussi se déclencher sur un travail inoffensif.
| Details | Description officielle (résumé) | Traitement par Claude Code |
|---|---|---|
cyber | Pourrait servir à des cyberattaques, comme le développement de logiciels malveillants ou d'exploits | Fable 5.1, Fable 5, Opus 5.5 et Opus 5 basculent vers Opus 4.8, et Sonnet 5.5 vers Sonnet 5, en renvoyant la même requête |
bio | Pourrait conduire à des dommages biologiques, comme des techniques de laboratoire dangereuses | Fable 5.1, Fable 5 et Opus 5.5 basculent vers Opus 5 ; Opus 5 et Sonnet 5.5 n'ont pas de repli et aboutissent à un refus |
frontier_llm | Pourrait aider à développer des modèles d'IA concurrents (restreint par les conditions commerciales) | D'après le centre d'aide, Opus 5.5 bascule vers Opus 5 (Opus 5 ne bascule pas pour cette catégorie) |
reasoning_extraction | Cherche à faire reproduire le raisonnement interne du modèle dans le texte de la réponse | La catégorie « distillation » du centre d'aide ; pas de bascule vers un autre modèle, l'arrêt est immédiat |
general_harms | Relève d'un domaine de la politique d'utilisation autre que les quatre ci-dessus | La documentation de Claude Code n'indique pas de modèle de repli |
Sources : le tableau des catégories de « Refusals and fallback » de l'API Claude, la section Automatic model fallback de « Model configuration » de Claude Code, et l'article du centre d'aide « Why Claude switched models in your conversation with Opus 5 or Opus 5.5 » (tous vérifiés le 29 septembre 2026).
Quand une bascule a lieu
Par défaut, quand Claude Code est arrêté dans une catégorie qui dispose d'un repli, il renvoie automatiquement la même requête sur le modèle de repli et affiche un avis dans la conversation. La suite de la session continue sur le modèle de repli. Pour revenir au modèle d'origine, sélectionnez-le de nouveau avec /model.
Le centre d'aide prévient toutefois que même si vous revenez au modèle d'origine, les mêmes garde-fous peuvent vous faire basculer de nouveau si la requête signalée est toujours dans la conversation, et que modifier le message précédent avant de le renvoyer aide souvent. Les situations typiques où la bascule n'aide pas et où vous restez bloqué avec un message comme ceux du haut de l'article sont : un arrêt dans une catégorie sans repli, comme reasoning_extraction ; un arrêt également sur le modèle de repli ; un modèle de repli non autorisé par availableModels ; et une exécution en mode non interactif comme -p avec le réglage « demander avant de basculer » activé.
4. Avez-vous fait quelque chose de mal ? Ce qu'Anthropic dit des faux positifs
Si vous vous dites « je n'ai rien fait de mal et j'ai quand même été arrêté », c'est tout à fait possible. La documentation d'Anthropic reconnaît clairement les faux positifs à plusieurs endroits.
✅ Ce que dit la documentation officielle
- Le message lui-même : « This sometimes happens with safe, normal conversations » et « intentionally broad safeguards »
- La documentation de l'API :
cyber,bio,frontier_llmetgeneral_harmsportent chacune une note précisant qu'elles peuvent aussi se déclencher sur un travail inoffensif - La documentation de Claude Code : lors d'un travail de sécurité offensive ou de biologie, une bascule a souvent lieu dès la toute première requête ; dans ces domaines, il s'agit d'un routage attendu, pas d'un signalement du compte
- Le centre d'aide : les classifieurs sont ajustés pour réduire les faux positifs, et tiendront aussi compte de divers signaux sur la fiabilité du compte
- L'explication du CVP : même les utilisateurs approuvés peuvent voir un travail légitime arrêté
En revanche, l'article du centre d'aide vers lequel pointe le message (Our Approach to User Safety) indique que les utilisateurs qui enfreignent les politiques de façon répétée peuvent se voir appliquer temporairement des filtres de sécurité à détection renforcée. Rien d'officiel ne précise si les arrêts dus à des faux positifs sont pris en compte dans ce cadre. Après un arrêt, il est plus prudent de changer de conversation en suivant les étapes de la section 6 que de continuer à envoyer la même requête en changeant seulement la formulation.
Comment interpréter un arrêt reasoning_extraction
Le centre d'aide donne des exemples de ce que cette catégorie arrête : demander au modèle de répéter mot pour mot son raisonnement, ou d'écrire l'intégralité de sa chaîne de pensée dans une sortie externe. En revanche, il indique que vous pouvez toujours demander à Claude d'expliquer son raisonnement, d'enseigner un concept ou de détailler une revue de code étape par étape, et que les questions conversationnelles comme « pourquoi as-tu fait cela ? » ne sont pas concernées.
À la lecture des Issues, il y a eu des cas où l'arrêt est survenu juste après des demandes comme les suivantes. Ce sont tous des signalements d'utilisateurs, et Anthropic n'a pas expliqué pourquoi le classifieur a réagi.
- Demander si l'écran pouvait afficher sa « réflexion » au lieu des appels d'outils (#96118)
- Faire citer à un sous-agent, depuis son contexte, la ligne indiquant le modèle sur lequel il tournait (#96139)
- À la fin d'une longue tâche, lui faire écrire un résumé de la session dans un fichier (#96874)
- Lui demander d'annoter un schéma de conception avec « les options envisagées et les raisons de leur rejet » pour chaque décision (#98108)
Leur point commun : demander au modèle d'écrire tel quel « son processus de réflexion » ou « son propre contexte ». Si vous avez besoin de cela comme livrable, passer à une formulation qui demande un court résumé du résultat, comme « la conclusion et les raisons de ce choix, en trois lignes », rapproche la demande du côté « expliquer son raisonnement » qu'Anthropic décrit comme autorisé. Cela dit, il existe des cas comme le signalement complémentaire sur #96118, où une simple question courte en allemand a été arrêtée : reformuler ne garantit donc pas d'éviter l'arrêt.
5. Cas signalés depuis le 22 septembre
Depuis la sortie d'Opus 5.5 le 22 septembre 2026, les signalements de ce type s'accumulent dans les Issues d'anthropics/claude-code. En comptant avec la recherche GitHub le 29 septembre, nous avons trouvé 67 Issues créées entre le 22 et le 28 septembre contenant « safeguards » dans le titre ou le corps (7 à 12 par jour ; le nombre varie selon les termes de recherche). Dans les Issues du 22 septembre et après que nous avons lues, nous n'avons trouvé aucune réponse du personnel d'Anthropic, et beaucoup portaient l'étiquette « duplicate ».
🟡 Cas signalés sur GitHub dont la cause n'est pas établie (vérifié le 29 septembre 2026)
- Arrêté par une simple salutation : « hi » a été jugé
[cyber]et a basculé vers Opus 4.8 (#96298), « ola » a été arrêté (#96495), et « hi » a reçu[reasoning_extraction](#97560). L'auteur de #96495 suppose que l'utilisation de Kali Linux en root a pu jouer un rôle. - Arrêté pendant /compact : le message
[reasoning_extraction]est apparu en plein compactage de la conversation (#96648, v2.1.281). - Une fois arrêtée, toute la conversation devient inutilisable : tous les messages suivants de la même session ont été arrêtés (#96874), et la phrase signalée est restée dans le journal de conversation, si bien que les sessions ultérieures qui le lisaient ont aussi été arrêtées (#97452).
- Des sous-agents sont arrêtés : un décompte sur une seule machine a montré que 14 sous-agents Opus 5 sur 866 (1,62 %) avaient été arrêtés avec
[reasoning_extraction]. Tous ceux qui ont été arrêtés étaient des demandes de type revue (#97492). - Arrêté malgré une approbation CVP : des utilisateurs approuvés ont tout de même été jugés
[cyber]sur Opus 5.5 (#96090, #96298, #96592, #97946). Comme l'explique la section 7, cela correspond à l'explication officielle. - Arrêté en travaillant sur ses propres machines ou son propre code : enquête sur un « Permission denied » SSH sur les systèmes de sa propre entreprise (#97373), désassemblage d'un binaire d'un produit de sa propre entreprise (#97891), et suppression d'identifiants codés en dur dans le code source (#97605).
Les cas d'arrêt sur une simple salutation pourraient s'expliquer par la déclaration officielle de la section 1 selon laquelle « les classifieurs examinent toute la conversation et les informations sur l'espace de travail ». L'idée est que même si le dernier message était anodin, le classifieur a réagi à CLAUDE.md, à l'échange précédent ou à des fichiers lus. Toutefois, aucun des signalements ne montre à quoi il a réagi, et aucun moyen de le vérifier n'a été publié.
6. Que faire quand vous êtes arrêté
Voici les étapes indiquées par la référence officielle des erreurs et la documentation de configuration des modèles, classées de la moins à la plus contraignante. Si cela ne s'est produit qu'une fois, l'étape 3 suffira généralement.
Vérifier Details, et si le modèle a basculé
Si vous voyez Switched to ou un avis de bascule, votre travail continue déjà sur un autre modèle. S'il est toujours arrêté, comparez la catégorie indiquée dans Details: avec le tableau de la section 3.
Vérifier les opérations sur fichiers en cours
Si l'arrêt a eu lieu en pleine réponse, la sortie jusqu'à ce point est incomplète. Utilisez d'abord git status et git diff pour voir si des modifications à moitié écrites sont restées (section 8).
Appuyer deux fois sur Échap pour revenir en arrière, et formuler autrement
Appuyer deux fois sur Échap avec le champ de saisie vide, ou lancer /rewind, ouvre le menu de retour en arrière. Choisissez un point antérieur au tour arrêté, puis changez la formulation ou l'approche de la demande et renvoyez-la. C'est le premier remède qu'Anthropic indique pour ce message.
Si vous ne savez pas quel tour en est la cause, démarrez une nouvelle conversation
Utilisez /clear pour démarrer une nouvelle conversation dans le même projet. La conversation d'origine n'est pas supprimée et peut être rouverte depuis /resume. Mais si vous reprenez la conversation d'origine avec --continue ou --resume, le contenu signalé revient avec elle, et vous serez probablement arrêté de la même façon.
Passer à un autre modèle avec /model
Le message lui-même recommande d'essayer « a different model with /model ». En effet, les différents modèles ont des classifieurs différents. Par exemple, l'annonce de Sonnet 5.5 indique qu'il est le premier Sonnet livré avec un classifieur qui protège contre l'extraction du raisonnement, et le Sonnet 5 de la génération précédente n'a pas ce classifieur.
Déterminer si CLAUDE.md ou un élément similaire est en cause
Si vous êtes arrêté dès le tout premier message, lancez claude --safe-mode. Ce mode démarre sans charger CLAUDE.md, les skills, les serveurs MCP ni les hooks : si vous n'êtes pas arrêté ainsi, c'est que l'un des éléments chargés contenait ce qui a déclenché l'arrêt. Le git status et le nom du répertoire sont tout de même envoyés dans ce mode.
S'il s'agit d'un faux positif, le signaler avec /feedback
Anthropic conseille, si le sujet n'était pas la cybersécurité, de signaler le faux positif avec /feedback. Le Request ID et le Message ID affichés dans le message sont utiles pour le signalement. Le journal de conversation contient le code sur lequel vous travailliez et des chemins de fichiers : si vous publiez dans un lieu public comme GitHub, ne collez que les lignes nécessaires.
Si vous préférez choisir à chaque fois plutôt que basculer automatiquement
Si vous trouvez que la qualité du travail baisse sur le modèle de repli, désactivez « Switch models when a message is flagged » dans /config, ou écrivez ce qui suit dans votre fichier de paramètres. La session se mettra alors en pause à chaque arrêt et vous laissera choisir entre basculer vers le modèle de repli et modifier le prompt pour le renvoyer sur le modèle actuel.
{
"switchModelsOnFlag": false
}
Toutefois, pour les catégories sans repli (comme bio sur Sonnet 5.5 ou Opus 5), aucun choix n'est proposé et cela aboutit à un refus. En mode non interactif -p, et dans les intégrations SDK qui ne peuvent pas afficher de question, le tour arrêté aboutit aussi à un refus. Dans les sessions cloud utilisées depuis l'application mobile, l'option de modifier puis renvoyer n'est pas disponible.
Si l'arrêt survient pendant /compact
Le compactage d'une conversation fait aussi lire toute la conversation au modèle : il peut donc être arrêté lui aussi (#96648). Le CHANGELOG de la v2.1.282 indique avoir corrigé l'échec du compactage quand la demande de résumé était refusée, et qu'il réessaie désormais sur le modèle de repli. Si claude --version affiche une version antérieure à 2.1.282, faites d'abord la mise à jour avec claude update. Nous expliquons quand le compactage vaut la peine dans notre article sur le bon moment pour lancer /compact.
7. Le Cyber Verification Program (CVP) aide-t-il ?
Le CVP est un programme gratuit, sur candidature, qui rend moins probable l'arrêt par les garde-fous des personnes effectuant un travail de cybersécurité à des fins défensives légitimes. L'article du centre d'aide sur le CVP classe le travail arrêté en deux types.
Prohibited use (usage interdit)
Un travail utilisé presque exclusivement à des fins abusives, comme l'exfiltration massive de données ou le développement de ransomwares. Arrêté même avec une approbation CVP.
High Risk Dual use (double usage à haut risque)
Un travail qui peut aussi servir à la défense, comme l'exploitation de vulnérabilités ou le développement d'outils offensifs. Arrêté par défaut, mais vous pouvez postuler au CVP pour obtenir un assouplissement.
Le point clé ici, c'est que au 29 septembre 2026, le CVP ne s'applique ni à Opus 5.5 ni à Sonnet 5.5. L'article sur le CVP indique en tête qu'il s'applique aux modèles Opus et Sonnet, mais pas à Opus 5.5 ni à Sonnet 5.5, et qu'il sera bientôt étendu à Opus 5.5, Sonnet 5.5 et aux modèles de classe Mythos. L'annonce d'Opus 5.5 comme celle de Sonnet 5.5 présentent aussi l'extension du CVP comme prévue « bientôt ». Les signalements vus en section 5, « approuvé CVP mais toujours arrêté sur Opus 5.5 », concordent avec cette explication.
L'article du centre d'aide sur Opus 5.5 donne un indice supplémentaire : une phrase indiquant que les organisations qui utilisent déjà Opus 4.8 via le CVP peuvent commencer tout de suite à utiliser Opus 5, qui a moins de restrictions cyber. Si vous êtes approuvé et toujours arrêté par Opus 5.5, choisir pour l'instant Opus 5 ou Opus 4.8 avec /model est le contournement conforme à l'explication officielle.
| Point à vérifier | Ce que dit le centre d'aide |
|---|---|
| Qui peut postuler | Candidature via le Verification Portal (Claude.ai, Claude Code, API Anthropic) / seuls les administrateurs disposant des droits voient l'écran de candidature / une vérification d'identité est requise / l'objectif est de notifier le résultat de l'examen par e-mail sous 2 jours ouvrés |
| Environnements non couverts | Les organisations en Zero Data Retention (ZDR) ne sont pas éligibles pour le moment / non proposé sur Amazon Bedrock |
| Si vous êtes toujours arrêté après l'approbation | L'approbation est liée à un ID d'organisation précis : comparez-le avec l'ID d'organisation figurant dans l'e-mail d'approbation pour vous assurer que vous n'utilisez pas une autre organisation, comme un espace de travail personnel / l'usage interdit reste arrêté même après approbation |
| Si quelque chose semble toujours anormal | Vous pouvez signaler un faux positif ou contester un refus via le formulaire de l'article |
Pour les organisations dont la recherche en biologie est arrêtée par [bio], il existe un programme de vérification distinct, le Life Sciences Verification Program (LSVP). L'annonce d'Opus 5.5 indique que les organisations qui passent l'examen peuvent utiliser Opus 5.5 pour leurs recherches.
8. Facturation des requêtes arrêtées et travail inachevé
La facturation dépend de la catégorie et du moment de l'arrêt
D'après la documentation de l'API et le centre d'aide, les requêtes arrêtées sont facturées comme suit. Dans tous les cas, elles comptent dans vos limites de débit (limites d'utilisation).
Arrêt avant toute sortie : facturé
bio, frontier_llm, reasoning_extraction. L'explication officielle est que ces catégories ont peu de faux positifs (en septembre 2026).
Arrêt avant toute sortie : non facturé
cyber, general_harms, ou en l'absence de catégorie (null).
Arrêt en pleine réponse
L'entrée et la sortie diffusée avant l'arrêt sont facturées au tarif normal.
La réponse sur le modèle de repli
Facturée séparément au tarif du modèle de repli. Le coût de la perte du cache est compensé par des crédits.
Si vous utilisez un abonnement, l'effet se voit dans la vitesse à laquelle votre limite d'utilisation se consomme. L'auteur de #97335 écrit que le cache de prompt écrit par une requête arrêtée n'était pas utilisé par la requête suivante : dans une longue conversation d'environ 700 000 tokens, chaque arrêt obligeait à réécrire toute la conversation. Il a constaté avoir épuisé la fenêtre de 5 heures d'une offre Pro avec quatre refus. C'est un signalement non confirmé par Anthropic, mais si vous êtes arrêté à répétition dans une longue conversation, changer de conversation avec /clear consomme moins de votre limite que de s'obstiner dans la même conversation.
Des opérations sur fichiers à moitié terminées peuvent rester
La documentation de l'API demande que la sortie d'une réponse arrêtée en cours de route soit écartée comme incomplète. La note que Claude Code ajoute à la conversation après un arrêt, dans le texte collé dans #97335, indique aussi que les appels d'outils qui n'étaient pas terminés n'ont pas été exécutés.
Pourtant, #97311 signale quatre cas où le modèle a été arrêté pendant l'écriture d'une modification de fichier (Edit), d'une écriture de fichier (Write) ou d'un appel Bash, et où le contenu tronqué a été exécuté tel quel (v2.1.219–2.1.280, sur une seule machine Linux). Pour Edit et Write, « succès » s'affichait, mais le fichier écrit ou les lignes réécrites étaient coupés en cours de route. Il n'y a pas encore de réponse officielle, mais juste après un arrêt, le plus sûr est de vérifier les changements avec git diff avant de continuer, comme à l'étape 2 de la section 6.
# Lister les fichiers modifiés
git status
# Examiner le contenu pour repérer les modifications coupées en cours de route
git diff
# Restaurer un fichier dans son état du dernier commit (après vérification)
git restore path/to/file
Les changements faits avec les outils d'édition de fichiers de Claude Code peuvent aussi être annulés avec le retour en arrière des checkpoints. En revanche, les fichiers réécrits via Bash ne sont pas couverts par ce retour en arrière.
9. Ce qui est confirmé et ce qui ne l'est pas
✅ Confirmé officiellement
- Les classifieurs tournent côté serveur ; les mises à jour de Claude Code n'ont changé que le texte
- Ils examinent non pas la dernière phrase mais tout ce qui a été lu : la conversation, les fichiers, CLAUDE.md, etc.
- Des conversations normales et sans danger peuvent aussi être arrêtées
reasoning_extractionne bascule pas vers un autre modèle- Au 29 septembre, le CVP ne couvre ni Opus 5.5 ni Sonnet 5.5
- Depuis la v2.1.282, un /compact refusé est réessayé sur le modèle de repli
🟡 Signalé mais non confirmé
- Être arrêté par un simple « hi » ou « ola » (#96298, #96495, #97560)
- Une fois arrêtée, les sessions qui lisent cette conversation continuent d'être arrêtées (#96874, #97452)
- Des opérations sur fichiers tronquées sont exécutées (#97311)
- Le cache d'une requête arrêtée n'est pas réutilisé (#97335)
🔴 Non communiqué
- Ce à quoi chaque message a réagi
- Si les arrêts dus à des faux positifs influencent le traitement de votre compte
- La date d'extension du CVP à Opus 5.5 et Sonnet 5.5
- Le texte de l'avis Sonnet modifié dans la v2.1.284
10. En résumé
« safeguards flagged this message » signifie que le classifieur de sécurité du modèle a réagi au contenu de la conversation et a empêché ce modèle de répondre. Les classifieurs tournent côté serveur et examinent non seulement le dernier message, mais toute la conversation, les fichiers lus et même CLAUDE.md. Le message lui-même comme la documentation officielle reconnaissent que des conversations ordinaires peuvent aussi être arrêtées.
Quand vous êtes arrêté, regardez d'abord la catégorie indiquée dans Details:, et si une opération sur fichiers était en cours, vérifiez-la avec git diff. Essayez ensuite, dans l'ordre : revenir en arrière avec deux appuis sur Échap et reformuler, démarrer une nouvelle conversation avec /clear, et changer de modèle avec /model. Si [cyber] bloque votre travail, le CVP est une option, mais au 29 septembre, Opus 5.5 et Sonnet 5.5 ne sont pas encore couverts. Pour une vue d'ensemble des garde-fous côté modèle, voir notre présentation d'Opus 5.5 ; pour d'autres messages de « blocage par un filtre », voir notre article sur The model returned no content ; et pour les autres erreurs, voir notre récapitulatif des erreurs courantes de Claude Code et de leurs solutions.
FAQ
Q. Que signifie « safeguards flagged this message » ?
R. Cela signifie que le classifieur de sécurité du modèle que vous utilisiez (comme Opus 5.5 ou Fable 5.1) a réagi au contenu de la conversation et a arrêté la réponse. Ce n'est ni un dysfonctionnement de Claude Code ni une erreur réseau. Details: sur la dernière ligne contient le nom de la catégorie qui a réagi.
Q. J'ai seulement envoyé « hi » et j'ai été arrêté. Qu'ai-je fait de mal ?
R. Votre dernier message n'est pas forcément en cause. Les classifieurs examinent toute la conversation, les fichiers lus, et même CLAUDE.md et le git status. Si vous lancez claude --safe-mode et que vous n'êtes pas arrêté, il se peut qu'il ait réagi au contenu des paramètres ou des fichiers chargés. Si vous pensez qu'il s'agit d'un faux positif, signalez-le avec /feedback.
Q. Mon compte risque-t-il d'être suspendu ?
R. La documentation de Claude Code indique que les bascules de modèle pendant un travail de sécurité ou de biologie sont un routage attendu, pas un signalement du compte. En revanche, un article du centre d'aide indique que les utilisateurs qui enfreignent les politiques de façon répétée peuvent se voir appliquer temporairement des filtres renforcés, et rien n'a été communiqué sur la prise en compte des faux positifs dans ce cadre.
Q. Pourquoi suis-je arrêté alors que j'ai une approbation CVP ?
R. Parce qu'au 29 septembre 2026, le CVP ne s'applique ni à Opus 5.5 ni à Sonnet 5.5. Anthropic indique qu'il sera bientôt étendu. Anthropic écrit aussi que les organisations qui utilisent déjà Opus 4.8 via le CVP peuvent utiliser Opus 5, qui a moins de restrictions cyber : pour l'instant, le contournement consiste donc à choisir Opus 5 ou Opus 4.8 avec /model. Vérifiez aussi que l'ID d'organisation lié à votre approbation correspond à l'organisation que vous utilisez.
Q. Tout ce que j'envoie dans la même conversation est arrêté. Que faire ?
R. Tant que le contenu signalé reste dans la conversation, tout ce que vous envoyez tend à recevoir le même jugement. Appuyez deux fois sur Échap pour revenir à un tour antérieur à l'arrêt, ou démarrez une nouvelle conversation avec /clear. Vous pouvez rouvrir la conversation d'origine avec /resume, mais la reprendre ramène le contenu signalé avec elle.
Sources primaires consultées
- Claude Code — Error reference (documentation officielle) : Safety measures flagged a cybersecurity topic (texte actuel et ancien, v2.1.203 et v2.1.219), Usage Policy refusal, Responses seem lower quality than usual
- Claude Code — Model configuration (documentation officielle) : Automatic model fallback, Check what triggered fallback, Ask before switching, Security research and biology workloads
- Claude Code — Settings reference (documentation officielle) :
switchModelsOnFlag - Claude Code — Checkpointing (documentation officielle) : deux appuis sur Échap et
/rewind, ce que couvre le retour en arrière - Claude Code — Changelog (officiel) : les entrées des v2.1.282 et v2.1.284
- Claude API — Refusals and fallback (documentation officielle) : la liste des catégories, le fonctionnement de la facturation
- Centre d'aide Claude — Why Claude switched models in your conversation with Opus 5 or Opus 5.5 : bascule selon la catégorie, la catégorie distillation, le lien avec le CVP, la facturation
- Centre d'aide Claude — Real-time cyber safeguards on Claude Opus and Sonnet : couverture du CVP, candidatures et recours
- Centre d'aide Claude — Our Approach to User Safety : modèles de détection et filtres de sécurité
- Anthropic — Claude Opus 5.5, Claude Sonnet 5.5 (la section Safeguards de chaque annonce)
- Issues GitHub : #96090, #96118, #96139, #96298, #96495, #96592, #96648, #96874, #97311, #97335, #97373, #97452, #97492, #97560, #97605, #97891, #97946, #98108 (tous des signalements d'utilisateurs ; vérifié le 29 septembre 2026)