„safeguards flagged this message“ bedeutet, dass ein Sicherheits-Klassifikator (classifier), der zu einem Claude-Modell gehört, auf den Inhalt des Gesprächs reagiert und die Antwort mit diesem Modell gestoppt hat. Es ist weder ein Fehler in Claude Code noch ein Verbindungsproblem. Die Meldung erscheint nicht nur bei Arbeiten zu Cybersicherheit oder Biologie, sondern manchmal auch bei ganz normalen Anfragen wie einer Begrüßung oder einer Planung, und Anthropic räumt offiziell ein, dass es Fehlalarme geben kann.
Am Anfang der Meldung steht der Name des Modells, das gestoppt hat. Die Texte, die zwischen dem 22. und 29. September 2026 in Issues auf GitHub gemeldet wurden, waren vor allem die folgenden zwei (die Zeilenumbrüche entsprechen nicht genau dem Bildschirm).
API Error: Opus 5.5's safeguards flagged this message (https://www.anthropic.com/legal/aup). This sometimes happens with safe, normal conversations. Claude Code can't respond to this message with Opus 5.5.
Double press esc to edit your last message, or try a different model with /model.
Send feedback with /feedback or learn more: https://support.claude.com/en/articles/8106465
Details: `[reasoning_extraction]`
API Error: Opus 5.5's safeguards flagged this session (https://www.anthropic.com/legal/aup). You may be seeing this for the first time on an Opus model: Opus 5.5 is more capable and has stronger safeguards as a result, which can sometimes flag non-cybersecurity work. We're improving these safeguards to reduce the amount of incorrectly flagged messages. Claude Code can't respond to your last message with Opus 5.5.
Double press esc to edit your last message, or try a different model with /model.
Send feedback with /feedback or learn more: https://support.claude.com/en/articles/8106465
Details: `[cyber]`
In den Titeln der Issues steht oft „Message flagged by safeguards“, auf dem Bildschirm erscheint aber der Text oben. Der Teil Opus 5.5 ändert sich je nach verwendetem Modell, etwa zu Fable 5.1, Opus 5 oder Opus 4.8.
Zuerst die letzte Zeile „Details:“ lesen
Welcher Klassifikator gestoppt hat, entscheidet über die richtige Reaktion
Eingestuft als Versuch, das interne Schlussfolgern des Modells herauszuziehen
Eingestuft als Arbeit, die für Cyberangriffe nutzbar sein könnte
Eingestuft als mögliche gefährliche Anwendung in der Biologie
Eingestuft als anderer Bereich der Nutzungsrichtlinien oder als Entwicklung von Spitzen-KI
Inhalt
- 1. Was die Meldung bedeutet: Ein Klassifikator hat das Gespräch gelesen und gestoppt
- 2. Der Wortlaut unterscheidet sich je nach Modell und Version
- 3. Die Kategorien in Details und ob das Modell wechselt
- 4. Liegt es an meiner Arbeit? Was Anthropic offiziell zu Fehlalarmen schreibt
- 5. Gemeldete Fälle seit dem 22. September
- 6. Was tun, wenn gestoppt wurde
- 7. Hilft das Cyber Verification Program (CVP)?
- 8. Abrechnung gestoppter Anfragen und halb erledigte Arbeit
- 9. Was feststeht und was nicht
- 10. Fazit
- FAQ
1. Was die Meldung bedeutet: Ein Klassifikator hat das Gespräch gelesen und gestoppt
Laut der offiziellen Dokumentation der Claude API „Refusals and fallback“ haben Fable 5.1, Fable 5, Opus 5.5, Opus 5 und Sonnet 5.5 Sicherheits-Klassifikatoren, die Anfragen ablehnen können. Bei einer Ablehnung liefert die API keinen Fehler, sondern eine normale Antwort (HTTP 200), setzt den Stoppgrund auf stop_reason: "refusal" und trägt in stop_details.category ein, in welchem Bereich abgelehnt wurde. Claude Code empfängt das und zeigt es als Meldung an, die mit „API Error:“ beginnt.
Wichtig ist: Der Klassifikator betrachtet nicht nur den zuletzt gesendeten Satz. Der Artikel im Help Center zu den Schutzmaßnahmen von Opus 5.5 schreibt, dass der Klassifikator „alles, was das Modell liest“, betrachtet. Dazu gehören auch Erinnerungen (Memory), Inhalte aus Connectors, Ergebnisse der Websuche und Dateien, sodass Sie auch wegen Inhalten gestoppt werden können, die Sie gar nicht selbst getippt haben.
Ihre eigenen Anweisungen
Die zuletzt gesendete Nachricht und der gesamte vorherige Austausch.
Was Claude gelesen hat
Geöffnete Dateien, Ausgaben von Befehlen, Ergebnisse der Websuche, Inhalte aus MCP oder Connectors.
Von Anfang an mitgesendete Angaben
Angaben zum Arbeitsverzeichnis, die Claude Code der ersten Anfrage beifügt, etwa der Inhalt von CLAUDE.md oder git status.
Die Ausgabe des Modells selbst
Auch mitten in der Antwort kann gestoppt werden. Dann gilt auch der bis dahin gestreamte Teil als unvollständig.
Zum dritten Punkt schreibt die Dokumentation zur Modellkonfiguration von Claude Code ausdrücklich, dass der Klassifikator „bei der ersten Anfrage einer Sitzung reagieren kann, obwohl noch nichts Ungewöhnliches gesendet wurde“. Die erste Anfrage enthält den Inhalt von CLAUDE.md und git status, sodass in Repositorys mit Material zu Sicherheit oder Biologie schon diese Angaben den Klassifikator auslösen können. Der vierte Punkt entspricht der Aussage der API-Dokumentation, dass eine Ablehnung vor oder während der Ausgabe kommen kann und die bis dahin erzeugte Ausgabe in beiden Fällen als unvollständig zu verwerfen ist.
2. Der Wortlaut unterscheidet sich je nach Modell und Version
Auch wenn der Mechanismus derselbe ist, gibt es mehrere Wortlaute. Die offizielle Fehlerreferenz zeigt für den geltenden Wortlaut dieses Beispiel:
API Error: Opus 4.8's safeguards flagged this message. Our intentionally broad safeguards allow us to deliver more capabilities faster, but can sometimes flag legitimate cybersecurity work. Apply to the Cyber Verification Program to reduce these interruptions. Send feedback with /feedback or learn more: https://support.claude.com/en/articles/14604842-real-time-cyber-safeguards-on-claude
Die Fehlerreferenz schreibt weiter, dass die Meldung bei Opus 5.5 und Sonnet 5.5 mit <model>'s safeguards flagged this session beginnt. Die beiden Meldungen vom Anfang dieses Artikels stammen aus Issues ab dem 22. September 2026. In den Issues, die wir gelesen haben, stand bei der Meldung flagged this session [cyber] oder [bio], bei der Meldung This sometimes happens with safe, normal conversations überwiegend [reasoning_extraction].
| Anfang des Wortlauts | Wo bestätigt | Wie es weitergeht |
|---|---|---|
<model>'s safeguards flagged this message. Our intentionally broad safeguards… | Offizielle Fehlerreferenz (in Issues zusammen mit [cyber] gemeldet) | Hinweis auf den Antrag beim CVP (bei einem Wechsel steht auch das Ausweichmodell dabei, etwa Switched to Opus 4.8.) |
<model>'s safeguards flagged this session | Offizielle Fehlerreferenz (Opus 5.5 und Sonnet 5.5) und Issues zu v2.1.280 bis 2.1.283 | Erklärung „Sie sehen das vielleicht zum ersten Mal bei einem Opus-Modell: Mehr Fähigkeiten bedeuten stärkere Schutzmaßnahmen“ |
<model>'s safeguards flagged this message (…aup). This sometimes happens… | Issues zu v2.1.278 bis 2.1.284 (kein Beispiel in der offiziellen Referenz) | Sagt, dass es „auch bei sicheren, normalen Gesprächen passieren kann“, und empfiehlt Bearbeiten mit Esc oder /model |
<model> has safety measures that flagged this message for a cybersecurity topic | Offizielle Fehlerreferenz (alter Wortlaut von v2.1.203 bis 2.1.218) | Link zum Help Center (vor v2.1.203 ein Link zum Formular für Ausnahmeanträge) |
<model> can't help with this. Start a new session to continue. | Offizielle Fehlerreferenz (Usage Policy refusal) | Ablehnung durch die Prüfung der Nutzungsrichtlinien (Usage Policy) (auf Amazon Bedrock, der Agent Platform von Google Cloud und Microsoft Foundry lautet auch eine Cyber-Einstufung so) |
Die Fehlerreferenz schreibt, dass die Klassifikatoren selbst serverseitig laufen und schon vor v2.1.203 existierten; mit den späteren Updates von Claude Code hat sich nur der Wortlaut der Meldung geändert. Es ist also nicht so, dass ein Update von Claude Code die Stopps ausgelöst hätte.
Was sich mit v2.1.284 geändert hat
Das CHANGELOG von v2.1.284, veröffentlicht am 28. September 2026, enthält zwei Punkte zu dieser Meldung.
- Die Benachrichtigung, wenn die Schutzmaßnahmen eines Sonnet-Modells auf eine Nachricht reagieren, erklärt jetzt, warum es passiert ist, und bietet an, die Nachricht zu bearbeiten und neu zu senden.
- Der Modellwechsel durch Schutzmaßnahmen wurde für Sitzungen geändert, die ein Opus-Modell mit
ANTHROPIC_DEFAULT_OPUS_MODELodermodelOverridesfestlegen. Auf der Anthropic API wählt nicht mehr das festgelegte Modell, sondern die API je nach Art der Einstufung das Ausweichmodell.
Der Wortlaut der neuen Benachrichtigung für Sonnet stand am 29. September weder in der offiziellen Fehlerreferenz noch in den Issues, die wir gelesen haben.
3. Die Kategorien in Details und ob das Modell wechselt
Das Wort nach Details: am Ende der Meldung entspricht dem Wert von stop_details.category, den die API liefert. Die API-Dokumentation führt fünf Kategorien auf. Beachten Sie, dass bei jeder Kategorie (außer reasoning_extraction) vermerkt ist, dass sie „auch bei harmloser Arbeit auslösen kann“.
| Details | Offizielle Beschreibung (sinngemäß) | Verhalten in Claude Code |
|---|---|---|
cyber | Könnte für Cyberangriffe nutzbar sein, etwa die Entwicklung von Malware oder Exploits | Fable 5.1, Fable 5, Opus 5.5 und Opus 5 wechseln zu Opus 4.8, Sonnet 5.5 zu Sonnet 5, und dieselbe Anfrage wird neu gesendet |
bio | Könnte zu biologischem Schaden führen, etwa Methoden für gefährliche Experimente | Fable 5.1, Fable 5 und Opus 5.5 wechseln zu Opus 5; Opus 5 und Sonnet 5.5 haben kein Ausweichmodell, die Anfrage endet mit einer Ablehnung |
frontier_llm | Könnte bei der Entwicklung konkurrierender KI-Modelle helfen (durch die kommerziellen Bedingungen eingeschränkt) | Laut Help Center Wechsel von Opus 5.5 zu Opus 5 (Opus 5 wechselt bei dieser Kategorie nicht) |
reasoning_extraction | Versuch, das interne Schlussfolgern des Modells als Antworttext wiedergeben zu lassen | Kategorie „Destillation“ (distillation) im Help Center: kein Wechsel zu einem anderen Modell, der Vorgang stoppt sofort |
general_harms | Fällt in einen anderen Bereich der Nutzungsrichtlinien als die vier oben | Die Dokumentation von Claude Code nennt kein Ausweichmodell |
Quellen: Kategorientabelle in „Refusals and fallback“ der Claude API, Automatic model fallback in „Model configuration“ von Claude Code, Help Center „Why Claude switched models in your conversation with Opus 5 or Opus 5.5“ (alle am 29. September 2026 geprüft).
Wenn das Modell gewechselt wird
Wird in einer Kategorie mit Ausweichmodell gestoppt, sendet Claude Code dieselbe Anfrage standardmäßig automatisch mit dem Ausweichmodell neu und zeigt im Gespräch eine Benachrichtigung an. Die Sitzung läuft danach mit dem Ausweichmodell weiter. Zum ursprünglichen Modell kehren Sie zurück, indem Sie es mit /model erneut wählen.
Das Help Center warnt allerdings: Auch nach der Rückkehr zum ursprünglichen Modell kann dieselbe Schutzmaßnahme erneut einen Wechsel auslösen, solange die gestoppte Anfrage im Gespräch steht; die vorherige Nachricht vor dem erneuten Senden zu bearbeiten, hilft oft. Typische Fälle, in denen kein Wechsel hilft und die Meldung vom Anfang stehen bleibt: wenn in einer Kategorie ohne Ausweichmodell wie reasoning_extraction gestoppt wurde, wenn auch das Ausweichmodell stoppt, wenn das Ausweichmodell in availableModels nicht erlaubt ist, und wenn in einem nicht interaktiven Modus wie -p die Einstellung „vor dem Wechsel nachfragen“ aktiv ist.
4. Liegt es an meiner Arbeit? Was Anthropic offiziell zu Fehlalarmen schreibt
Wenn Sie das Gefühl haben, gestoppt worden zu sein, obwohl Sie nichts Falsches getan haben, ist das gut möglich. Die offiziellen Dokumente räumen an mehreren Stellen ausdrücklich ein, dass es Fehlalarme gibt.
✅ Was in den offiziellen Dokumenten steht
- Wortlaut der Meldung: „This sometimes happens with safe, normal conversations“ (passiert manchmal auch bei sicheren, normalen Gesprächen), „intentionally broad safeguards“ (absichtlich weit gefasste Schutzmaßnahmen)
- API-Dokumentation: Bei
cyber,bio,frontier_llmundgeneral_harmsist jeweils vermerkt, dass sie „auch bei harmloser Arbeit auslösen können“ - Dokumentation von Claude Code: Bei offensiver Sicherheitsarbeit oder Biologie kommt es oft schon ab der ersten Anfrage zum Wechsel. „In diesen Bereichen ist das erwartete Routing, keine Markierung des Kontos (account flag)“
- Help Center: Die Klassifikatoren werden angepasst, um Fehlalarme zu verringern, und verschiedene Signale zur Vertrauenswürdigkeit eines Kontos sollen einbezogen werden
- Erklärung zum CVP: Auch bei zugelassenen Nutzern kann legitime Arbeit gestoppt werden
Andererseits schreibt der Artikel im Help Center, auf den die Meldung verlinkt (Our Approach to User Safety), dass Nutzern, die wiederholt gegen die Richtlinien verstoßen, vorübergehend Sicherheitsfilter mit empfindlicherer Erkennung zugeschaltet werden können. Ob Stopps durch Fehlalarme dabei mitgezählt werden, steht nirgends offiziell. Nach einem Stopp ist es sicherer, das Gespräch mit den Schritten aus Abschnitt 6 zu wechseln, statt dieselbe Anfrage immer wieder nur anders formuliert zu senden.
Vorgehen bei einem Stopp durch reasoning_extraction
Als Beispiele, die diese Kategorie stoppt, nennt das Help Center Anfragen, „das Schlussfolgern Wort für Wort zu wiederholen“ oder „den gesamten Denkprozess (chain of thought) in eine externe Ausgabe zu schreiben“. Dagegen sei es möglich, „das Schlussfolgern erklären“, „Konzepte beibringen“ oder „ein Code-Review Schritt für Schritt erläutern“ zu lassen, und Gesprächsfragen wie „Warum hast du das gemacht?“ seien nicht betroffen.
In den Issues finden sich Fälle, in denen direkt nach Anfragen wie den folgenden gestoppt wurde. Alle sind Berichte von Nutzern, und Anthropic hat nicht erklärt, warum ausgelöst wurde.
- Die Frage, ob sich auf dem Bildschirm statt der Tool-Aufrufe das „Denken“ anzeigen lässt (#96118)
- Ein Subagent sollte die Zeile mit dem Namen des Modells, auf dem er läuft, aus dem Kontext zitieren (#96139)
- Am Ende einer langen Arbeit sollte eine Zusammenfassung der Sitzung in eine Datei geschrieben werden (#96874)
- In ein Designdiagramm sollten zu jeder Entscheidung „die erwogenen Optionen und die Gründe für ihre Ablehnung“ eingetragen werden (#98108)
Gemeinsam ist ihnen, dass der „Denkprozess“ oder der „eigene Kontext“ unverändert ausgeschrieben werden soll. Brauchen Sie so etwas als Ergebnis, bringen Sie die Anfrage mit einer Formulierung, die das Ergebnis kurz zusammenfassen lässt, etwa „das Fazit und die Gründe für die Wahl in drei Zeilen“, näher an das, was die offizielle Seite als „das Schlussfolgern erklären lassen“ nennt. Wie ein Nachtrag zu #96118 zeigt, wurde aber auch schon eine kurze Frage auf Deutsch gestoppt; Umformulieren hilft also nicht in jedem Fall.
5. Gemeldete Fälle seit dem 22. September
Seit der Veröffentlichung von Opus 5.5 am 22. September 2026 häufen sich solche Meldungen in den Issues von anthropics/claude-code. Bei unserer Zählung über die Suche von GitHub am 29. September gab es 67 Issues, die zwischen dem 22. und 28. September erstellt wurden und „safeguards“ im Titel oder Text enthalten (7 bis 12 pro Tag; die Zahl hängt von den Suchbegriffen ab). In den Issues ab dem 22. September, die wir gelesen haben, fanden wir keine Antwort von Anthropic-Mitarbeitern, und auffällig viele trugen das Label „duplicate“.
🟡 Auf GitHub gemeldete Fälle ohne geklärte Ursache (geprüft am 29. September 2026)
- Gestoppt bei einer bloßen Begrüßung: Auf „hi“ als
[cyber]eingestuft und zu Opus 4.8 gewechselt (#96298), gestoppt bei „ola“ (#96495),[reasoning_extraction]bei „hi“ (#97560). Die meldende Person von #96495 vermutet, dass die Nutzung von Kali Linux als root eine Rolle gespielt haben könnte. - Gestoppt bei /compact: Während der Komprimierung des Gesprächs erschien die Meldung mit
[reasoning_extraction](#96648, v2.1.281). - Nach einem Stopp ist das ganze Gespräch unbrauchbar: Alle weiteren Nachrichten derselben Sitzung wurden gestoppt (#96874); die gestoppte Formulierung blieb im Gesprächsprotokoll, und auch spätere Sitzungen, die es lasen, wurden gestoppt (#97452).
- Subagenten werden gestoppt: Laut Auswertung auf einem einzelnen Rechner wurden von 866 Subagenten mit Opus 5 14 (1,62 %) mit
[reasoning_extraction]gestoppt, alle bei Review-Aufgaben (#97492). - Auch mit CVP-Zulassung gestoppt: Trotz Zulassung mit Opus 5.5 als
[cyber]eingestuft (#96090, #96298, #96592, #97946). Das passt, wie in Abschnitt 7 beschrieben, zur offiziellen Erklärung. - Gestoppt bei Arbeit an eigenen Geräten oder eigenem Code: Untersuchung eines „Permission denied“ beim eigenen SSH (#97373), Disassemblieren einer Binärdatei des eigenen Produkts (#97891), Entfernen fest im Quellcode hinterlegter Zugangsdaten (#97605).
Die Stopps bei einer bloßen Begrüßung lassen sich möglicherweise mit der offiziellen Erklärung aus Abschnitt 1 erklären, dass der Klassifikator das ganze Gespräch und die Angaben zum Arbeitsverzeichnis betrachtet: Auch wenn die letzte Nachricht harmlos war, könnte er auf CLAUDE.md, den bisherigen Austausch oder gelesene Dateien reagiert haben. Keiner der Berichte zeigt aber, worauf reagiert wurde, und es gibt keine öffentliche Möglichkeit, das zu prüfen.
6. Was tun, wenn gestoppt wurde
Die Maßnahmen aus der offiziellen Fehlerreferenz und der Dokumentation zur Modellkonfiguration stehen hier nach Aufwand geordnet, vom geringsten an. Bei einem einmaligen Stopp reicht meist Schritt 3.
Details lesen und prüfen, ob gewechselt wurde
Steht Switched to oder eine Benachrichtigung über den Wechsel da, läuft die Arbeit bereits mit einem anderen Modell weiter. Bleibt es beim Stopp, gleichen Sie die Kategorie unter Details: mit der Tabelle in Abschnitt 3 ab.
Laufende Dateioperationen prüfen
Wurde mitten in der Antwort gestoppt, ist die bisherige Ausgabe unvollständig. Prüfen Sie zuerst mit git status und git diff, ob halb geschriebene Änderungen zurückgeblieben sind (Abschnitt 8).
Zweimal Esc drücken, zurückgehen und anders formuliert senden
Drücken Sie bei leerem Eingabefeld zweimal Esc oder führen Sie /rewind aus, dann öffnet sich das Menü zum Zurückspulen. Wählen Sie einen Punkt vor dem gestoppten Zug und senden Sie die Anfrage mit anderer Formulierung oder anderem Vorgehen neu. Diese Maßnahme nennt Anthropic als erste für diese Meldung.
Ist unklar, welcher Zug die Ursache war, ein neues Gespräch beginnen
Mit /clear beginnen Sie im selben Projekt ein neues Gespräch. Das alte Gespräch bleibt erhalten und lässt sich über /resume öffnen. Wenn Sie es aber mit --continue oder --resume fortsetzen, kommt auch der gestoppte Inhalt mit zurück, und es wird leicht wieder gestoppt.
Mit /model zu einem anderen Modell wechseln
Die Meldung selbst empfiehlt „try a different model with /model“. Die Modelle haben unterschiedliche Klassifikatoren. So schreibt etwa die Ankündigung von Sonnet 5.5, dass es das erste Sonnet ist, das mit einem Klassifikator gegen das Herausziehen des Schlussfolgerns erscheint; die Vorgängergeneration Sonnet 5 hat diesen Klassifikator nicht.
Eingrenzen, ob CLAUDE.md oder Ähnliches die Ursache ist
Wird schon die erste Nachricht gestoppt, starten Sie mit claude --safe-mode. Dann werden CLAUDE.md, Skills, MCP-Server und Hooks nicht geladen; wird so nicht gestoppt, steckt der auslösende Inhalt in dem, was sonst geladen wird. git status und der Verzeichnisname werden auch in diesem Modus gesendet.
Fehlalarme mit /feedback melden
Anthropic empfiehlt: Wenn es nicht um ein Cybersicherheitsthema ging, melden Sie den Fehlalarm mit /feedback. Die Request ID und Message ID aus der Meldung helfen dabei. Das Gesprächsprotokoll enthält Code aus Ihrer Arbeit und Dateipfade; posten Sie an öffentlichen Orten wie GitHub also nur die nötigen Zeilen.
Wenn Sie nicht automatisch wechseln, sondern jedes Mal selbst wählen wollen
Wenn Sie finden, dass die Qualität der Arbeit mit dem Ausweichmodell nachlässt, schalten Sie unter /config „Switch models when a message is flagged“ aus oder tragen Folgendes in die Einstellungsdatei ein. Dann pausiert die Sitzung bei jedem Stopp, und Sie können wählen, ob Sie „zum Ausweichmodell wechseln“ oder „den Prompt bearbeiten und mit dem bisherigen Modell neu senden“ wollen.
{
"switchModelsOnFlag": false
}
In Kategorien ohne Ausweichmodell (etwa bio bei Sonnet 5.5 oder Opus 5) erscheint allerdings keine Auswahl, und die Anfrage endet mit einer Ablehnung. Auch im nicht interaktiven Modus -p und in SDK-Integrationen, die keine Rückfrage anzeigen können, endet der gestoppte Zug mit einer Ablehnung. In Cloud-Sitzungen aus der Smartphone-App steht „bearbeiten und neu senden“ nicht zur Verfügung.
Wenn /compact gestoppt wird
Auch die Komprimierung des Gesprächs lässt das Modell das ganze Gespräch lesen und kann deshalb gestoppt werden (#96648). Im CHANGELOG von v2.1.282 steht, dass ein Fehler behoben wurde, durch den die Komprimierung fehlschlug, wenn die Zusammenfassungsanfrage abgelehnt wurde, und dass nun mit dem Ausweichmodell erneut versucht wird. Ist claude --version älter als 2.1.282, aktualisieren Sie zuerst mit claude update. Wann sich die Komprimierung lohnt, beschreibt der Artikel zum richtigen Zeitpunkt für /compact.
7. Hilft das Cyber Verification Program (CVP)?
Das CVP ist ein kostenloses Antragsverfahren für Personen, die Cybersicherheitsarbeit zu legitimen Verteidigungszwecken leisten, damit sie seltener von Schutzmaßnahmen gestoppt werden. Der Artikel zum CVP im Help Center teilt die gestoppte Arbeit in zwei Gruppen.
Verbotene Nutzung (Prohibited use)
Arbeit, die fast nur missbräuchlich genutzt wird, etwa das Abziehen großer Datenmengen oder die Entwicklung von Ransomware. Wird auch mit CVP-Zulassung gestoppt.
Doppelte Verwendbarkeit mit hohem Risiko (High Risk Dual use)
Arbeit, die auch der Verteidigung dient, etwa das Ausnutzen von Schwachstellen oder die Entwicklung von Angriffswerkzeugen. Standardmäßig gestoppt, eine Lockerung lässt sich über das CVP beantragen.
Entscheidend ist: Stand 29. September 2026 gilt das CVP nicht für Opus 5.5 und Sonnet 5.5. Der CVP-Artikel schreibt gleich zu Beginn: „Dieser Artikel gilt für Opus- und Sonnet-Modelle, aber nicht für Opus 5.5 und Sonnet 5.5. Wir werden ihn bald auf Opus 5.5, Sonnet 5.5 und Modelle der Mythos-Klasse ausweiten.“ Auch die Ankündigungen von Opus 5.5 und Sonnet 5.5 sprechen von einer Ausweitung des CVP „bald“. Die in Abschnitt 5 genannten Berichte „trotz CVP-Zulassung mit Opus 5.5 gestoppt“ stimmen mit dieser Erklärung überein.
Der Artikel im Help Center zu Opus 5.5 enthält einen weiteren Hinweis: „Organisationen, die Opus 4.8 bereits über das CVP nutzen, können sofort Opus 5 mit weniger Cyber-Einschränkungen verwenden.“ Werden Sie trotz Zulassung von Opus 5.5 gestoppt, ist es vorerst die Umgehung im Sinne der offiziellen Erklärung, mit /model Opus 5 oder Opus 4.8 zu wählen.
| Zu prüfen | Erklärung im Help Center |
|---|---|
| Wer einen Antrag stellen kann | Antrag über das Verification Portal (Claude.ai, Claude Code, Anthropic API) / die Antragsseite sehen nur berechtigte Administratoren / Identitätsprüfung erforderlich / Ziel ist eine Benachrichtigung über das Ergebnis per E-Mail innerhalb von 2 Werktagen |
| Nicht unterstützte Umgebungen | Organisationen mit Zero Data Retention (ZDR) sind bislang ausgeschlossen / auf Amazon Bedrock nicht angeboten |
| Wenn nach der Zulassung weiter gestoppt wird | Die Zulassung ist an eine bestimmte Organisations-ID gebunden; vergleichen Sie mit der Organisations-ID aus der Zulassungs-E-Mail, ob Sie in einer anderen Organisation arbeiten, etwa einem persönlichen Workspace / verbotene Nutzung wird auch nach der Zulassung gestoppt |
| Wenn es trotzdem nicht stimmt | Über das Formular im Artikel lassen sich Fehlalarme melden oder Widerspruch gegen eine Ablehnung einlegen |
Für Organisationen, die bei biologischer Forschung von [bio] gestoppt werden, gibt es ein eigenes Prüfverfahren, das Life Sciences Verification Program (LSVP). Die Ankündigung von Opus 5.5 schreibt, dass geprüfte Organisationen Opus 5.5 für ihre Forschung nutzen können.
8. Abrechnung gestoppter Anfragen und halb erledigte Arbeit
Die Abrechnung hängt von Kategorie und Zeitpunkt des Stopps ab
Laut API-Dokumentation und Help Center werden gestoppte Anfragen wie folgt abgerechnet. In jedem Fall zählen sie zu den Rate Limits (Nutzungsgrenzen).
Stopp vor der Ausgabe: wird berechnet
bio, frontier_llm, reasoning_extraction. Offizielle Begründung: Diese Kategorien haben wenige Fehlalarme (Stand September 2026).
Stopp vor der Ausgabe: wird nicht berechnet
cyber, general_harms oder keine Kategorie (null).
Stopp mitten in der Antwort
Die Eingabe und die bis zum Stopp gestreamte Ausgabe werden zum normalen Tarif berechnet.
Antwort des Ausweichmodells
Wird separat zum Tarif des Ausweichmodells berechnet. Der Verlust des Caches wird mit Guthaben ausgeglichen.
Mit einem Abonnement wirkt sich das darauf aus, wie schnell die Nutzungsgrenze schrumpft. Die meldende Person von #97335 schreibt, dass der von einer gestoppten Anfrage geschriebene Prompt-Cache bei der nächsten Anfrage nicht verwendet wurde, sodass in einem langen Gespräch mit rund 700.000 Tokens bei jedem Stopp das ganze Gespräch neu geschrieben wurde. Beobachtet wurde, dass das 5-Stunden-Kontingent des Pro-Tarifs nach 4 Ablehnungen aufgebraucht war. Das ist ein offiziell nicht bestätigter Bericht, doch wenn ein langes Gespräch immer wieder gestoppt wird, ist der Verlust auch beim Kontingent kleiner, wenn Sie mit /clear wechseln, statt im selben Gespräch weiterzumachen.
Halb ausgeführte Dateioperationen können zurückbleiben
Die API-Dokumentation verlangt, die Ausgabe einer mittendrin gestoppten Antwort „als unvollständig zu verwerfen“. Auch der Hinweis, den Claude Code nach einem Stopp ans Gespräch anhängt, lautet laut dem in #97335 eingefügten Text, dass nicht abgeschlossene Tool-Aufrufe nicht ausgeführt wurden.
#97311 berichtet jedoch von 4 Fällen, in denen mitten im Schreiben einer Dateibearbeitung (Edit), eines Dateischreibvorgangs (Write) oder eines Bash-Aufrufs gestoppt und der abgeschnittene Inhalt trotzdem ausgeführt wurde (v2.1.219 bis 2.1.280, ein einzelner Linux-Rechner). Bei Edit und Write wurde „erfolgreich“ angezeigt, doch die geschriebene Datei oder die geänderten Zeilen waren abgeschnitten. Eine offizielle Antwort gibt es noch nicht; sicher ist es, direkt nach einem Stopp wie in Schritt 2 aus Abschnitt 6 die Änderungen mit git diff zu prüfen, bevor Sie weitermachen.
# Geänderte Dateien auflisten
git status
# Inhalt ansehen: Gibt es abgeschnittene Änderungen?
git diff
# Eine Datei auf den Stand des letzten Commits zurücksetzen (erst nach Prüfung)
git restore path/to/file
Änderungen, die mit den Dateibearbeitungs-Tools von Claude Code gemacht wurden, lassen sich auch mit dem Zurückspulen zu Checkpoints rückgängig machen. Dateien, die über Bash geändert wurden, erfasst das Zurückspulen allerdings nicht.
9. Was feststeht und was nicht
✅ Offiziell bestätigt
- Die Klassifikatoren laufen serverseitig; mit den Updates von Claude Code hat sich nur der Wortlaut geändert
- Betrachtet wird nicht nur der letzte Satz, sondern alles Gelesene: Gespräch, Dateien, CLAUDE.md und mehr
- Auch sichere, normale Gespräche können gestoppt werden
reasoning_extractionwechselt nicht zu einem anderen Modell- Das CVP gilt Stand 29. September nicht für Opus 5.5 und Sonnet 5.5
- Seit v2.1.282 wird bei einer Ablehnung von /compact mit dem Ausweichmodell erneut versucht
🟡 Gemeldet, aber nicht geklärt
- Stopp schon bei „hi“ oder „ola“ (#96298, #96495, #97560)
- Nach einem Stopp werden auch Sitzungen, die das Gespräch lesen, immer wieder gestoppt (#96874, #97452)
- Abgeschnittene Dateioperationen werden ausgeführt (#97311)
- Der Cache gestoppter Anfragen wird nicht wiederverwendet (#97335)
🔴 Nicht veröffentlicht
- Worauf bei einer einzelnen Meldung reagiert wurde
- Ob Stopps durch Fehlalarme sich auf die Behandlung des Kontos auswirken
- Das Datum, ab dem das CVP auf Opus 5.5 und Sonnet 5.5 ausgeweitet wird
- Der Wortlaut der mit v2.1.284 geänderten Benachrichtigung für Sonnet
10. Fazit
„safeguards flagged this message“ bedeutet, dass der Sicherheits-Klassifikator eines Modells auf den Inhalt des Gesprächs reagiert und die Antwort mit diesem Modell gestoppt hat. Der Klassifikator läuft serverseitig und betrachtet nicht nur die letzte Nachricht, sondern das ganze Gespräch, gelesene Dateien und sogar CLAUDE.md. Dass auch normale Gespräche gestoppt werden können, räumen sowohl die Meldung selbst als auch die offiziellen Dokumente ein.
Wurde gestoppt, lesen Sie zuerst die Kategorie unter Details:, und wenn gerade eine Dateioperation lief, prüfen Sie mit git diff. Probieren Sie dann in dieser Reihenfolge: mit zweimal Esc zurückgehen und umformulieren, mit /clear ein neues Gespräch beginnen, mit /model das Modell wechseln. Stoppt [cyber] Ihre berufliche Arbeit, ist das CVP eine Option, doch Stand 29. September sind Opus 5.5 und Sonnet 5.5 noch ausgenommen. Einen Überblick über die Schutzmaßnahmen auf Modellseite gibt die Analyse zu Opus 5.5, andere Meldungen der Art „vom Filter gestoppt“ behandelt der Artikel zu The model returned no content, und weitere Fehler fasst die Übersicht häufiger Fehler in Claude Code und ihrer Lösungen zusammen.
FAQ
F. Was bedeutet „safeguards flagged this message“?
A. Dass der Sicherheits-Klassifikator des verwendeten Modells (etwa Opus 5.5 oder Fable 5.1) auf den Inhalt des Gesprächs reagiert und die Antwort gestoppt hat. Es ist weder ein Defekt von Claude Code noch ein Verbindungsfehler. In der letzten Zeile unter Details: steht der Name der Kategorie, die ausgelöst hat.
F. Ich habe nur „hi“ gesendet und wurde gestoppt. Was habe ich falsch gemacht?
A. Die Ursache muss nicht Ihre letzte Nachricht sein. Der Klassifikator betrachtet das ganze Gespräch, gelesene Dateien und sogar CLAUDE.md und git status. Wird nach einem Start mit claude --safe-mode nicht mehr gestoppt, hat er möglicherweise auf den Inhalt geladener Einstellungen oder Dateien reagiert. Halten Sie es für einen Fehlalarm, melden Sie es mit /feedback.
F. Kann mein Konto gesperrt werden?
A. Die Dokumentation von Claude Code schreibt, dass ein Modellwechsel bei Sicherheits- oder Biologiearbeit erwartetes Routing und keine Markierung des Kontos ist. Andererseits gibt es einen Artikel im Help Center, nach dem Nutzern, die wiederholt gegen die Richtlinien verstoßen, vorübergehend strengere Filter zugeschaltet werden können; ob Fehlalarme dabei mitzählen, ist nicht veröffentlicht.
F. Warum werde ich trotz CVP-Zulassung gestoppt?
A. Weil das CVP Stand 29. September 2026 nicht für Opus 5.5 und Sonnet 5.5 gilt. Anthropic will es bald ausweiten. Laut offizieller Aussage können Organisationen, die Opus 4.8 bereits über das CVP nutzen, Opus 5 mit weniger Cyber-Einschränkungen verwenden; vorerst hilft es also, mit /model Opus 5 oder Opus 4.8 zu wählen. Prüfen Sie auch, ob die an die Zulassung gebundene Organisations-ID mit der Organisation übereinstimmt, in der Sie arbeiten.
F. Im selben Gespräch wird jede Nachricht gestoppt. Was kann ich tun?
A. Solange der gestoppte Inhalt im Gespräch steht, führt fast alles, was Sie senden, zur selben Einstufung. Gehen Sie mit zweimal Esc zu einem Zug vor dem Stopp zurück oder beginnen Sie mit /clear ein neues Gespräch. Das alte Gespräch lässt sich mit /resume öffnen, doch beim Fortsetzen kommt auch der gestoppte Inhalt mit zurück.
Verwendete Primärquellen
- Claude Code — Error reference (offizielle Dokumentation): Safety measures flagged a cybersecurity topic (geltender und alter Wortlaut, v2.1.203, v2.1.219), Usage Policy refusal, Responses seem lower quality than usual
- Claude Code — Model configuration (offizielle Dokumentation): Automatic model fallback, Check what triggered fallback, Ask before switching, Security research and biology workloads
- Claude Code — Settings reference (offizielle Dokumentation):
switchModelsOnFlag - Claude Code — Checkpointing (offizielle Dokumentation): zweimal Esc und
/rewind, Umfang des Zurückspulens - Claude Code — Changelog (offiziell): die Punkte zu v2.1.282 und v2.1.284
- Claude API — Refusals and fallback (offizielle Dokumentation): Liste der Kategorien, Abrechnung
- Claude Help Center — Why Claude switched models in your conversation with Opus 5 or Opus 5.5: Wechsel je Kategorie, Kategorie Destillation, Verhältnis zum CVP, Abrechnung
- Claude Help Center — Real-time cyber safeguards on Claude Opus and Sonnet: Geltungsbereich, Antrag und Widerspruch beim CVP
- Claude Help Center — Our Approach to User Safety: Erkennungsmodelle und Sicherheitsfilter
- Anthropic — Claude Opus 5.5, Claude Sonnet 5.5 (Abschnitt Safeguards der Ankündigungen)
- GitHub-Issues: #96090, #96118, #96139, #96298, #96495, #96592, #96648, #96874, #97311, #97335, #97373, #97452, #97492, #97560, #97605, #97891, #97946, #98108 (alle Berichte von Nutzern, geprüft am 29. September 2026)