„safeguards flagged this message“ bedeutet, dass ein Sicherheits-Klassifikator (classifier), der zu einem Claude-Modell gehört, auf den Inhalt des Gesprächs reagiert und die Antwort mit diesem Modell gestoppt hat. Es ist weder ein Fehler in Claude Code noch ein Verbindungsproblem. Die Meldung erscheint nicht nur bei Arbeiten zu Cybersicherheit oder Biologie, sondern manchmal auch bei ganz normalen Anfragen wie einer Begrüßung oder einer Planung, und Anthropic räumt offiziell ein, dass es Fehlalarme geben kann.

Am Anfang der Meldung steht der Name des Modells, das gestoppt hat. Die Texte, die zwischen dem 22. und 29. September 2026 in Issues auf GitHub gemeldet wurden, waren vor allem die folgenden zwei (die Zeilenumbrüche entsprechen nicht genau dem Bildschirm).

API Error: Opus 5.5's safeguards flagged this message (https://www.anthropic.com/legal/aup). This sometimes happens with safe, normal conversations. Claude Code can't respond to this message with Opus 5.5.

Double press esc to edit your last message, or try a different model with /model.

Send feedback with /feedback or learn more: https://support.claude.com/en/articles/8106465

Details: `[reasoning_extraction]`
API Error: Opus 5.5's safeguards flagged this session (https://www.anthropic.com/legal/aup). You may be seeing this for the first time on an Opus model: Opus 5.5 is more capable and has stronger safeguards as a result, which can sometimes flag non-cybersecurity work. We're improving these safeguards to reduce the amount of incorrectly flagged messages. Claude Code can't respond to your last message with Opus 5.5.

Double press esc to edit your last message, or try a different model with /model.

Send feedback with /feedback or learn more: https://support.claude.com/en/articles/8106465

Details: `[cyber]`

In den Titeln der Issues steht oft „Message flagged by safeguards“, auf dem Bildschirm erscheint aber der Text oben. Der Teil Opus 5.5 ändert sich je nach verwendetem Modell, etwa zu Fable 5.1, Opus 5 oder Opus 4.8.

Zuerst die letzte Zeile „Details:“ lesen

Welcher Klassifikator gestoppt hat, entscheidet über die richtige Reaktion

[reasoning_extraction]
Eingestuft als Versuch, das interne Schlussfolgern des Modells herauszuziehen
→ Umformulieren und neu senden
Kein automatischer Wechsel zu einem anderen Modell
[cyber]
Eingestuft als Arbeit, die für Cyberangriffe nutzbar sein könnte
→ Mit dem Ausweichmodell weiterarbeiten
Beruflich: prüfen, ob CVP infrage kommt
[bio]
Eingestuft als mögliche gefährliche Anwendung in der Biologie
→ Verhalten je Modell ansehen
Für Forschungseinrichtungen gibt es ein Prüfverfahren
[general_harms] · [frontier_llm]
Eingestuft als anderer Bereich der Nutzungsrichtlinien oder als Entwicklung von Spitzen-KI
→ Bedeutung der Kategorien ansehen
Fehlalarm mit /feedback melden
Grafik auf Grundlage der Kategorien aus der offiziellen Dokumentation der Claude API „Refusals and fallback“ sowie der Erklärungen in der Dokumentation zur Modellkonfiguration von Claude Code und im Help Center.

1. Was die Meldung bedeutet: Ein Klassifikator hat das Gespräch gelesen und gestoppt

Laut der offiziellen Dokumentation der Claude API „Refusals and fallback“ haben Fable 5.1, Fable 5, Opus 5.5, Opus 5 und Sonnet 5.5 Sicherheits-Klassifikatoren, die Anfragen ablehnen können. Bei einer Ablehnung liefert die API keinen Fehler, sondern eine normale Antwort (HTTP 200), setzt den Stoppgrund auf stop_reason: "refusal" und trägt in stop_details.category ein, in welchem Bereich abgelehnt wurde. Claude Code empfängt das und zeigt es als Meldung an, die mit „API Error:“ beginnt.

Wichtig ist: Der Klassifikator betrachtet nicht nur den zuletzt gesendeten Satz. Der Artikel im Help Center zu den Schutzmaßnahmen von Opus 5.5 schreibt, dass der Klassifikator „alles, was das Modell liest“, betrachtet. Dazu gehören auch Erinnerungen (Memory), Inhalte aus Connectors, Ergebnisse der Websuche und Dateien, sodass Sie auch wegen Inhalten gestoppt werden können, die Sie gar nicht selbst getippt haben.

Ihre eigenen Anweisungen

Die zuletzt gesendete Nachricht und der gesamte vorherige Austausch.

Was Claude gelesen hat

Geöffnete Dateien, Ausgaben von Befehlen, Ergebnisse der Websuche, Inhalte aus MCP oder Connectors.

Von Anfang an mitgesendete Angaben

Angaben zum Arbeitsverzeichnis, die Claude Code der ersten Anfrage beifügt, etwa der Inhalt von CLAUDE.md oder git status.

Die Ausgabe des Modells selbst

Auch mitten in der Antwort kann gestoppt werden. Dann gilt auch der bis dahin gestreamte Teil als unvollständig.

Zum dritten Punkt schreibt die Dokumentation zur Modellkonfiguration von Claude Code ausdrücklich, dass der Klassifikator „bei der ersten Anfrage einer Sitzung reagieren kann, obwohl noch nichts Ungewöhnliches gesendet wurde“. Die erste Anfrage enthält den Inhalt von CLAUDE.md und git status, sodass in Repositorys mit Material zu Sicherheit oder Biologie schon diese Angaben den Klassifikator auslösen können. Der vierte Punkt entspricht der Aussage der API-Dokumentation, dass eine Ablehnung vor oder während der Ausgabe kommen kann und die bis dahin erzeugte Ausgabe in beiden Fällen als unvollständig zu verwerfen ist.

2. Der Wortlaut unterscheidet sich je nach Modell und Version

Auch wenn der Mechanismus derselbe ist, gibt es mehrere Wortlaute. Die offizielle Fehlerreferenz zeigt für den geltenden Wortlaut dieses Beispiel:

API Error: Opus 4.8's safeguards flagged this message. Our intentionally broad safeguards allow us to deliver more capabilities faster, but can sometimes flag legitimate cybersecurity work. Apply to the Cyber Verification Program to reduce these interruptions. Send feedback with /feedback or learn more: https://support.claude.com/en/articles/14604842-real-time-cyber-safeguards-on-claude

Die Fehlerreferenz schreibt weiter, dass die Meldung bei Opus 5.5 und Sonnet 5.5 mit <model>'s safeguards flagged this session beginnt. Die beiden Meldungen vom Anfang dieses Artikels stammen aus Issues ab dem 22. September 2026. In den Issues, die wir gelesen haben, stand bei der Meldung flagged this session [cyber] oder [bio], bei der Meldung This sometimes happens with safe, normal conversations überwiegend [reasoning_extraction].

Anfang des WortlautsWo bestätigtWie es weitergeht
<model>'s safeguards flagged this message. Our intentionally broad safeguards…Offizielle Fehlerreferenz (in Issues zusammen mit [cyber] gemeldet)Hinweis auf den Antrag beim CVP (bei einem Wechsel steht auch das Ausweichmodell dabei, etwa Switched to Opus 4.8.)
<model>'s safeguards flagged this sessionOffizielle Fehlerreferenz (Opus 5.5 und Sonnet 5.5) und Issues zu v2.1.280 bis 2.1.283Erklärung „Sie sehen das vielleicht zum ersten Mal bei einem Opus-Modell: Mehr Fähigkeiten bedeuten stärkere Schutzmaßnahmen“
<model>'s safeguards flagged this message (…aup). This sometimes happens…Issues zu v2.1.278 bis 2.1.284 (kein Beispiel in der offiziellen Referenz)Sagt, dass es „auch bei sicheren, normalen Gesprächen passieren kann“, und empfiehlt Bearbeiten mit Esc oder /model
<model> has safety measures that flagged this message for a cybersecurity topicOffizielle Fehlerreferenz (alter Wortlaut von v2.1.203 bis 2.1.218)Link zum Help Center (vor v2.1.203 ein Link zum Formular für Ausnahmeanträge)
<model> can't help with this. Start a new session to continue.Offizielle Fehlerreferenz (Usage Policy refusal)Ablehnung durch die Prüfung der Nutzungsrichtlinien (Usage Policy) (auf Amazon Bedrock, der Agent Platform von Google Cloud und Microsoft Foundry lautet auch eine Cyber-Einstufung so)

Die Fehlerreferenz schreibt, dass die Klassifikatoren selbst serverseitig laufen und schon vor v2.1.203 existierten; mit den späteren Updates von Claude Code hat sich nur der Wortlaut der Meldung geändert. Es ist also nicht so, dass ein Update von Claude Code die Stopps ausgelöst hätte.

Was sich mit v2.1.284 geändert hat

Das CHANGELOG von v2.1.284, veröffentlicht am 28. September 2026, enthält zwei Punkte zu dieser Meldung.

  • Die Benachrichtigung, wenn die Schutzmaßnahmen eines Sonnet-Modells auf eine Nachricht reagieren, erklärt jetzt, warum es passiert ist, und bietet an, die Nachricht zu bearbeiten und neu zu senden.
  • Der Modellwechsel durch Schutzmaßnahmen wurde für Sitzungen geändert, die ein Opus-Modell mit ANTHROPIC_DEFAULT_OPUS_MODEL oder modelOverrides festlegen. Auf der Anthropic API wählt nicht mehr das festgelegte Modell, sondern die API je nach Art der Einstufung das Ausweichmodell.

Der Wortlaut der neuen Benachrichtigung für Sonnet stand am 29. September weder in der offiziellen Fehlerreferenz noch in den Issues, die wir gelesen haben.

3. Die Kategorien in Details und ob das Modell wechselt

Das Wort nach Details: am Ende der Meldung entspricht dem Wert von stop_details.category, den die API liefert. Die API-Dokumentation führt fünf Kategorien auf. Beachten Sie, dass bei jeder Kategorie (außer reasoning_extraction) vermerkt ist, dass sie „auch bei harmloser Arbeit auslösen kann“.

DetailsOffizielle Beschreibung (sinngemäß)Verhalten in Claude Code
cyberKönnte für Cyberangriffe nutzbar sein, etwa die Entwicklung von Malware oder ExploitsFable 5.1, Fable 5, Opus 5.5 und Opus 5 wechseln zu Opus 4.8, Sonnet 5.5 zu Sonnet 5, und dieselbe Anfrage wird neu gesendet
bioKönnte zu biologischem Schaden führen, etwa Methoden für gefährliche ExperimenteFable 5.1, Fable 5 und Opus 5.5 wechseln zu Opus 5; Opus 5 und Sonnet 5.5 haben kein Ausweichmodell, die Anfrage endet mit einer Ablehnung
frontier_llmKönnte bei der Entwicklung konkurrierender KI-Modelle helfen (durch die kommerziellen Bedingungen eingeschränkt)Laut Help Center Wechsel von Opus 5.5 zu Opus 5 (Opus 5 wechselt bei dieser Kategorie nicht)
reasoning_extractionVersuch, das interne Schlussfolgern des Modells als Antworttext wiedergeben zu lassenKategorie „Destillation“ (distillation) im Help Center: kein Wechsel zu einem anderen Modell, der Vorgang stoppt sofort
general_harmsFällt in einen anderen Bereich der Nutzungsrichtlinien als die vier obenDie Dokumentation von Claude Code nennt kein Ausweichmodell

Quellen: Kategorientabelle in „Refusals and fallback“ der Claude API, Automatic model fallback in „Model configuration“ von Claude Code, Help Center „Why Claude switched models in your conversation with Opus 5 or Opus 5.5“ (alle am 29. September 2026 geprüft).

Wenn das Modell gewechselt wird

Wird in einer Kategorie mit Ausweichmodell gestoppt, sendet Claude Code dieselbe Anfrage standardmäßig automatisch mit dem Ausweichmodell neu und zeigt im Gespräch eine Benachrichtigung an. Die Sitzung läuft danach mit dem Ausweichmodell weiter. Zum ursprünglichen Modell kehren Sie zurück, indem Sie es mit /model erneut wählen.

Das Help Center warnt allerdings: Auch nach der Rückkehr zum ursprünglichen Modell kann dieselbe Schutzmaßnahme erneut einen Wechsel auslösen, solange die gestoppte Anfrage im Gespräch steht; die vorherige Nachricht vor dem erneuten Senden zu bearbeiten, hilft oft. Typische Fälle, in denen kein Wechsel hilft und die Meldung vom Anfang stehen bleibt: wenn in einer Kategorie ohne Ausweichmodell wie reasoning_extraction gestoppt wurde, wenn auch das Ausweichmodell stoppt, wenn das Ausweichmodell in availableModels nicht erlaubt ist, und wenn in einem nicht interaktiven Modus wie -p die Einstellung „vor dem Wechsel nachfragen“ aktiv ist.

4. Liegt es an meiner Arbeit? Was Anthropic offiziell zu Fehlalarmen schreibt

Wenn Sie das Gefühl haben, gestoppt worden zu sein, obwohl Sie nichts Falsches getan haben, ist das gut möglich. Die offiziellen Dokumente räumen an mehreren Stellen ausdrücklich ein, dass es Fehlalarme gibt.

✅ Was in den offiziellen Dokumenten steht

  • Wortlaut der Meldung: „This sometimes happens with safe, normal conversations“ (passiert manchmal auch bei sicheren, normalen Gesprächen), „intentionally broad safeguards“ (absichtlich weit gefasste Schutzmaßnahmen)
  • API-Dokumentation: Bei cyber, bio, frontier_llm und general_harms ist jeweils vermerkt, dass sie „auch bei harmloser Arbeit auslösen können“
  • Dokumentation von Claude Code: Bei offensiver Sicherheitsarbeit oder Biologie kommt es oft schon ab der ersten Anfrage zum Wechsel. „In diesen Bereichen ist das erwartete Routing, keine Markierung des Kontos (account flag)“
  • Help Center: Die Klassifikatoren werden angepasst, um Fehlalarme zu verringern, und verschiedene Signale zur Vertrauenswürdigkeit eines Kontos sollen einbezogen werden
  • Erklärung zum CVP: Auch bei zugelassenen Nutzern kann legitime Arbeit gestoppt werden

Andererseits schreibt der Artikel im Help Center, auf den die Meldung verlinkt (Our Approach to User Safety), dass Nutzern, die wiederholt gegen die Richtlinien verstoßen, vorübergehend Sicherheitsfilter mit empfindlicherer Erkennung zugeschaltet werden können. Ob Stopps durch Fehlalarme dabei mitgezählt werden, steht nirgends offiziell. Nach einem Stopp ist es sicherer, das Gespräch mit den Schritten aus Abschnitt 6 zu wechseln, statt dieselbe Anfrage immer wieder nur anders formuliert zu senden.

Vorgehen bei einem Stopp durch reasoning_extraction

Als Beispiele, die diese Kategorie stoppt, nennt das Help Center Anfragen, „das Schlussfolgern Wort für Wort zu wiederholen“ oder „den gesamten Denkprozess (chain of thought) in eine externe Ausgabe zu schreiben“. Dagegen sei es möglich, „das Schlussfolgern erklären“, „Konzepte beibringen“ oder „ein Code-Review Schritt für Schritt erläutern“ zu lassen, und Gesprächsfragen wie „Warum hast du das gemacht?“ seien nicht betroffen.

In den Issues finden sich Fälle, in denen direkt nach Anfragen wie den folgenden gestoppt wurde. Alle sind Berichte von Nutzern, und Anthropic hat nicht erklärt, warum ausgelöst wurde.

  • Die Frage, ob sich auf dem Bildschirm statt der Tool-Aufrufe das „Denken“ anzeigen lässt (#96118)
  • Ein Subagent sollte die Zeile mit dem Namen des Modells, auf dem er läuft, aus dem Kontext zitieren (#96139)
  • Am Ende einer langen Arbeit sollte eine Zusammenfassung der Sitzung in eine Datei geschrieben werden (#96874)
  • In ein Designdiagramm sollten zu jeder Entscheidung „die erwogenen Optionen und die Gründe für ihre Ablehnung“ eingetragen werden (#98108)

Gemeinsam ist ihnen, dass der „Denkprozess“ oder der „eigene Kontext“ unverändert ausgeschrieben werden soll. Brauchen Sie so etwas als Ergebnis, bringen Sie die Anfrage mit einer Formulierung, die das Ergebnis kurz zusammenfassen lässt, etwa „das Fazit und die Gründe für die Wahl in drei Zeilen“, näher an das, was die offizielle Seite als „das Schlussfolgern erklären lassen“ nennt. Wie ein Nachtrag zu #96118 zeigt, wurde aber auch schon eine kurze Frage auf Deutsch gestoppt; Umformulieren hilft also nicht in jedem Fall.

5. Gemeldete Fälle seit dem 22. September

Seit der Veröffentlichung von Opus 5.5 am 22. September 2026 häufen sich solche Meldungen in den Issues von anthropics/claude-code. Bei unserer Zählung über die Suche von GitHub am 29. September gab es 67 Issues, die zwischen dem 22. und 28. September erstellt wurden und „safeguards“ im Titel oder Text enthalten (7 bis 12 pro Tag; die Zahl hängt von den Suchbegriffen ab). In den Issues ab dem 22. September, die wir gelesen haben, fanden wir keine Antwort von Anthropic-Mitarbeitern, und auffällig viele trugen das Label „duplicate“.

🟡 Auf GitHub gemeldete Fälle ohne geklärte Ursache (geprüft am 29. September 2026)

  • Gestoppt bei einer bloßen Begrüßung: Auf „hi“ als [cyber] eingestuft und zu Opus 4.8 gewechselt (#96298), gestoppt bei „ola“ (#96495), [reasoning_extraction] bei „hi“ (#97560). Die meldende Person von #96495 vermutet, dass die Nutzung von Kali Linux als root eine Rolle gespielt haben könnte.
  • Gestoppt bei /compact: Während der Komprimierung des Gesprächs erschien die Meldung mit [reasoning_extraction] (#96648, v2.1.281).
  • Nach einem Stopp ist das ganze Gespräch unbrauchbar: Alle weiteren Nachrichten derselben Sitzung wurden gestoppt (#96874); die gestoppte Formulierung blieb im Gesprächsprotokoll, und auch spätere Sitzungen, die es lasen, wurden gestoppt (#97452).
  • Subagenten werden gestoppt: Laut Auswertung auf einem einzelnen Rechner wurden von 866 Subagenten mit Opus 5 14 (1,62 %) mit [reasoning_extraction] gestoppt, alle bei Review-Aufgaben (#97492).
  • Auch mit CVP-Zulassung gestoppt: Trotz Zulassung mit Opus 5.5 als [cyber] eingestuft (#96090, #96298, #96592, #97946). Das passt, wie in Abschnitt 7 beschrieben, zur offiziellen Erklärung.
  • Gestoppt bei Arbeit an eigenen Geräten oder eigenem Code: Untersuchung eines „Permission denied“ beim eigenen SSH (#97373), Disassemblieren einer Binärdatei des eigenen Produkts (#97891), Entfernen fest im Quellcode hinterlegter Zugangsdaten (#97605).

Die Stopps bei einer bloßen Begrüßung lassen sich möglicherweise mit der offiziellen Erklärung aus Abschnitt 1 erklären, dass der Klassifikator das ganze Gespräch und die Angaben zum Arbeitsverzeichnis betrachtet: Auch wenn die letzte Nachricht harmlos war, könnte er auf CLAUDE.md, den bisherigen Austausch oder gelesene Dateien reagiert haben. Keiner der Berichte zeigt aber, worauf reagiert wurde, und es gibt keine öffentliche Möglichkeit, das zu prüfen.

6. Was tun, wenn gestoppt wurde

Die Maßnahmen aus der offiziellen Fehlerreferenz und der Dokumentation zur Modellkonfiguration stehen hier nach Aufwand geordnet, vom geringsten an. Bei einem einmaligen Stopp reicht meist Schritt 3.

01

Details lesen und prüfen, ob gewechselt wurde

Steht Switched to oder eine Benachrichtigung über den Wechsel da, läuft die Arbeit bereits mit einem anderen Modell weiter. Bleibt es beim Stopp, gleichen Sie die Kategorie unter Details: mit der Tabelle in Abschnitt 3 ab.

02

Laufende Dateioperationen prüfen

Wurde mitten in der Antwort gestoppt, ist die bisherige Ausgabe unvollständig. Prüfen Sie zuerst mit git status und git diff, ob halb geschriebene Änderungen zurückgeblieben sind (Abschnitt 8).

03

Zweimal Esc drücken, zurückgehen und anders formuliert senden

Drücken Sie bei leerem Eingabefeld zweimal Esc oder führen Sie /rewind aus, dann öffnet sich das Menü zum Zurückspulen. Wählen Sie einen Punkt vor dem gestoppten Zug und senden Sie die Anfrage mit anderer Formulierung oder anderem Vorgehen neu. Diese Maßnahme nennt Anthropic als erste für diese Meldung.

04

Ist unklar, welcher Zug die Ursache war, ein neues Gespräch beginnen

Mit /clear beginnen Sie im selben Projekt ein neues Gespräch. Das alte Gespräch bleibt erhalten und lässt sich über /resume öffnen. Wenn Sie es aber mit --continue oder --resume fortsetzen, kommt auch der gestoppte Inhalt mit zurück, und es wird leicht wieder gestoppt.

05

Mit /model zu einem anderen Modell wechseln

Die Meldung selbst empfiehlt „try a different model with /model“. Die Modelle haben unterschiedliche Klassifikatoren. So schreibt etwa die Ankündigung von Sonnet 5.5, dass es das erste Sonnet ist, das mit einem Klassifikator gegen das Herausziehen des Schlussfolgerns erscheint; die Vorgängergeneration Sonnet 5 hat diesen Klassifikator nicht.

06

Eingrenzen, ob CLAUDE.md oder Ähnliches die Ursache ist

Wird schon die erste Nachricht gestoppt, starten Sie mit claude --safe-mode. Dann werden CLAUDE.md, Skills, MCP-Server und Hooks nicht geladen; wird so nicht gestoppt, steckt der auslösende Inhalt in dem, was sonst geladen wird. git status und der Verzeichnisname werden auch in diesem Modus gesendet.

07

Fehlalarme mit /feedback melden

Anthropic empfiehlt: Wenn es nicht um ein Cybersicherheitsthema ging, melden Sie den Fehlalarm mit /feedback. Die Request ID und Message ID aus der Meldung helfen dabei. Das Gesprächsprotokoll enthält Code aus Ihrer Arbeit und Dateipfade; posten Sie an öffentlichen Orten wie GitHub also nur die nötigen Zeilen.

Wenn Sie nicht automatisch wechseln, sondern jedes Mal selbst wählen wollen

Wenn Sie finden, dass die Qualität der Arbeit mit dem Ausweichmodell nachlässt, schalten Sie unter /config „Switch models when a message is flagged“ aus oder tragen Folgendes in die Einstellungsdatei ein. Dann pausiert die Sitzung bei jedem Stopp, und Sie können wählen, ob Sie „zum Ausweichmodell wechseln“ oder „den Prompt bearbeiten und mit dem bisherigen Modell neu senden“ wollen.

{
  "switchModelsOnFlag": false
}

In Kategorien ohne Ausweichmodell (etwa bio bei Sonnet 5.5 oder Opus 5) erscheint allerdings keine Auswahl, und die Anfrage endet mit einer Ablehnung. Auch im nicht interaktiven Modus -p und in SDK-Integrationen, die keine Rückfrage anzeigen können, endet der gestoppte Zug mit einer Ablehnung. In Cloud-Sitzungen aus der Smartphone-App steht „bearbeiten und neu senden“ nicht zur Verfügung.

Wenn /compact gestoppt wird

Auch die Komprimierung des Gesprächs lässt das Modell das ganze Gespräch lesen und kann deshalb gestoppt werden (#96648). Im CHANGELOG von v2.1.282 steht, dass ein Fehler behoben wurde, durch den die Komprimierung fehlschlug, wenn die Zusammenfassungsanfrage abgelehnt wurde, und dass nun mit dem Ausweichmodell erneut versucht wird. Ist claude --version älter als 2.1.282, aktualisieren Sie zuerst mit claude update. Wann sich die Komprimierung lohnt, beschreibt der Artikel zum richtigen Zeitpunkt für /compact.

7. Hilft das Cyber Verification Program (CVP)?

Das CVP ist ein kostenloses Antragsverfahren für Personen, die Cybersicherheitsarbeit zu legitimen Verteidigungszwecken leisten, damit sie seltener von Schutzmaßnahmen gestoppt werden. Der Artikel zum CVP im Help Center teilt die gestoppte Arbeit in zwei Gruppen.

Verbotene Nutzung (Prohibited use)

Arbeit, die fast nur missbräuchlich genutzt wird, etwa das Abziehen großer Datenmengen oder die Entwicklung von Ransomware. Wird auch mit CVP-Zulassung gestoppt.

Doppelte Verwendbarkeit mit hohem Risiko (High Risk Dual use)

Arbeit, die auch der Verteidigung dient, etwa das Ausnutzen von Schwachstellen oder die Entwicklung von Angriffswerkzeugen. Standardmäßig gestoppt, eine Lockerung lässt sich über das CVP beantragen.

Entscheidend ist: Stand 29. September 2026 gilt das CVP nicht für Opus 5.5 und Sonnet 5.5. Der CVP-Artikel schreibt gleich zu Beginn: „Dieser Artikel gilt für Opus- und Sonnet-Modelle, aber nicht für Opus 5.5 und Sonnet 5.5. Wir werden ihn bald auf Opus 5.5, Sonnet 5.5 und Modelle der Mythos-Klasse ausweiten.“ Auch die Ankündigungen von Opus 5.5 und Sonnet 5.5 sprechen von einer Ausweitung des CVP „bald“. Die in Abschnitt 5 genannten Berichte „trotz CVP-Zulassung mit Opus 5.5 gestoppt“ stimmen mit dieser Erklärung überein.

Der Artikel im Help Center zu Opus 5.5 enthält einen weiteren Hinweis: „Organisationen, die Opus 4.8 bereits über das CVP nutzen, können sofort Opus 5 mit weniger Cyber-Einschränkungen verwenden.“ Werden Sie trotz Zulassung von Opus 5.5 gestoppt, ist es vorerst die Umgehung im Sinne der offiziellen Erklärung, mit /model Opus 5 oder Opus 4.8 zu wählen.

Zu prüfenErklärung im Help Center
Wer einen Antrag stellen kannAntrag über das Verification Portal (Claude.ai, Claude Code, Anthropic API) / die Antragsseite sehen nur berechtigte Administratoren / Identitätsprüfung erforderlich / Ziel ist eine Benachrichtigung über das Ergebnis per E-Mail innerhalb von 2 Werktagen
Nicht unterstützte UmgebungenOrganisationen mit Zero Data Retention (ZDR) sind bislang ausgeschlossen / auf Amazon Bedrock nicht angeboten
Wenn nach der Zulassung weiter gestoppt wirdDie Zulassung ist an eine bestimmte Organisations-ID gebunden; vergleichen Sie mit der Organisations-ID aus der Zulassungs-E-Mail, ob Sie in einer anderen Organisation arbeiten, etwa einem persönlichen Workspace / verbotene Nutzung wird auch nach der Zulassung gestoppt
Wenn es trotzdem nicht stimmtÜber das Formular im Artikel lassen sich Fehlalarme melden oder Widerspruch gegen eine Ablehnung einlegen

Für Organisationen, die bei biologischer Forschung von [bio] gestoppt werden, gibt es ein eigenes Prüfverfahren, das Life Sciences Verification Program (LSVP). Die Ankündigung von Opus 5.5 schreibt, dass geprüfte Organisationen Opus 5.5 für ihre Forschung nutzen können.

8. Abrechnung gestoppter Anfragen und halb erledigte Arbeit

Die Abrechnung hängt von Kategorie und Zeitpunkt des Stopps ab

Laut API-Dokumentation und Help Center werden gestoppte Anfragen wie folgt abgerechnet. In jedem Fall zählen sie zu den Rate Limits (Nutzungsgrenzen).

Stopp vor der Ausgabe: wird berechnet

bio, frontier_llm, reasoning_extraction. Offizielle Begründung: Diese Kategorien haben wenige Fehlalarme (Stand September 2026).

Stopp vor der Ausgabe: wird nicht berechnet

cyber, general_harms oder keine Kategorie (null).

Stopp mitten in der Antwort

Die Eingabe und die bis zum Stopp gestreamte Ausgabe werden zum normalen Tarif berechnet.

Antwort des Ausweichmodells

Wird separat zum Tarif des Ausweichmodells berechnet. Der Verlust des Caches wird mit Guthaben ausgeglichen.

Mit einem Abonnement wirkt sich das darauf aus, wie schnell die Nutzungsgrenze schrumpft. Die meldende Person von #97335 schreibt, dass der von einer gestoppten Anfrage geschriebene Prompt-Cache bei der nächsten Anfrage nicht verwendet wurde, sodass in einem langen Gespräch mit rund 700.000 Tokens bei jedem Stopp das ganze Gespräch neu geschrieben wurde. Beobachtet wurde, dass das 5-Stunden-Kontingent des Pro-Tarifs nach 4 Ablehnungen aufgebraucht war. Das ist ein offiziell nicht bestätigter Bericht, doch wenn ein langes Gespräch immer wieder gestoppt wird, ist der Verlust auch beim Kontingent kleiner, wenn Sie mit /clear wechseln, statt im selben Gespräch weiterzumachen.

Halb ausgeführte Dateioperationen können zurückbleiben

Die API-Dokumentation verlangt, die Ausgabe einer mittendrin gestoppten Antwort „als unvollständig zu verwerfen“. Auch der Hinweis, den Claude Code nach einem Stopp ans Gespräch anhängt, lautet laut dem in #97335 eingefügten Text, dass nicht abgeschlossene Tool-Aufrufe nicht ausgeführt wurden.

#97311 berichtet jedoch von 4 Fällen, in denen mitten im Schreiben einer Dateibearbeitung (Edit), eines Dateischreibvorgangs (Write) oder eines Bash-Aufrufs gestoppt und der abgeschnittene Inhalt trotzdem ausgeführt wurde (v2.1.219 bis 2.1.280, ein einzelner Linux-Rechner). Bei Edit und Write wurde „erfolgreich“ angezeigt, doch die geschriebene Datei oder die geänderten Zeilen waren abgeschnitten. Eine offizielle Antwort gibt es noch nicht; sicher ist es, direkt nach einem Stopp wie in Schritt 2 aus Abschnitt 6 die Änderungen mit git diff zu prüfen, bevor Sie weitermachen.

# Geänderte Dateien auflisten
git status

# Inhalt ansehen: Gibt es abgeschnittene Änderungen?
git diff

# Eine Datei auf den Stand des letzten Commits zurücksetzen (erst nach Prüfung)
git restore path/to/file

Änderungen, die mit den Dateibearbeitungs-Tools von Claude Code gemacht wurden, lassen sich auch mit dem Zurückspulen zu Checkpoints rückgängig machen. Dateien, die über Bash geändert wurden, erfasst das Zurückspulen allerdings nicht.

9. Was feststeht und was nicht

✅ Offiziell bestätigt

  • Die Klassifikatoren laufen serverseitig; mit den Updates von Claude Code hat sich nur der Wortlaut geändert
  • Betrachtet wird nicht nur der letzte Satz, sondern alles Gelesene: Gespräch, Dateien, CLAUDE.md und mehr
  • Auch sichere, normale Gespräche können gestoppt werden
  • reasoning_extraction wechselt nicht zu einem anderen Modell
  • Das CVP gilt Stand 29. September nicht für Opus 5.5 und Sonnet 5.5
  • Seit v2.1.282 wird bei einer Ablehnung von /compact mit dem Ausweichmodell erneut versucht

🟡 Gemeldet, aber nicht geklärt

  • Stopp schon bei „hi“ oder „ola“ (#96298, #96495, #97560)
  • Nach einem Stopp werden auch Sitzungen, die das Gespräch lesen, immer wieder gestoppt (#96874, #97452)
  • Abgeschnittene Dateioperationen werden ausgeführt (#97311)
  • Der Cache gestoppter Anfragen wird nicht wiederverwendet (#97335)

🔴 Nicht veröffentlicht

  • Worauf bei einer einzelnen Meldung reagiert wurde
  • Ob Stopps durch Fehlalarme sich auf die Behandlung des Kontos auswirken
  • Das Datum, ab dem das CVP auf Opus 5.5 und Sonnet 5.5 ausgeweitet wird
  • Der Wortlaut der mit v2.1.284 geänderten Benachrichtigung für Sonnet

10. Fazit

„safeguards flagged this message“ bedeutet, dass der Sicherheits-Klassifikator eines Modells auf den Inhalt des Gesprächs reagiert und die Antwort mit diesem Modell gestoppt hat. Der Klassifikator läuft serverseitig und betrachtet nicht nur die letzte Nachricht, sondern das ganze Gespräch, gelesene Dateien und sogar CLAUDE.md. Dass auch normale Gespräche gestoppt werden können, räumen sowohl die Meldung selbst als auch die offiziellen Dokumente ein.

Wurde gestoppt, lesen Sie zuerst die Kategorie unter Details:, und wenn gerade eine Dateioperation lief, prüfen Sie mit git diff. Probieren Sie dann in dieser Reihenfolge: mit zweimal Esc zurückgehen und umformulieren, mit /clear ein neues Gespräch beginnen, mit /model das Modell wechseln. Stoppt [cyber] Ihre berufliche Arbeit, ist das CVP eine Option, doch Stand 29. September sind Opus 5.5 und Sonnet 5.5 noch ausgenommen. Einen Überblick über die Schutzmaßnahmen auf Modellseite gibt die Analyse zu Opus 5.5, andere Meldungen der Art „vom Filter gestoppt“ behandelt der Artikel zu The model returned no content, und weitere Fehler fasst die Übersicht häufiger Fehler in Claude Code und ihrer Lösungen zusammen.

FAQ

F. Was bedeutet „safeguards flagged this message“?
A. Dass der Sicherheits-Klassifikator des verwendeten Modells (etwa Opus 5.5 oder Fable 5.1) auf den Inhalt des Gesprächs reagiert und die Antwort gestoppt hat. Es ist weder ein Defekt von Claude Code noch ein Verbindungsfehler. In der letzten Zeile unter Details: steht der Name der Kategorie, die ausgelöst hat.

F. Ich habe nur „hi“ gesendet und wurde gestoppt. Was habe ich falsch gemacht?
A. Die Ursache muss nicht Ihre letzte Nachricht sein. Der Klassifikator betrachtet das ganze Gespräch, gelesene Dateien und sogar CLAUDE.md und git status. Wird nach einem Start mit claude --safe-mode nicht mehr gestoppt, hat er möglicherweise auf den Inhalt geladener Einstellungen oder Dateien reagiert. Halten Sie es für einen Fehlalarm, melden Sie es mit /feedback.

F. Kann mein Konto gesperrt werden?
A. Die Dokumentation von Claude Code schreibt, dass ein Modellwechsel bei Sicherheits- oder Biologiearbeit erwartetes Routing und keine Markierung des Kontos ist. Andererseits gibt es einen Artikel im Help Center, nach dem Nutzern, die wiederholt gegen die Richtlinien verstoßen, vorübergehend strengere Filter zugeschaltet werden können; ob Fehlalarme dabei mitzählen, ist nicht veröffentlicht.

F. Warum werde ich trotz CVP-Zulassung gestoppt?
A. Weil das CVP Stand 29. September 2026 nicht für Opus 5.5 und Sonnet 5.5 gilt. Anthropic will es bald ausweiten. Laut offizieller Aussage können Organisationen, die Opus 4.8 bereits über das CVP nutzen, Opus 5 mit weniger Cyber-Einschränkungen verwenden; vorerst hilft es also, mit /model Opus 5 oder Opus 4.8 zu wählen. Prüfen Sie auch, ob die an die Zulassung gebundene Organisations-ID mit der Organisation übereinstimmt, in der Sie arbeiten.

F. Im selben Gespräch wird jede Nachricht gestoppt. Was kann ich tun?
A. Solange der gestoppte Inhalt im Gespräch steht, führt fast alles, was Sie senden, zur selben Einstufung. Gehen Sie mit zweimal Esc zu einem Zug vor dem Stopp zurück oder beginnen Sie mit /clear ein neues Gespräch. Das alte Gespräch lässt sich mit /resume öffnen, doch beim Fortsetzen kommt auch der gestoppte Inhalt mit zurück.

Verwendete Primärquellen