"safeguards flagged this message" का मतलब है कि Claude मॉडल से जुड़े एक सुरक्षा classifier ने आपकी बातचीत की सामग्री पर प्रतिक्रिया दी और उस मॉडल को जवाब देने से रोक दिया। यह Claude Code का बग नहीं है, और न ही नेटवर्क की गड़बड़ी। यह सिर्फ़ साइबर सुरक्षा या जीव विज्ञान से जुड़े काम में ही नहीं, बल्कि अभिवादन या योजना बनाने जैसे सामान्य अनुरोधों पर भी दिख सकता है, और Anthropic खुद मानता है कि गलत पहचान (false positive) हो सकती है।

संदेश की शुरुआत उस मॉडल के नाम से होती है जिसे रोका गया। 22 से 29 सितंबर 2026 के बीच GitHub Issues में दर्ज रिपोर्टों में स्क्रीन पर दिखी इबारत मुख्य रूप से नीचे की दो में से एक थी (लाइन ब्रेक स्क्रीन जैसे बिल्कुल नहीं हैं)।

API Error: Opus 5.5's safeguards flagged this message (https://www.anthropic.com/legal/aup). This sometimes happens with safe, normal conversations. Claude Code can't respond to this message with Opus 5.5.

Double press esc to edit your last message, or try a different model with /model.

Send feedback with /feedback or learn more: https://support.claude.com/en/articles/8106465

Details: `[reasoning_extraction]`
API Error: Opus 5.5's safeguards flagged this session (https://www.anthropic.com/legal/aup). You may be seeing this for the first time on an Opus model: Opus 5.5 is more capable and has stronger safeguards as a result, which can sometimes flag non-cybersecurity work. We're improving these safeguards to reduce the amount of incorrectly flagged messages. Claude Code can't respond to your last message with Opus 5.5.

Double press esc to edit your last message, or try a different model with /model.

Send feedback with /feedback or learn more: https://support.claude.com/en/articles/8106465

Details: `[cyber]`

Issue के शीर्षकों में अक्सर "Message flagged by safeguards" लिखा होता है, लेकिन स्क्रीन पर असल में ऊपर वाली इबारत दिखती है। Opus 5.5 वाला हिस्सा आपके इस्तेमाल किए जा रहे मॉडल के हिसाब से Fable 5.1, Opus 5, Opus 4.8 वगैरह में बदल जाता है।

सबसे पहले आखिरी पंक्ति "Details:" देखें

क्या काम करेगा, यह इस पर निर्भर है कि किस classifier ने रोका

[reasoning_extraction]
माना गया कि मॉडल की अंदरूनी तर्क-प्रक्रिया निकलवाने की कोशिश है
→ शब्द बदलकर दोबारा भेजें
दूसरे मॉडल पर अपने-आप स्विच नहीं होता
[cyber]
माना गया कि यह काम साइबर हमले में इस्तेमाल हो सकता है
→ fallback मॉडल पर काम जारी रखें
पेशेवर काम के लिए देखें कि CVP लागू होता है या नहीं
[bio]
माना गया कि इसमें जीव विज्ञान का खतरनाक इस्तेमाल शामिल हो सकता है
→ देखें कि हर मॉडल इसे कैसे संभालता है
शोध संस्थाओं के लिए एक जाँच कार्यक्रम मौजूद है
[general_harms] / [frontier_llm]
माना गया कि यह उपयोग नीति के दूसरे क्षेत्रों या अग्रणी AI के विकास के दायरे में आता है
→ श्रेणियों का मतलब देखें
गलत पहचान हो, तो /feedback से रिपोर्ट करें
Claude API के आधिकारिक दस्तावेज़ "Refusals and fallback" की श्रेणियों, और Claude Code के मॉडल कॉन्फ़िगरेशन दस्तावेज़ व Help Center के विवरणों के आधार पर।

1. संदेश का मतलब—बातचीत पढ़ने वाले classifier ने रोका

Claude API के आधिकारिक दस्तावेज़ "Refusals and fallback" के मुताबिक Fable 5.1, Fable 5, Opus 5.5, Opus 5 और Sonnet 5.5 के साथ ऐसे सुरक्षा classifier आते हैं जो अनुरोध ठुकरा सकते हैं। जब कोई ठुकराता है, तो API एरर नहीं लौटाता, बल्कि सामान्य जवाब (HTTP 200) लौटाता है, जिसमें रुकने का कारण stop_reason: "refusal" होता है और इनकार का क्षेत्र stop_details.category में होता है। Claude Code इसे पाकर "API Error:" से शुरू होने वाले संदेश के रूप में दिखाता है।

अहम बात यह है कि classifier सिर्फ़ आपका भेजा आखिरी वाक्य नहीं देखता। Opus 5.5 के safeguards समझाने वाले Help Center लेख में लिखा है कि classifier वह सब देखते हैं जो मॉडल पढ़ता है। इसमें मेमोरी, connector की सामग्री, वेब सर्च के नतीजे और फ़ाइलें शामिल हैं, इसलिए ऐसी सामग्री से भी आप रुक सकते हैं जो आपने खुद कभी टाइप नहीं की।

आपके निर्देश

आपका भेजा आखिरी संदेश, और उससे पहले की पूरी बातचीत।

जो Claude ने पढ़ा

खोली गई फ़ाइलें, कमांड का आउटपुट, वेब सर्च के नतीजे, और MCP या connector से आई सामग्री।

शुरू से जुड़ा संदर्भ

वर्कस्पेस की वह जानकारी जो Claude Code पहले अनुरोध में जोड़ता है, जैसे CLAUDE.md की सामग्री और git status।

मॉडल का अपना आउटपुट

यह जवाब के बीच में भी रुक सकता है। तब तक जो कुछ स्ट्रीम हुआ था, उसे भी अधूरा माना जाता है।

तीसरे बिंदु पर, Claude Code का मॉडल कॉन्फ़िगरेशन दस्तावेज़ साफ़ कहता है कि classifier सेशन के पहले ही अनुरोध पर, आपके कुछ भी असामान्य भेजने से पहले, सक्रिय हो सकता है। क्योंकि पहले अनुरोध में CLAUDE.md की सामग्री और git status शामिल होते हैं, इसलिए सुरक्षा या जीव विज्ञान की सामग्री वाली repository सिर्फ़ उसी जानकारी से classifier को सक्रिय कर सकती है—यही वहाँ का स्पष्टीकरण है। चौथा बिंदु API दस्तावेज़ की उस बात से मेल खाता है कि इनकार आउटपुट से पहले या उसके बीच में आ सकता है, और दोनों ही हालात में आंशिक आउटपुट को अधूरा मानकर छोड़ देना चाहिए।

2. इबारत मॉडल और वर्ज़न के हिसाब से बदलती है

एक ही व्यवस्था कई अलग-अलग इबारतें पैदा करती है। आधिकारिक एरर रेफ़रेंस में दिया गया मौजूदा उदाहरण ऐसा दिखता है।

API Error: Opus 4.8's safeguards flagged this message. Our intentionally broad safeguards allow us to deliver more capabilities faster, but can sometimes flag legitimate cybersecurity work. Apply to the Cyber Verification Program to reduce these interruptions. Send feedback with /feedback or learn more: https://support.claude.com/en/articles/14604842-real-time-cyber-safeguards-on-claude

एरर रेफ़रेंस आगे कहता है कि Opus 5.5 और Sonnet 5.5 पर संदेश <model>'s safeguards flagged this session से शुरू होता है। इस लेख की शुरुआत में दिए गए दोनों संदेश 22 सितंबर 2026 या उसके बाद दर्ज Issues में चिपकाए गए थे। हमने जितने पढ़े, उनमें flagged this session वाला संदेश [cyber] या [bio] के साथ आया, जबकि This sometimes happens with safe, normal conversations वाला संदेश ज़्यादातर [reasoning_extraction] के साथ आया।

संदेश की शुरुआतकहाँ पुष्टि हुईआगे क्या लिखा होता है
<model>'s safeguards flagged this message. Our intentionally broad safeguards…आधिकारिक एरर रेफ़रेंस (Issues में [cyber] के साथ रिपोर्ट)CVP के लिए आवेदन का संकेत (स्विच होने पर fallback मॉडल का नाम भी, जैसे Switched to Opus 4.8.)
<model>'s safeguards flagged this sessionआधिकारिक एरर रेफ़रेंस (Opus 5.5 और Sonnet 5.5), और v2.1.280–2.1.283 वाले Issuesयह स्पष्टीकरण कि Opus मॉडल पर शायद आप इसे पहली बार देख रहे हैं, क्योंकि वह ज़्यादा सक्षम है और इसलिए उसके safeguards भी ज़्यादा मज़बूत हैं
<model>'s safeguards flagged this message (…aup). This sometimes happens…v2.1.278–2.1.284 वाले Issues (आधिकारिक रेफ़रेंस में उदाहरण नहीं)कहता है कि यह "sometimes happens with safe, normal conversations", और Esc से बदलने या /model इस्तेमाल करने का सुझाव देता है
<model> has safety measures that flagged this message for a cybersecurity topicआधिकारिक एरर रेफ़रेंस (पुरानी इबारत, v2.1.203–2.1.218)Help Center का लिंक (v2.1.203 से पहले, छूट के अनुरोध वाले फ़ॉर्म का लिंक)
<model> can't help with this. Start a new session to continue.आधिकारिक एरर रेफ़रेंस (Usage Policy refusal)Usage Policy जाँच से आया इनकार (Amazon Bedrock, Google Cloud के Agent Platform और Microsoft Foundry पर cyber flag भी यही इबारत इस्तेमाल करते हैं)

एरर रेफ़रेंस कहता है कि classifier खुद सर्वर की ओर चलते हैं और v2.1.203 से पहले भी मौजूद थे; Claude Code के बाद के अपडेट ने सिर्फ़ संदेश की इबारत बदली। ऐसा नहीं है कि Claude Code अपडेट करने से आप रुकने लगे।

v2.1.284 में क्या बदला

28 सितंबर 2026 को जारी v2.1.284 के CHANGELOG में इस संदेश से जुड़ी दो प्रविष्टियाँ हैं।

  • Sonnet मॉडल के safeguards जब किसी संदेश को flag करते हैं, तब दिखने वाली सूचना बदली गई, ताकि वह बताए कि ऐसा क्यों हुआ और बदलकर दोबारा भेजने का विकल्प दे।
  • जिन सेशन में ANTHROPIC_DEFAULT_OPUS_MODEL या modelOverrides से कोई Opus मॉडल तय (pin) किया गया है, उनके लिए safeguard से होने वाला मॉडल स्विच बदला गया। Anthropic API पर अब pin किए गए मॉडल के बजाय API हर तरह के flag के लिए fallback मॉडल खुद चुनता है।

29 सितंबर तक Sonnet की नई सूचना की इबारत आधिकारिक एरर रेफ़रेंस में नहीं थी, और हमने जितने Issues पढ़े, उनमें से किसी में भी वह चिपकाई नहीं गई थी।

3. Details की श्रेणियाँ, और मॉडल स्विच होता है या नहीं

संदेश के आखिर में Details: वाला शब्द API से लौटाए गए stop_details.category के मान से मेल खाता है। API दस्तावेज़ में पाँच श्रेणियाँ हैं। ध्यान दें कि reasoning_extraction को छोड़कर हर श्रेणी के साथ यह टिप्पणी है कि वह हानिरहित काम पर भी सक्रिय हो सकती है।

Detailsआधिकारिक विवरण (सार)Claude Code इसे कैसे संभालता है
cyberसाइबर हमलों में इस्तेमाल हो सकता है, जैसे malware या exploit बनानाFable 5.1, Fable 5, Opus 5.5 और Opus 5, Opus 4.8 पर स्विच होते हैं, और Sonnet 5.5, Sonnet 5 पर; वही अनुरोध दोबारा भेजा जाता है
bioजैविक नुकसान तक ले जा सकता है, जैसे प्रयोगशाला की खतरनाक तकनीकेंFable 5.1, Fable 5 और Opus 5.5, Opus 5 पर स्विच होते हैं; Opus 5 और Sonnet 5.5 का कोई fallback नहीं है और बात इनकार पर खत्म होती है
frontier_llmप्रतिस्पर्धी AI मॉडल बनाने में मदद कर सकता है (वाणिज्यिक शर्तों से प्रतिबंधित)Help Center के मुताबिक Opus 5.5, Opus 5 पर स्विच होता है (Opus 5 इस श्रेणी में स्विच नहीं होता)
reasoning_extractionमॉडल की अंदरूनी तर्क-प्रक्रिया को जवाब के टेक्स्ट के रूप में दोहरवाने की कोशिशHelp Center की "distillation" श्रेणी; यह दूसरे मॉडल पर स्विच नहीं होता और वहीं रुक जाता है
general_harmsऊपर की चार के अलावा उपयोग नीति के किसी और क्षेत्र में आता हैClaude Code के दस्तावेज़ में कोई fallback मॉडल नहीं बताया गया

स्रोत: Claude API "Refusals and fallback" की श्रेणी तालिका, Claude Code "Model configuration" का Automatic model fallback, और Help Center लेख "Why Claude switched models in your conversation with Opus 5 or Opus 5.5" (सभी 29 सितंबर 2026 को जाँचे गए)।

जब स्विच होता है

डिफ़ॉल्ट रूप से, जब Claude Code किसी ऐसी श्रेणी में रुकता है जिसका fallback है, तो वह वही अनुरोध fallback मॉडल पर अपने-आप दोबारा भेजता है और बातचीत में एक सूचना दिखाता है। सेशन का बाकी हिस्सा fallback मॉडल पर चलता है। मूल मॉडल पर लौटने के लिए उसे /model से फिर चुनें।

लेकिन Help Center चेताता है कि मूल मॉडल पर लौटने के बाद भी, अगर flag हुआ अनुरोध बातचीत में बचा है, तो वही safeguards आपको फिर स्विच कर सकते हैं, और दोबारा भेजने से पहले पिछला संदेश बदल देना अक्सर मदद करता है। ऐसी आम स्थितियाँ जिनमें स्विच काम नहीं आता और आप ऊपर जैसे संदेश के साथ रुक जाते हैं: reasoning_extraction जैसी ऐसी श्रेणी में रुकना जिसका कोई fallback नहीं; fallback मॉडल पर भी रुक जाना; fallback मॉडल को availableModels में अनुमति न होना; और "स्विच करने से पहले पूछें" सेटिंग चालू रखकर -p जैसे non-interactive मोड में चलाना।

4. क्या आपने कुछ गलत किया? गलत पहचान पर Anthropic क्या कहता है

अगर आपको लगता है कि "मैंने कुछ गलत नहीं किया, फिर भी रोक दिया गया", तो यह पूरी तरह मुमकिन है। Anthropic के दस्तावेज़ कई जगह साफ़ तौर पर गलत पहचान को मानते हैं।

✅ आधिकारिक दस्तावेज़ क्या कहते हैं

  • खुद संदेश: "This sometimes happens with safe, normal conversations" और "intentionally broad safeguards"
  • API दस्तावेज़: cyber, bio, frontier_llm और general_harms में से हर एक के साथ यह टिप्पणी है कि वे हानिरहित काम पर भी सक्रिय हो सकते हैं
  • Claude Code दस्तावेज़: offensive security या जीव विज्ञान के काम में पहले ही अनुरोध से स्विच होना आम है; इन क्षेत्रों में यह अपेक्षित routing है, खाते पर लगा flag नहीं
  • Help Center: गलत पहचान घटाने के लिए classifier को ट्यून किया जा रहा है, और खाते की विश्वसनीयता के अलग-अलग संकेतों को भी ध्यान में रखा जाएगा
  • CVP का विवरण: मंज़ूरी पाए उपयोगकर्ताओं का वैध काम भी रुक सकता है

दूसरी ओर, संदेश से लिंक किया गया Help Center लेख (Our Approach to User Safety) कहता है कि जो उपयोगकर्ता बार-बार नीतियों का उल्लंघन करते हैं, उन पर कुछ समय के लिए ज़्यादा कड़ी पहचान वाले सुरक्षा फ़िल्टर लगाए जा सकते हैं। गलत पहचान से रुकने की घटनाएँ इसमें गिनी जाती हैं या नहीं, यह आधिकारिक तौर पर नहीं बताया गया है। रुकने के बाद, सिर्फ़ शब्द बदल-बदलकर वही अनुरोध बार-बार भेजने से बेहतर है कि खंड 6 के कदमों से बातचीत बदल लें।

reasoning_extraction से रुकने को कैसे समझें

Help Center इस श्रेणी के रोके जाने वाले अनुरोधों के उदाहरण देता है: अपनी तर्क-प्रक्रिया शब्दशः दोहराने को कहना, या अपनी पूरी chain of thought बाहरी आउटपुट में लिखवाना। दूसरी ओर वह कहता है कि आप अब भी Claude से उसकी तर्क-प्रक्रिया समझाने, कोई अवधारणा सिखाने या code review को कदम-दर-कदम समझाने को कह सकते हैं, और "तुमने ऐसा क्यों किया?" जैसे बातचीत वाले सवालों पर इसका असर नहीं होता।

Issue की रिपोर्टें पढ़ने पर, ऐसे मामले मिले जिनमें नीचे जैसे अनुरोधों के ठीक बाद रुकावट आई। सभी उपयोगकर्ताओं की रिपोर्ट हैं, और Anthropic ने नहीं बताया है कि classifier ने प्रतिक्रिया क्यों दी।

  • पूछा कि क्या स्क्रीन tool calls के बजाय उसकी "thinking" दिखा सकती है (#96118)
  • एक subagent से उसके संदर्भ में से वह पंक्ति उद्धृत करवाई जिसमें लिखा था कि वह किस मॉडल पर चल रहा है (#96139)
  • एक लंबे काम के अंत में उससे सेशन का सार एक फ़ाइल में लिखवाया (#96874)
  • एक डिज़ाइन आरेख में हर फ़ैसले के साथ "किन विकल्पों पर विचार हुआ और वे क्यों खारिज हुए" लिखने को कहा (#98108)

इनमें साझा बात यह है कि मॉडल से "अपनी सोचने की प्रक्रिया" या "अपना संदर्भ" जैसे का तैसा लिखने को कहा गया। अगर आपको यह किसी नतीजे के रूप में चाहिए, तो ऐसी इबारत पर जाएँ जो नतीजे का छोटा सार माँगे, जैसे "निष्कर्ष और उसे चुनने के कारण, तीन पंक्तियों में"; इससे अनुरोध उस "तर्क-प्रक्रिया समझाने" वाली तरफ़ चला जाता है जिसे Anthropic अनुमत बताता है। फिर भी #96118 पर आई अतिरिक्त रिपोर्ट जैसे मामले हैं, जिनमें जर्मन में सिर्फ़ एक छोटा-सा सवाल भी रोक दिया गया, इसलिए शब्द बदलने से बचाव की गारंटी नहीं है।

5. 22 सितंबर से रिपोर्ट हुए मामले

22 सितंबर 2026 को Opus 5.5 जारी होने के बाद से anthropics/claude-code के Issues में इस तरह की रिपोर्टें बढ़ती जा रही हैं। 29 सितंबर को GitHub search से गिनने पर, 22 से 28 सितंबर के बीच बने ऐसे 67 Issues मिले जिनके शीर्षक या विवरण में "safeguards" था (रोज़ 7–12; गिनती खोज के शब्दों के हिसाब से बदलती है)। 22 सितंबर के बाद के जिन Issues को हमने पढ़ा, उनमें Anthropic के कर्मचारियों का कोई जवाब नहीं मिला, और कई पर "duplicate" लेबल लगा था।

🟡 GitHub पर रिपोर्ट हुए ऐसे मामले जिनका कारण तय नहीं हुआ (29 सितंबर 2026 को जाँचे गए)

  • सिर्फ़ अभिवादन पर रुकना: "hi" को [cyber] माना गया और Opus 4.8 पर स्विच हुआ (#96298), "ola" रोका गया (#96495), और "hi" पर [reasoning_extraction] आया (#97560)। #96495 के रिपोर्टर का अनुमान है कि Kali Linux को root के रूप में चलाने की इसमें भूमिका हो सकती है।
  • /compact के दौरान रुकना: बातचीत compact करते-करते [reasoning_extraction] वाला संदेश आया (#96648, v2.1.281)।
  • एक बार रुकने पर पूरी बातचीत बेकार: उसी सेशन के बाद के सभी संदेश रोके गए (#96874), और flag हुआ वाक्यांश बातचीत के लॉग में रह गया, जिससे उसे पढ़ने वाले बाद के सेशन भी रुक गए (#97452)।
  • subagent रुक जाते हैं: एक ही मशीन की गिनती में 866 Opus 5 subagent में से 14 (1.62%) [reasoning_extraction] से रुके। रुके हुए सभी review जैसे अनुरोध थे (#97492)।
  • CVP की मंज़ूरी के बावजूद रुकना: मंज़ूरी पाए उपयोगकर्ताओं को भी Opus 5.5 पर [cyber] माना गया (#96090, #96298, #96592, #97946)। जैसा खंड 7 में बताया गया है, यह आधिकारिक स्पष्टीकरण से मेल खाता है।
  • अपनी ही मशीन या अपने ही कोड पर काम करते हुए रुकना: अपनी कंपनी के सिस्टम पर SSH के "Permission denied" की जाँच (#97373), अपनी कंपनी के उत्पाद की binary को disassemble करना (#97891), और source में hardcode किए गए credentials हटाना (#97605)।

सिर्फ़ अभिवादन पर रुकने के मामलों को खंड 1 के उस आधिकारिक कथन से समझा जा सकता है कि "classifier पूरी बातचीत और वर्कस्पेस की जानकारी देखते हैं"। विचार यह है कि आखिरी संदेश भले हानिरहित हो, classifier ने CLAUDE.md, पिछली बातचीत या पढ़ी गई फ़ाइलों पर प्रतिक्रिया दी हो। लेकिन किसी भी रिपोर्ट से यह पता नहीं चलता कि प्रतिक्रिया किस पर हुई, और इसे जाँचने का कोई तरीका प्रकाशित नहीं किया गया है।

6. रोके जाने पर क्या करें

ये कदम आधिकारिक एरर रेफ़रेंस और मॉडल कॉन्फ़िगरेशन दस्तावेज़ में दिए गए हैं, और कम से ज़्यादा मेहनत के क्रम में रखे गए हैं। अगर ऐसा सिर्फ़ एक बार हुआ है, तो आम तौर पर कदम 3 काफ़ी होगा।

01

Details देखें, और यह कि मॉडल स्विच हुआ या नहीं

अगर आपको Switched to या स्विच की सूचना दिखती है, तो आपका काम पहले ही दूसरे मॉडल पर जारी है। अगर अब भी रुका है, तो Details: की श्रेणी को खंड 3 की तालिका से मिलाएँ।

02

बीच में चल रहे फ़ाइल ऑपरेशन जाँचें

अगर जवाब के बीच में रुका, तो वहाँ तक का आउटपुट अधूरा है। पहले git status और git diff से देखें कि कोई आधा-लिखा बदलाव तो नहीं छूटा (खंड 8)।

03

Esc दो बार दबाकर लौटें, और अलग तरीके से भेजें

इनपुट बॉक्स खाली रखकर Esc दो बार दबाने से, या /rewind चलाने से, rewind मेन्यू खुलता है। रुकी हुई बारी से पहले का कोई बिंदु चुनें, फिर अनुरोध के शब्द या तरीका बदलकर दोबारा भेजें। इस संदेश के लिए Anthropic सबसे पहले यही उपाय बताता है।

04

किस बारी से हुआ, यह पता न चले तो नई बातचीत शुरू करें

उसी प्रोजेक्ट में नई बातचीत शुरू करने के लिए /clear इस्तेमाल करें। मूल बातचीत मिटती नहीं है और /resume से खोली जा सकती है। लेकिन अगर आप मूल बातचीत को --continue या --resume से फिर शुरू करते हैं, तो flag हुई सामग्री भी साथ लौट आती है, इसलिए उसी तरह रुकने की संभावना है।

05

/model से दूसरे मॉडल पर जाएँ

संदेश खुद "try a different model with /model" की सलाह देता है। वजह यह है कि अलग-अलग मॉडल के साथ अलग-अलग classifier होते हैं। उदाहरण के लिए, Sonnet 5.5 की घोषणा कहती है कि यह पहला Sonnet है जो reasoning extraction से बचाने वाले classifier के साथ आता है, और पिछली पीढ़ी के Sonnet 5 में यह classifier नहीं है।

06

पता करें कि कारण CLAUDE.md जैसी कोई चीज़ तो नहीं

अगर आप पहले ही संदेश से रुक रहे हैं, तो claude --safe-mode से शुरू करें। यह CLAUDE.md, skills, MCP सर्वर या hooks लोड किए बिना शुरू होता है, इसलिए अगर इस तरह आप नहीं रुकते, तो जो लोड हो रहा था उसी में कहीं वह सामग्री थी जिसने इसे सक्रिय किया। इस मोड में भी git status और डायरेक्टरी का नाम भेजे जाते हैं।

07

गलत पहचान हो, तो /feedback से रिपोर्ट करें

Anthropic की सलाह है कि अगर विषय साइबर सुरक्षा का नहीं था, तो गलत पहचान को /feedback से रिपोर्ट करें। संदेश में दिखने वाले Request ID और Message ID रिपोर्ट करते समय काम आते हैं। बातचीत के लॉग में आपका कोड और फ़ाइल paths होते हैं, इसलिए अगर GitHub जैसी सार्वजनिक जगह पर पोस्ट करें, तो सिर्फ़ ज़रूरी पंक्तियाँ ही चिपकाएँ।

अगर अपने-आप स्विच के बजाय हर बार खुद चुनना चाहें

अगर आपको लगता है कि fallback मॉडल पर काम की गुणवत्ता गिरती है, तो /config में "Switch models when a message is flagged" बंद करें, या अपनी settings फ़ाइल में नीचे वाला लिखें। तब हर बार रुकने पर सेशन थम जाएगा और आपको चुनने देगा कि fallback मॉडल पर जाएँ या prompt बदलकर मौजूदा मॉडल पर ही दोबारा भेजें।

{
  "switchModelsOnFlag": false
}

लेकिन जिन श्रेणियों का कोई fallback नहीं है (जैसे Sonnet 5.5 या Opus 5 पर bio), उनमें कोई विकल्प नहीं मिलता और बात इनकार पर खत्म होती है। non-interactive -p मोड में, और उन SDK integrations में जो prompt नहीं दिखा सकते, रुकी हुई बारी भी इनकार पर खत्म होती है। मोबाइल ऐप से इस्तेमाल होने वाले cloud सेशन में बदलकर दोबारा भेजने का विकल्प उपलब्ध नहीं है।

अगर /compact के दौरान रुके

बातचीत को compact करते समय भी मॉडल पूरी बातचीत पढ़ता है, इसलिए वह भी रुक सकता है (#96648)। v2.1.282 का CHANGELOG कहता है कि सार के अनुरोध के ठुकराए जाने पर compaction के विफल होने की समस्या ठीक की गई, और अब वह fallback मॉडल पर दोबारा कोशिश करता है। अगर claude --version में 2.1.282 से पुराना वर्ज़न दिखे, तो पहले claude update से अपडेट करें। compaction कब करना फ़ायदेमंद है, इस पर हमारा /compact कब चलाएँ वाला लेख देखें।

7. क्या Cyber Verification Program (CVP) मदद करता है?

CVP एक मुफ़्त आवेदन कार्यक्रम है, जिससे वैध रक्षात्मक उद्देश्यों के लिए साइबर सुरक्षा का काम करने वालों के safeguards से रुकने की संभावना कम हो जाती है। Help Center का CVP लेख रोके जाने वाले काम को दो तरह में बाँटता है।

निषिद्ध उपयोग (Prohibited use)

ऐसा काम जो लगभग सिर्फ़ दुरुपयोग में इस्तेमाल होता है, जैसे बड़े पैमाने पर डेटा चुराना या ransomware बनाना। CVP की मंज़ूरी के बावजूद रोका जाता है।

उच्च जोखिम वाला दोहरा उपयोग (High Risk Dual use)

ऐसा काम जो रक्षा में भी काम आ सकता है, जैसे कमज़ोरियों का exploit या offensive tools बनाना। डिफ़ॉल्ट रूप से रोका जाता है, लेकिन CVP के ज़रिए आवेदन करके ढील पाई जा सकती है।

यहाँ मुख्य बात यह है कि 29 सितंबर 2026 तक CVP, Opus 5.5 या Sonnet 5.5 पर लागू नहीं होता। CVP लेख की शुरुआत में लिखा है कि यह Opus और Sonnet मॉडल पर लागू होता है, पर Opus 5.5 और Sonnet 5.5 पर नहीं, और जल्द ही इसे Opus 5.5, Sonnet 5.5 और Mythos-श्रेणी के मॉडल तक बढ़ाया जाएगा। Opus 5.5 और Sonnet 5.5 दोनों की घोषणाएँ भी CVP के विस्तार को "soon" (जल्द) बताती हैं। खंड 5 में देखी गई "CVP मंज़ूर होने के बावजूद Opus 5.5 पर रुकना" वाली रिपोर्टें इस स्पष्टीकरण से मेल खाती हैं।

Opus 5.5 का Help Center लेख एक और सुराग देता है: एक वाक्य जिसमें कहा गया है कि जो संगठन CVP के ज़रिए पहले से Opus 4.8 इस्तेमाल कर रहे हैं, वे कम साइबर प्रतिबंधों वाला Opus 5 तुरंत इस्तेमाल करना शुरू कर सकते हैं। अगर आपको मंज़ूरी मिली है और फिर भी Opus 5.5 रोक रहा है, तो फ़िलहाल /model से Opus 5 या Opus 4.8 चुनना आधिकारिक स्पष्टीकरण के अनुरूप उपाय है।

क्या जाँचेंHelp Center क्या कहता है
कौन आवेदन कर सकता हैVerification Portal से आवेदन करें (Claude.ai, Claude Code, Anthropic API) / आवेदन की स्क्रीन सिर्फ़ सही अनुमतियों वाले admins को दिखती है / पहचान का सत्यापन ज़रूरी है / लक्ष्य समीक्षा का नतीजा 2 कार्यदिवसों के भीतर ईमेल से बताना है
जिन परिवेशों पर लागू नहींZero Data Retention (ZDR) वाले संगठन फ़िलहाल पात्र नहीं / Amazon Bedrock पर उपलब्ध नहीं
मंज़ूरी के बाद भी रुकें तोमंज़ूरी एक खास organization ID से जुड़ी होती है, इसलिए मंज़ूरी वाले ईमेल के organization ID से मिलाकर पक्का करें कि आप निजी वर्कस्पेस जैसे किसी दूसरे संगठन का इस्तेमाल तो नहीं कर रहे / निषिद्ध उपयोग मंज़ूरी के बाद भी रोका जाता है
फिर भी कुछ गलत लगे तोलेख में दिए फ़ॉर्म से गलत पहचान की रिपोर्ट या अस्वीकृति के खिलाफ़ अपील की जा सकती है

जिन संगठनों का जीव विज्ञान शोध [bio] से रुकता है, उनके लिए Life Sciences Verification Program (LSVP) नाम का अलग जाँच कार्यक्रम है। Opus 5.5 की घोषणा कहती है कि समीक्षा में सफल संगठन अपने शोध के लिए Opus 5.5 इस्तेमाल कर सकते हैं।

8. रोके गए अनुरोधों का बिल, और अधूरा काम

बिल श्रेणी पर और इस पर निर्भर है कि कब रुका

API दस्तावेज़ और Help Center के मुताबिक रोके गए अनुरोधों का बिल इस तरह बनता है। हर हाल में वे आपकी rate limits (उपयोग सीमा) में गिने जाते हैं।

कोई आउटपुट आने से पहले रुका: बिल बनता है

bio, frontier_llm, reasoning_extraction। आधिकारिक स्पष्टीकरण यह है कि इन श्रेणियों में गलत पहचान कम होती है (सितंबर 2026 तक)।

कोई आउटपुट आने से पहले रुका: बिल नहीं बनता

cyber, general_harms, या जब कोई श्रेणी न हो (null)।

जवाब के बीच में रुका

इनपुट और रुकने से पहले स्ट्रीम हुए आउटपुट का बिल सामान्य दरों पर बनता है।

fallback मॉडल पर मिला जवाब

fallback मॉडल की दरों पर अलग से बिल बनता है। cache खोने की लागत की भरपाई credits से की जाती है।

अगर आप subscription इस्तेमाल करते हैं, तो असर इस बात में दिखता है कि आपकी उपयोग सीमा कितनी तेज़ी से खत्म होती है। #97335 के रिपोर्टर लिखते हैं कि रोके गए अनुरोध से लिखा गया prompt cache अगले अनुरोध में इस्तेमाल नहीं हुआ, इसलिए लगभग 7 लाख टोकन की एक लंबी बातचीत में हर रुकावट का मतलब पूरी बातचीत को दोबारा लिखना था। उन्होंने देखा कि चार इनकारों में Pro प्लान की 5 घंटे की सीमा खत्म हो गई। यह Anthropic से पुष्ट नहीं हुई रिपोर्ट है, लेकिन अगर लंबी बातचीत में आप बार-बार रुक रहे हैं, तो उसी बातचीत में डटे रहने के बजाय /clear से बदल लेना आपकी सीमा का कम हिस्सा खर्च करता है।

आधे-अधूरे फ़ाइल ऑपरेशन पीछे छूट सकते हैं

API दस्तावेज़ कहता है कि बीच में रुके जवाब के आउटपुट को अधूरा मानकर छोड़ दिया जाए। #97335 में चिपकाए गए टेक्स्ट के मुताबिक, रुकने के बाद Claude Code बातचीत में जो टिप्पणी जोड़ता है, उसमें भी लिखा है कि जो tool calls पूरे नहीं हुए थे, वे चलाए नहीं गए।

लेकिन #97311 ऐसे चार मामले बताता है जिनमें मॉडल फ़ाइल संपादन (Edit), फ़ाइल लेखन (Write) या Bash call लिखते-लिखते रुका, और कटी हुई सामग्री जैसी की तैसी चला दी गई (v2.1.219–2.1.280, एक ही Linux मशीन पर)। Edit और Write के लिए "success" दिखा, लेकिन लिखी गई फ़ाइल या बदली गई पंक्तियाँ बीच में कटी हुई थीं। अभी तक कोई आधिकारिक जवाब नहीं है, लेकिन रुकने के ठीक बाद, खंड 6 के कदम 2 की तरह, आगे बढ़ने से पहले git diff से बदलाव जाँच लेना सबसे सुरक्षित है।

# बदली हुई फ़ाइलों की सूची
git status

# बीच में कटे संपादनों के लिए सामग्री देखें
git diff

# एक फ़ाइल को आखिरी commit वाली स्थिति में लौटाएँ (जाँचने के बाद)
git restore path/to/file

Claude Code के फ़ाइल संपादन टूल से किए गए बदलाव checkpoint rewind से भी वापस लिए जा सकते हैं। लेकिन Bash के ज़रिए बदली गई फ़ाइलें rewind के दायरे में नहीं आतीं।

9. क्या पुष्ट है और क्या नहीं

✅ आधिकारिक रूप से पुष्ट

  • classifier सर्वर की ओर चलते हैं; Claude Code के अपडेट ने सिर्फ़ इबारत बदली
  • वे आखिरी वाक्य नहीं, बल्कि पढ़ी गई हर चीज़ देखते हैं: बातचीत, फ़ाइलें, CLAUDE.md वगैरह
  • सुरक्षित, सामान्य बातचीत भी रोकी जा सकती है
  • reasoning_extraction दूसरे मॉडल पर स्विच नहीं होता
  • 29 सितंबर तक CVP, Opus 5.5 या Sonnet 5.5 पर लागू नहीं
  • v2.1.282 से, ठुकराया गया /compact fallback मॉडल पर दोबारा आज़माया जाता है

🟡 रिपोर्ट हुआ पर पुष्ट नहीं

  • सिर्फ़ "hi" या "ola" पर रुकना (#96298, #96495, #97560)
  • एक बार रुकने पर, उस बातचीत को पढ़ने वाले सेशन बार-बार रुकते हैं (#96874, #97452)
  • कटे हुए फ़ाइल ऑपरेशन चल जाते हैं (#97311)
  • रोके गए अनुरोध का cache दोबारा इस्तेमाल नहीं होता (#97335)

🔴 खुलासा नहीं

  • किसी खास संदेश में प्रतिक्रिया किस पर हुई
  • गलत पहचान से रुकने की घटनाएँ आपके खाते के साथ होने वाले बर्ताव पर असर डालती हैं या नहीं
  • CVP को Opus 5.5 और Sonnet 5.5 तक बढ़ाने की तारीख
  • v2.1.284 में बदली गई Sonnet सूचना की इबारत

10. सारांश

"safeguards flagged this message" का मतलब है कि मॉडल के सुरक्षा classifier ने बातचीत की सामग्री पर प्रतिक्रिया दी और उस मॉडल को जवाब देने से रोक दिया। classifier सर्वर की ओर चलते हैं और सिर्फ़ आखिरी संदेश नहीं, बल्कि पूरी बातचीत, पढ़ी गई फ़ाइलें और CLAUDE.md तक देखते हैं। खुद संदेश और आधिकारिक दस्तावेज़ दोनों मानते हैं कि सामान्य बातचीत भी रोकी जा सकती है।

रोके जाने पर पहले Details: की श्रेणी देखें, और अगर कोई फ़ाइल ऑपरेशन चल रहा था, तो git diff से जाँचें। फिर क्रम से आज़माएँ: Esc दो बार दबाकर लौटें और शब्द बदलें, /clear से नई बातचीत शुरू करें, और /model से मॉडल बदलें। अगर [cyber] आपके काम में रुकावट है, तो CVP एक विकल्प है, लेकिन 29 सितंबर तक Opus 5.5 और Sonnet 5.5 उसके दायरे में नहीं आए हैं। मॉडल की ओर के safeguards की पूरी तस्वीर के लिए हमारा Opus 5.5 वाला लेख देखें; "फ़िल्टर से ब्लॉक" वाले दूसरे संदेशों के लिए The model returned no content पर हमारा लेख; और दूसरे एरर के लिए Claude Code के आम एरर और फिक्स।

FAQ

Q. "safeguards flagged this message" का क्या मतलब है?
A. इसका मतलब है कि आप जिस मॉडल का इस्तेमाल कर रहे थे (जैसे Opus 5.5 या Fable 5.1), उसके सुरक्षा classifier ने बातचीत की सामग्री पर प्रतिक्रिया दी और जवाब रोक दिया। यह Claude Code की खराबी या नेटवर्क एरर नहीं है। आखिरी पंक्ति के Details: में उस श्रेणी का नाम होता है जिसने प्रतिक्रिया दी।

Q. मैंने सिर्फ़ "hi" भेजा और रोक दिया गया। मैंने क्या गलत किया?
A. ज़रूरी नहीं कि कारण आपका आखिरी संदेश हो। classifier पूरी बातचीत, पढ़ी गई फ़ाइलें, और CLAUDE.md व git status तक देखते हैं। अगर claude --safe-mode से शुरू करने पर आप नहीं रुकते, तो हो सकता है प्रतिक्रिया लोड हो रही settings या फ़ाइलों की सामग्री पर हुई हो। अगर आपको लगता है कि यह गलत पहचान है, तो /feedback से रिपोर्ट करें।

Q. क्या मेरा खाता निलंबित हो सकता है?
A. Claude Code के दस्तावेज़ कहते हैं कि सुरक्षा या जीव विज्ञान के काम के दौरान मॉडल का स्विच होना अपेक्षित routing है, खाते पर लगा flag नहीं। दूसरी ओर, एक Help Center लेख कहता है कि बार-बार नीतियों का उल्लंघन करने वाले उपयोगकर्ताओं पर कुछ समय के लिए ज़्यादा कड़े फ़िल्टर लगाए जा सकते हैं, और गलत पहचान उसमें गिनी जाती है या नहीं, यह नहीं बताया गया है।

Q. CVP की मंज़ूरी होने के बावजूद मैं क्यों रुक रहा हूँ?
A. क्योंकि 29 सितंबर 2026 तक CVP, Opus 5.5 या Sonnet 5.5 पर लागू नहीं होता। Anthropic कहता है कि इसे जल्द बढ़ाया जाएगा। Anthropic यह भी लिखता है कि जो संगठन CVP के ज़रिए पहले से Opus 4.8 इस्तेमाल कर रहे हैं, वे कम साइबर प्रतिबंधों वाला Opus 5 इस्तेमाल कर सकते हैं, इसलिए फ़िलहाल उपाय है /model से Opus 5 या Opus 4.8 चुनना। यह भी जाँच लें कि आपकी मंज़ूरी से जुड़ा organization ID उसी संगठन का है जिसे आप इस्तेमाल कर रहे हैं।

Q. उसी बातचीत में कुछ भी भेजूँ, रुकता ही रहता है। क्या करूँ?
A. जब तक flag हुई सामग्री बातचीत में बची है, आप जो भी भेजें उस पर वही फ़ैसला आने की संभावना रहती है। Esc दो बार दबाकर रुकावट से पहले की बारी पर लौटें, या /clear से नई बातचीत शुरू करें। मूल बातचीत /resume से खोली जा सकती है, लेकिन उसे फिर शुरू करने पर flag हुई सामग्री भी साथ लौट आती है।

हमने जिन प्राथमिक स्रोतों को देखा