«safeguards flagged this message» означает, что классификатор безопасности (classifier), встроенный в модель Claude, среагировал на содержимое разговора и остановил ответ этой модели. Это не ошибка Claude Code и не сбой сети. Сообщение может появиться не только при работе с кибербезопасностью или биологией, но и на обычных запросах вроде приветствия или составления плана, и Anthropic сама признаёт, что ложные срабатывания возможны.

Сообщение начинается с названия модели, которую остановили. В GitHub Issues, созданных с 22 по 29 сентября 2026 года, на экране чаще всего появлялся один из двух вариантов текста (переносы строк не совсем такие, как на экране).

API Error: Opus 5.5's safeguards flagged this message (https://www.anthropic.com/legal/aup). This sometimes happens with safe, normal conversations. Claude Code can't respond to this message with Opus 5.5.

Double press esc to edit your last message, or try a different model with /model.

Send feedback with /feedback or learn more: https://support.claude.com/en/articles/8106465

Details: `[reasoning_extraction]`
API Error: Opus 5.5's safeguards flagged this session (https://www.anthropic.com/legal/aup). You may be seeing this for the first time on an Opus model: Opus 5.5 is more capable and has stronger safeguards as a result, which can sometimes flag non-cybersecurity work. We're improving these safeguards to reduce the amount of incorrectly flagged messages. Claude Code can't respond to your last message with Opus 5.5.

Double press esc to edit your last message, or try a different model with /model.

Send feedback with /feedback or learn more: https://support.claude.com/en/articles/8106465

Details: `[cyber]`

В заголовках Issues часто пишут «Message flagged by safeguards», но на экране появляется именно текст выше. Часть Opus 5.5 меняется на Fable 5.1, Opus 5, Opus 4.8 и т. д. — в зависимости от модели, с которой вы работали.

Сначала посмотрите на последнюю строку, «Details:»

Что поможет, зависит от того, какой классификатор вас остановил

[reasoning_extraction]
Решено, что вы пытаетесь извлечь внутренние рассуждения модели
→ Переформулировать и отправить снова
Автоматического переключения на другую модель нет
[cyber]
Решено, что работа может быть использована для кибератаки
→ Продолжить на резервной модели
Для профессиональной работы проверьте, подходит ли CVP
[bio]
Решено, что речь может идти об опасном применении биологии
→ Как это обрабатывает каждая модель
Для исследовательских организаций есть программа проверки
[general_harms] / [frontier_llm]
Решено, что запрос относится к другим областям правил использования или к разработке передовых ИИ
→ Что означают категории
Если это ложное срабатывание, сообщите через /feedback
Схема основана на категориях из официальной документации Claude API «Refusals and fallback», а также на пояснениях из документации Claude Code о настройке моделей и из справочного центра.

1. Что означает сообщение — его остановил классификатор, прочитавший разговор

Согласно официальной документации Claude API «Refusals and fallback», у Fable 5.1, Fable 5, Opus 5.5, Opus 5 и Sonnet 5.5 есть классификаторы безопасности, которые могут отклонить запрос. При отказе API возвращает не ошибку, а обычный ответ (HTTP 200): причина остановки указывается как stop_reason: "refusal", а область, по которой последовал отказ, — в stop_details.category. Claude Code получает это и показывает как сообщение, начинающееся с «API Error:».

Важно, что классификатор смотрит не только на последнюю отправленную фразу. В статье справочного центра, где объясняются защитные меры Opus 5.5, сказано, что классификаторы смотрят на всё, что читает модель. Сюда входят память, содержимое коннекторов, результаты веб-поиска и файлы, поэтому вас могут остановить из-за того, чего вы сами не набирали.

Ваши указания

Последнее отправленное сообщение и весь предшествующий обмен.

Что прочитал Claude

Открытые файлы, вывод команд, результаты веб-поиска, содержимое из MCP и коннекторов.

Контекст с самого начала

Сведения о рабочем месте, которые Claude Code добавляет к первому запросу, например содержимое CLAUDE.md и git status.

Собственный вывод модели

Остановка возможна и посреди ответа. Тогда всё, что успело прийти, тоже считается неполным.

О третьем пункте документация Claude Code о настройке моделей прямо говорит: классификатор может сработать на первом запросе сессии, ещё до того, как вы отправили что-то необычное. Поскольку первый запрос включает содержимое CLAUDE.md и git status, в репозитории с материалами по безопасности или биологии классификатор может сработать только из-за этих сведений — таково объяснение. Четвёртый пункт соответствует словам документации API: отказ может прийти до вывода или посреди него, и в обоих случаях частичный вывод следует отбросить как неполный.

2. Текст зависит от модели и версии

Один и тот же механизм выдаёт сообщения с разным текстом. Текущий пример из официального справочника ошибок выглядит так.

API Error: Opus 4.8's safeguards flagged this message. Our intentionally broad safeguards allow us to deliver more capabilities faster, but can sometimes flag legitimate cybersecurity work. Apply to the Cyber Verification Program to reduce these interruptions. Send feedback with /feedback or learn more: https://support.claude.com/en/articles/14604842-real-time-cyber-safeguards-on-claude

Далее справочник ошибок сообщает, что на Opus 5.5 и Sonnet 5.5 сообщение начинается с <model>'s safeguards flagged this session. Два сообщения, приведённые в начале статьи, были вставлены в Issues, созданные 22 сентября 2026 года и позже. В том, что мы прочитали, сообщение flagged this session сопровождалось [cyber] или [bio], а сообщение This sometimes happens with safe, normal conversations — в основном [reasoning_extraction].

Начало сообщенияГде подтвержденоЧто дальше
<model>'s safeguards flagged this message. Our intentionally broad safeguards…Официальный справочник ошибок (в Issues встречается вместе с [cyber])Предложение подать заявку в CVP (если произошло переключение, указывается и резервная модель, например Switched to Opus 4.8.)
<model>'s safeguards flagged this sessionОфициальный справочник ошибок (Opus 5.5 и Sonnet 5.5) и Issues по v2.1.280–2.1.283Пояснение: на моделях Opus вы можете видеть это впервые — модель мощнее, поэтому и защитные меры строже
<model>'s safeguards flagged this message (…aup). This sometimes happens…Issues по v2.1.278–2.1.284 (в официальном справочнике примера нет)Говорит, что это «иногда случается и в безопасных, обычных разговорах», и предлагает исправить сообщение через Esc или воспользоваться /model
<model> has safety measures that flagged this message for a cybersecurity topicОфициальный справочник ошибок (старый текст, v2.1.203–2.1.218)Ссылка на справочный центр (до v2.1.203 — ссылка на форму запроса исключения)
<model> can't help with this. Start a new session to continue.Официальный справочник ошибок (Usage Policy refusal)Отказ по итогам проверки на соответствие правилам использования (Usage Policy) (в Amazon Bedrock, Agent Platform в Google Cloud и Microsoft Foundry с этим же текстом приходят и срабатывания по кибербезопасности)

Справочник ошибок сообщает, что сами классификаторы работают на стороне сервера и существовали ещё до v2.1.203, а последующие обновления Claude Code меняли только текст сообщения. То есть дело не в том, что вас стали останавливать после обновления Claude Code.

Что изменилось в v2.1.284

В CHANGELOG версии v2.1.284, вышедшей 28 сентября 2026 года, есть два пункта, связанных с этим сообщением.

  • Уведомление, которое появляется, когда защитные меры модели Sonnet срабатывают на сообщение, теперь объясняет, почему это произошло, и предлагает исправить сообщение и отправить его снова.
  • Изменено переключение моделей из-за защитных мер в сессиях, где модель Opus закреплена через ANTHROPIC_DEFAULT_OPUS_MODEL или modelOverrides. В Anthropic API резервную модель для каждого типа срабатывания теперь выбирает сам API, а не берётся закреплённая модель.

По состоянию на 29 сентября текст нового уведомления для Sonnet не был указан в официальном справочнике ошибок и не встречался ни в одном из прочитанных нами Issues.

3. Категории в Details и переключается ли модель

Слово в Details: в конце сообщения совпадает со значением stop_details.category, которое возвращает API. В документации API перечислены пять категорий. Обратите внимание: у каждой категории, кроме reasoning_extraction, есть примечание, что она может срабатывать и на безобидной работе.

DetailsОфициальное описание (кратко)Как это обрабатывает Claude Code
cyberМожет быть использовано для кибератак, например разработки вредоносного ПО или эксплойтовFable 5.1, Fable 5, Opus 5.5 и Opus 5 переключаются на Opus 4.8, а Sonnet 5.5 — на Sonnet 5, и тот же запрос отправляется повторно
bioМожет привести к биологическому вреду, например через опасные лабораторные методикиFable 5.1, Fable 5 и Opus 5.5 переключаются на Opus 5; у Opus 5 и Sonnet 5.5 резервной модели нет, и всё заканчивается отказом
frontier_llmМожет помочь в разработке конкурирующих моделей ИИ (ограничено коммерческими условиями)По данным справочного центра, Opus 5.5 переключается на Opus 5 (Opus 5 по этой категории не переключается)
reasoning_extractionПопытка заставить модель воспроизвести свои внутренние рассуждения в тексте ответаКатегория «дистилляции» (distillation) в справочном центре; на другую модель не переключается и останавливается сразу
general_harmsОтносится к области правил использования, отличной от четырёх вышеВ документации Claude Code резервная модель не указана

Источники: таблица категорий в Claude API «Refusals and fallback», раздел Automatic model fallback в Claude Code «Model configuration» и статья справочного центра «Why Claude switched models in your conversation with Opus 5 or Opus 5.5» (всё проверено 29 сентября 2026 года).

Когда происходит переключение

По умолчанию, если Claude Code останавливают по категории, у которой есть резервная модель, он автоматически отправляет тот же запрос на резервную модель и публикует уведомление в разговоре. Остаток сессии продолжается на резервной модели. Чтобы вернуться к исходной модели, выберите её снова через /model.

Однако справочный центр предупреждает: даже если вернуться к исходной модели, те же защитные меры могут снова вас переключить, если помеченный запрос остаётся в разговоре, а исправление предыдущего сообщения перед повторной отправкой часто помогает. Типичные ситуации, когда переключение не спасает и вы оказываетесь остановлены с сообщением вроде приведённых в начале: остановка по категории без резервной модели, например reasoning_extraction; остановка и на резервной модели; резервная модель не разрешена в availableModels; работа в неинтерактивном режиме вроде -p с включённой настройкой «спрашивать перед переключением».

4. Вы сделали что-то не так? Что Anthropic пишет о ложных срабатываниях

Если вам кажется, что «ничего плохого я не делал, а меня всё равно остановили», — это вполне возможно. Официальная документация в нескольких местах прямо признаёт ложные срабатывания.

✅ Что сказано в официальной документации

  • Сам текст сообщения: «This sometimes happens with safe, normal conversations» (иногда случается и в безопасных, обычных разговорах) и «intentionally broad safeguards» (намеренно широкие защитные меры)
  • Документация API: у cyber, bio, frontier_llm и general_harms есть примечание, что они могут срабатывать и на безобидной работе
  • Документация Claude Code: при работе с наступательной безопасностью или биологией переключение часто происходит уже с первого запроса; в этих областях это ожидаемая маршрутизация, а не пометка аккаунта (account flag)
  • Справочный центр: классификаторы настраивают, чтобы уменьшить число ложных срабатываний, и будут учитывать различные признаки надёжности аккаунта
  • Описание CVP: даже у одобренных пользователей законная работа может быть остановлена

С другой стороны, статья справочного центра, на которую ссылается сообщение (Our Approach to User Safety), говорит, что к пользователям, неоднократно нарушающим правила, могут временно применяться фильтры безопасности с повышенной чувствительностью. Учитываются ли при этом остановки из-за ложных срабатываний, официально не сказано. После остановки безопаснее сменить разговор по шагам из раздела 6, чем раз за разом отправлять тот же запрос, меняя лишь формулировку.

Как подходить к остановке с reasoning_extraction

Справочный центр приводит примеры того, что останавливает эта категория: просьбы повторить рассуждения слово в слово или выписать всю цепочку рассуждений (chain of thought) во внешний вывод. При этом, по его словам, можно по-прежнему просить Claude объяснить рассуждения, растолковать понятие или пошагово провести ревью кода, а разговорные вопросы вроде «почему ты так сделал?» не затрагиваются.

В отчётах в Issues встречались случаи, когда остановка следовала сразу после запросов вроде следующих. Всё это сообщения пользователей, и Anthropic не объясняла, почему сработал классификатор.

  • Спросили, можно ли показывать на экране «размышления» вместо вызовов инструментов (#96118)
  • Попросили субагента процитировать из своего контекста строку с названием модели, на которой он работает (#96139)
  • В конце длинной задачи попросили записать итоги сессии в файл (#96874)
  • Попросили дополнить схему архитектуры пометками «какие варианты рассматривались и почему отвергнуты» для каждого решения (#98108)

Общее у них — просьба выписать «ход мыслей» или «собственный контекст» как есть. Если это нужно как результат работы, смените формулировку на просьбу кратко подытожить результат, например «вывод и причины выбора — в трёх строках»: так запрос смещается к разрешённому, по словам Anthropic, «объяснению рассуждений». Впрочем, есть случаи вроде дополнительного сообщения в #96118, где остановил один лишь короткий вопрос на немецком, так что переформулировка не гарантирует успеха.

5. Случаи, о которых сообщают с 22 сентября

С выхода Opus 5.5 22 сентября 2026 года такие сообщения массово появляются в Issues репозитория anthropics/claude-code. Когда мы 29 сентября посчитали через поиск GitHub, Issues, созданных с 22 по 28 сентября и содержащих «safeguards» в заголовке или тексте, оказалось 67 (по 7–12 в день; число зависит от выбора поисковых слов). В прочитанных нами Issues начиная с 22 сентября ответов сотрудников Anthropic мы не нашли, а многие были помечены «duplicate».

🟡 Случаи из GitHub, причина которых не установлена (проверено 29 сентября 2026 года)

  • Остановка на одном приветствии: «hi» получило оценку [cyber] и переключение на Opus 4.8 (#96298), «ola» было остановлено (#96495), а «hi» получило [reasoning_extraction] (#97560). Автор #96495 предполагает, что роль могла сыграть работа в Kali Linux под root.
  • Остановка во время /compact: сообщение с [reasoning_extraction] появилось посреди сжатия разговора (#96648, v2.1.281).
  • После одной остановки разговор становится непригодным целиком: все последующие сообщения в той же сессии останавливались (#96874), а помеченная фраза оставалась в журнале разговора, так что останавливались и следующие сессии, которые его читали (#97452).
  • Останавливаются субагенты: по подсчёту на одной машине 14 из 866 субагентов Opus 5 (1,62%) были остановлены с [reasoning_extraction]. Все остановленные выполняли задачи типа ревью (#97492).
  • Остановка даже при одобренной заявке CVP: одобренные пользователи всё равно получали [cyber] на Opus 5.5 (#96090, #96298, #96592, #97946). Как объясняется в разделе 7, это согласуется с официальным объяснением.
  • Остановка при работе со своими машинами или своим кодом: разбор ошибки SSH «Permission denied» в системах собственной компании (#97373), дизассемблирование бинарного файла продукта своей компании (#97891) и удаление учётных данных, зашитых в исходный код (#97605).

Случаи остановки на одном приветствии, возможно, объясняются официальным утверждением из раздела 1: «классификаторы смотрят на весь разговор и сведения о рабочем месте». Идея в том, что даже если последнее сообщение было безобидным, классификатор среагировал на CLAUDE.md, предыдущий обмен или прочитанные файлы. Однако ни в одном сообщении не показано, на что именно он среагировал, и способа это проверить не опубликовано.

6. Что делать, если вас остановили

Ниже — шаги из официального справочника ошибок и документации о настройке моделей, от самых простых к более трудоёмким. Если это случилось один раз, обычно хватает шага 3.

01

Проверьте Details и то, переключилась ли модель

Если вы видите Switched to или уведомление о переключении, работа уже продолжается на другой модели. Если остановка сохраняется, сверьте категорию в Details: с таблицей из раздела 3.

02

Проверьте незавершённые операции с файлами

Если остановка произошла посреди ответа, вывод до этого момента неполон. Сначала через git status и git diff посмотрите, не остались ли недописанные изменения (раздел 8).

03

Нажмите Esc дважды, вернитесь и отправьте иначе

Двойное нажатие Esc при пустом поле ввода или команда /rewind открывает меню отката. Выберите точку до остановленного хода, измените формулировку или подход к запросу и отправьте его снова. Именно это Anthropic называет первым средством при таком сообщении.

04

Если непонятно, какой ход виноват, начните новый разговор

Через /clear начните новый разговор в том же проекте. Исходный разговор не удаляется и открывается через /resume. Но если возобновить исходный разговор через --continue или --resume, помеченное содержимое вернётся вместе с ним, и вас, скорее всего, остановят так же.

05

Смените модель через /model

Само сообщение советует «try a different model with /model». Дело в том, что у разных моделей разные классификаторы. Например, в анонсе Sonnet 5.5 сказано, что это первая Sonnet, выпущенная с классификатором против извлечения рассуждений, а у предыдущего поколения, Sonnet 5, такого классификатора нет.

06

Выясните, не в CLAUDE.md ли дело

Если вас останавливают с самого первого сообщения, запустите claude --safe-mode. Этот режим стартует без загрузки CLAUDE.md, навыков, MCP-серверов и хуков, поэтому если так вас не останавливают, среагировавшее содержимое было среди того, что загружалось. git status и имя каталога отправляются и в этом режиме.

07

Если это ложное срабатывание, сообщите через /feedback

Anthropic советует: если тема не касалась кибербезопасности, сообщить о ложном срабатывании через /feedback. Request ID и Message ID из сообщения пригодятся при отправке. Журнал разговора содержит код, над которым вы работали, и пути к файлам, поэтому в публичных местах вроде GitHub вставляйте только нужные строки.

Если хотите каждый раз выбирать сами, а не переключаться автоматически

Если вам кажется, что на резервной модели качество работы падает, отключите «Switch models when a message is flagged» в /config или пропишите в файле настроек следующее. Тогда при каждой остановке сессия будет вставать на паузу и предлагать выбор: переключиться на резервную модель или исправить промпт и отправить его снова на текущей модели.

{
  "switchModelsOnFlag": false
}

Однако для категорий без резервной модели (например, bio на Sonnet 5.5 или Opus 5) выбор не предлагается, и всё заканчивается отказом. В неинтерактивном режиме -p и во встраиваниях через SDK, которые не могут показать запрос подтверждения, остановленный ход тоже заканчивается отказом. В облачных сессиях из мобильного приложения вариант «исправить и отправить снова» недоступен.

Если остановка случилась во время /compact

Сжатие разговора тоже заставляет модель прочитать весь разговор, поэтому его тоже могут остановить (#96648). В CHANGELOG v2.1.282 сказано, что исправлена ошибка, из-за которой сжатие не удавалось при отказе на запрос сводки, и что теперь оно повторяется на резервной модели. Если claude --version показывает версию старше 2.1.282, сначала обновитесь через claude update. Когда стоит использовать сжатие, мы разбираем в статье о том, когда запускать /compact.

7. Помогает ли Cyber Verification Program (CVP)?

CVP — бесплатная программа по заявкам, которая снижает вероятность того, что защитные меры остановят людей, занимающихся кибербезопасностью в законных оборонительных целях. Статья справочного центра о CVP делит останавливаемую работу на два вида.

Запрещённое использование (Prohibited use)

Работа, которая используется почти исключительно во вред, например массовая выгрузка данных или разработка программ-вымогателей. Останавливается даже при одобренной заявке CVP.

Двойное назначение с высоким риском (High Risk Dual use)

Работа, которая может служить и защите, например эксплуатация уязвимостей или разработка наступательных инструментов. По умолчанию останавливается, но через CVP можно подать заявку на смягчение.

Главное здесь то, что по состоянию на 29 сентября 2026 года CVP не распространяется на Opus 5.5 и Sonnet 5.5. В начале статьи о CVP сказано, что она применяется к моделям Opus и Sonnet, но не к Opus 5.5 и Sonnet 5.5, и что скоро её распространят на Opus 5.5, Sonnet 5.5 и модели класса Mythos. И анонс Opus 5.5, и анонс Sonnet 5.5 тоже называют расширение CVP делом «ближайшего времени». Сообщения из раздела 5 о том, что «заявка CVP одобрена, но Opus 5.5 всё равно останавливает», согласуются с этим объяснением.

В статье справочного центра об Opus 5.5 есть ещё одна подсказка — фраза о том, что организации, уже использующие Opus 4.8 через CVP, могут сразу начать пользоваться Opus 5 с меньшими ограничениями по кибербезопасности. Если заявка одобрена, а Opus 5.5 всё равно вас останавливает, обходной путь, соответствующий официальному объяснению, — пока выбрать Opus 5 или Opus 4.8 через /model.

Что проверитьЧто говорит справочный центр
Кто может подать заявкуЗаявка подаётся через Verification Portal (Claude.ai, Claude Code, Anthropic API) / экран заявки видят только администраторы с нужными правами / требуется подтверждение личности / цель — сообщить результат проверки по электронной почте в течение 2 рабочих дней
Где недоступноОрганизации с Zero Data Retention (ZDR) пока не допускаются / в Amazon Bedrock не предлагается
Если остановки продолжаются после одобренияОдобрение привязано к конкретному ID организации, поэтому сверьте его с ID организации в письме об одобрении и убедитесь, что не работаете в другой организации, например в личном рабочем пространстве / запрещённое использование останавливается и после одобрения
Если что-то всё ещё не такЧерез форму в статье можно сообщить о ложном срабатывании или обжаловать отказ

Для организаций, чьи биологические исследования останавливает [bio], есть отдельная программа проверки — Life Sciences Verification Program (LSVP). В анонсе Opus 5.5 сказано, что организации, прошедшие проверку, могут использовать Opus 5.5 для исследований.

8. Оплата остановленных запросов и незавершённая работа

Оплата зависит от категории и момента остановки

Согласно документации API и справочному центру, остановленные запросы оплачиваются так. Во всех случаях они учитываются в лимитах запросов (лимитах использования).

Остановка до вывода: оплачивается

bio, frontier_llm, reasoning_extraction. Официальное объяснение — у этих категорий мало ложных срабатываний (на сентябрь 2026 года).

Остановка до вывода: не оплачивается

cyber, general_harms или случаи без категории (null).

Остановка посреди ответа

Ввод и вывод, пришедший до остановки, оплачиваются по обычным тарифам.

Ответ резервной модели

Оплачивается отдельно по тарифам резервной модели. Потерю кэша компенсируют кредитами.

Если вы пользуетесь подпиской, последствия видны в том, как быстро расходуется лимит использования. Автор #97335 пишет, что кэш промпта, записанный остановленным запросом, не использовался следующим запросом, поэтому в длинном разговоре примерно на 700 тыс. токенов каждая остановка означала повторную запись всего разговора. По его наблюдению, 5-часовое окно тарифа Pro ушло на четыре отказа. Это сообщение не подтверждено Anthropic, но если в длинном разговоре вас раз за разом останавливают, переход через /clear обойдётся лимиту дешевле, чем упорство в том же разговоре.

Могут остаться недоделанные операции с файлами

Документация API требует отбрасывать вывод ответа, остановленного на полпути, как неполный. Примечание, которое Claude Code добавляет в разговор после остановки, в тексте, вставленном в #97335, тоже гласит, что незавершённые вызовы инструментов не выполнялись.

Однако в #97311 описаны четыре случая, когда модель остановили во время написания правки файла (Edit), записи файла (Write) или вызова Bash, и обрезанное содержимое было выполнено как есть (v2.1.219–2.1.280, на одной машине с Linux). Для Edit и Write отображался «успех», но записанный файл или изменённые строки были обрезаны. Официального ответа пока нет, но сразу после остановки безопаснее проверить изменения через git diff, прежде чем двигаться дальше, как в шаге 2 раздела 6.

# Показать изменённые файлы
git status

# Посмотреть содержимое: нет ли обрезанных правок
git diff

# Вернуть один файл к состоянию последнего коммита (после проверки)
git restore path/to/file

Изменения, сделанные инструментами правки файлов Claude Code, можно отменить и через откат к контрольной точке. Однако файлы, переписанные через Bash, откат не затрагивает.

9. Что подтверждено, а что нет

✅ Официально подтверждено

  • Классификаторы работают на стороне сервера; обновления Claude Code меняли только текст
  • Они смотрят не на последнюю фразу, а на всё прочитанное: разговор, файлы, CLAUDE.md и т. д.
  • Безопасные, обычные разговоры тоже могут быть остановлены
  • reasoning_extraction не переключается на другую модель
  • На 29 сентября CVP не распространяется на Opus 5.5 и Sonnet 5.5
  • С v2.1.282 отклонённый /compact повторяется на резервной модели

🟡 Есть сообщения, но не подтверждено

  • Остановка на одном «hi» или «ola» (#96298, #96495, #97560)
  • После одной остановки сессии, читающие тот разговор, продолжают останавливаться (#96874, #97452)
  • Обрезанные операции с файлами выполняются (#97311)
  • Кэш остановленного запроса не используется повторно (#97335)

🔴 Не раскрывается

  • На что среагировало каждое конкретное сообщение
  • Влияют ли остановки из-за ложных срабатываний на отношение к аккаунту
  • Когда CVP распространят на Opus 5.5 и Sonnet 5.5
  • Текст уведомления для Sonnet, изменённого в v2.1.284

10. Итоги

«safeguards flagged this message» означает, что классификатор безопасности модели среагировал на содержимое разговора и остановил ответ этой модели. Классификаторы работают на стороне сервера и смотрят не только на последнее сообщение, но и на весь разговор, прочитанные файлы и даже CLAUDE.md. И само сообщение, и официальная документация признают, что остановить могут и обычный разговор.

Если вас остановили, сначала посмотрите категорию в Details:, а если шла операция с файлами, проверьте её через git diff. Затем пробуйте по порядку: вернуться двойным Esc и переформулировать, начать новый разговор через /clear, сменить модель через /model. Если работу блокирует [cyber], вариант — CVP, но на 29 сентября Opus 5.5 и Sonnet 5.5 ею ещё не охвачены. Общую картину защитных мер на стороне моделей смотрите в нашем разборе Opus 5.5, другие сообщения из серии «заблокировано фильтром» — в статье о The model returned no content, а прочие ошибки — в подборке частых ошибок Claude Code и способов их устранения.

FAQ

Q. Что означает «safeguards flagged this message»?
A. Это значит, что классификатор безопасности модели, с которой вы работали (например, Opus 5.5 или Fable 5.1), среагировал на содержимое разговора и остановил ответ. Это не поломка Claude Code и не сетевая ошибка. В Details: в последней строке указано название сработавшей категории.

Q. Я отправил только «hi», и меня остановили. Что я сделал не так?
A. Причина не обязательно в вашем последнем сообщении. Классификаторы смотрят на весь разговор, прочитанные файлы и даже CLAUDE.md и git status. Если при запуске через claude --safe-mode остановки нет, возможно, классификатор среагировал на содержимое загружаемых настроек или файлов. Если считаете это ложным срабатыванием, сообщите через /feedback.

Q. Могут ли заблокировать мой аккаунт?
A. В документации Claude Code сказано, что переключение модели при работе с безопасностью или биологией — ожидаемая маршрутизация, а не пометка аккаунта. С другой стороны, в статье справочного центра говорится, что к пользователям, неоднократно нарушающим правила, могут временно применяться более строгие фильтры, а учитываются ли при этом ложные срабатывания, не раскрывается.

Q. Почему меня останавливают, хотя заявка CVP одобрена?
A. Потому что по состоянию на 29 сентября 2026 года CVP не распространяется на Opus 5.5 и Sonnet 5.5. Anthropic обещает расширить её в ближайшее время. Anthropic также пишет, что организации, уже использующие Opus 4.8 через CVP, могут пользоваться Opus 5 с меньшими ограничениями по кибербезопасности, поэтому пока обходной путь — выбрать Opus 5 или Opus 4.8 через /model. Проверьте также, совпадает ли ID организации, к которой привязано одобрение, с организацией, в которой вы работаете.

Q. В одном и том же разговоре меня останавливают, что бы я ни отправил. Что делать?
A. Пока помеченное содержимое остаётся в разговоре, всё, что вы отправляете, скорее всего, получит ту же оценку. Нажмите Esc дважды и вернитесь к ходу до остановки или начните новый разговор через /clear. Исходный разговор можно открыть через /resume, но при возобновлении помеченное содержимое вернётся вместе с ним.

Первоисточники, которыми мы пользовались