"safeguards flagged this message" significa que um classificador de segurança (classifier) acoplado ao modelo Claude reagiu ao conteúdo da conversa e impediu que aquele modelo respondesse. Não é um bug do Claude Code nem uma falha de rede. Pode aparecer não só em trabalhos de cibersegurança ou biologia, mas também em pedidos comuns, como um cumprimento ou um planejamento, e a própria Anthropic reconhece que falsos positivos podem acontecer.

A mensagem começa com o nome do modelo que foi barrado. Nas Issues do GitHub abertas entre 22 e 29 de setembro de 2026, o texto relatado na tela foi principalmente um destes dois (as quebras de linha não são exatamente as da tela).

API Error: Opus 5.5's safeguards flagged this message (https://www.anthropic.com/legal/aup). This sometimes happens with safe, normal conversations. Claude Code can't respond to this message with Opus 5.5.

Double press esc to edit your last message, or try a different model with /model.

Send feedback with /feedback or learn more: https://support.claude.com/en/articles/8106465

Details: `[reasoning_extraction]`
API Error: Opus 5.5's safeguards flagged this session (https://www.anthropic.com/legal/aup). You may be seeing this for the first time on an Opus model: Opus 5.5 is more capable and has stronger safeguards as a result, which can sometimes flag non-cybersecurity work. We're improving these safeguards to reduce the amount of incorrectly flagged messages. Claude Code can't respond to your last message with Opus 5.5.

Double press esc to edit your last message, or try a different model with /model.

Send feedback with /feedback or learn more: https://support.claude.com/en/articles/8106465

Details: `[cyber]`

Os títulos das Issues costumam dizer "Message flagged by safeguards", mas o que aparece de fato na tela é o texto acima. A parte Opus 5.5 muda para Fable 5.1, Opus 5, Opus 4.8 etc., conforme o modelo que você estava usando.

Olhe primeiro a última linha, "Details:"

O que funciona depende de qual classificador barrou você

[reasoning_extraction]
Considerado uma tentativa de extrair o raciocínio interno do modelo
→ Reformular e reenviar
Não há troca automática para outro modelo
[cyber]
Considerado um trabalho que poderia servir a um ciberataque
→ Continuar no modelo substituto
Se for trabalho profissional, veja se o CVP se aplica
[bio]
Considerado possivelmente ligado a usos perigosos da biologia
→ Ver como cada modelo trata o caso
Há um programa de verificação para organizações de pesquisa
[general_harms] / [frontier_llm]
Considerado dentro de outras áreas da política de uso, ou do desenvolvimento de IA de fronteira
→ Ver o que as categorias significam
Se for falso positivo, informe com /feedback
Baseado nas categorias da documentação oficial da API do Claude "Refusals and fallback" e nas explicações da documentação de configuração de modelos do Claude Code e da Central de Ajuda.

1. O que a mensagem significa: um classificador que leu a conversa barrou a resposta

Segundo a documentação oficial da API do Claude "Refusals and fallback", o Fable 5.1, o Fable 5, o Opus 5.5, o Opus 5 e o Sonnet 5.5 vêm com classificadores de segurança que podem recusar solicitações. Quando um deles recusa, a API não devolve um erro, e sim uma resposta normal (HTTP 200), com o motivo de parada definido como stop_reason: "refusal" e a área da recusa em stop_details.category. O Claude Code recebe isso e mostra como uma mensagem que começa com "API Error:".

O ponto importante é que o classificador não olha só a última frase que você enviou. O artigo da Central de Ajuda que explica as salvaguardas do Opus 5.5 diz que os classificadores examinam tudo o que o modelo lê. Isso inclui a memória, o conteúdo de conectores, resultados de busca na web e arquivos, então você pode ser barrado por um conteúdo que nem digitou.

Suas instruções

A última mensagem que você enviou e toda a conversa anterior a ela.

O que o Claude leu

Arquivos que ele abriu, saída de comandos, resultados de busca na web e conteúdo vindo de MCP ou de conectores.

Contexto anexado desde o início

Informações do ambiente de trabalho que o Claude Code acrescenta à primeira solicitação, como o conteúdo do CLAUDE.md e o git status.

A própria saída do modelo

Ele também pode parar no meio da resposta. Nesse caso, o que já tinha sido transmitido também é tratado como incompleto.

Sobre o terceiro ponto, a documentação de configuração de modelos do Claude Code afirma explicitamente que um classificador pode disparar na primeira solicitação de uma sessão, antes de você enviar qualquer coisa fora do comum. Como a primeira solicitação inclui o conteúdo do CLAUDE.md e o git status, um repositório com material de segurança ou de biologia pode disparar o classificador só com essas informações: essa é a explicação. O quarto ponto corresponde ao que diz a documentação da API: a recusa pode chegar antes da saída ou no meio dela e, em ambos os casos, a saída parcial deve ser descartada como incompleta.

2. O texto muda conforme o modelo e a versão

O mesmo mecanismo produz vários textos diferentes. O exemplo atual listado na referência de erros oficial é este.

API Error: Opus 4.8's safeguards flagged this message. Our intentionally broad safeguards allow us to deliver more capabilities faster, but can sometimes flag legitimate cybersecurity work. Apply to the Cyber Verification Program to reduce these interruptions. Send feedback with /feedback or learn more: https://support.claude.com/en/articles/14604842-real-time-cyber-safeguards-on-claude

A referência de erros diz em seguida que, no Opus 5.5 e no Sonnet 5.5, a mensagem começa com <model>'s safeguards flagged this session. As duas mensagens citadas no início deste artigo foram coladas em Issues abertas a partir de 22 de setembro de 2026. Dentro do que lemos, a mensagem flagged this session vinha com [cyber] ou [bio], enquanto a mensagem This sometimes happens with safe, normal conversations vinha principalmente com [reasoning_extraction].

Como a mensagem começaOnde foi confirmadaO que vem depois
<model>'s safeguards flagged this message. Our intentionally broad safeguards…Referência de erros oficial (relatada em Issues junto com [cyber])Uma indicação para se inscrever no CVP (quando há troca, o modelo substituto também aparece, como em Switched to Opus 4.8.)
<model>'s safeguards flagged this sessionReferência de erros oficial (Opus 5.5 e Sonnet 5.5) e Issues nas versões v2.1.280–2.1.283Uma explicação de que você pode estar vendo isso pela primeira vez num modelo Opus, porque ele é mais capaz e, por isso, tem salvaguardas mais fortes
<model>'s safeguards flagged this message (…aup). This sometimes happens…Issues nas versões v2.1.278–2.1.284 (sem exemplo na referência oficial)Diz que "às vezes acontece com conversas seguras e normais" e sugere editar com Esc ou usar /model
<model> has safety measures that flagged this message for a cybersecurity topicReferência de erros oficial (texto antigo, v2.1.203–2.1.218)Um link para a Central de Ajuda (antes da v2.1.203, um link para o formulário de pedido de exceção)
<model> can't help with this. Start a new session to continue.Referência de erros oficial (Usage Policy refusal)Uma recusa da verificação da Política de Uso (Usage Policy) (no Amazon Bedrock, no Agent Platform do Google Cloud e no Microsoft Foundry, as sinalizações de cyber também usam este texto)

A referência de erros diz que os classificadores em si rodam no lado do servidor e já existiam antes da v2.1.203; o que as atualizações posteriores do Claude Code mudaram foi apenas o texto da mensagem. Não é que atualizar o Claude Code tenha feito você começar a ser barrado.

O que mudou na v2.1.284

O CHANGELOG da v2.1.284, publicada em 28 de setembro de 2026, tem duas entradas relacionadas a esta mensagem.

  • O aviso exibido quando as salvaguardas de um modelo Sonnet sinalizam uma mensagem passou a explicar por que isso aconteceu e a oferecer a opção de editar e reenviar.
  • A troca de modelo acionada pelas salvaguardas mudou para as sessões que fixam um modelo Opus com ANTHROPIC_DEFAULT_OPUS_MODEL ou modelOverrides. Na API da Anthropic, agora é a API que escolhe o modelo substituto para cada tipo de sinalização, em vez de usar o modelo fixado.

Em 29 de setembro, o texto do novo aviso do Sonnet não constava da referência de erros oficial nem tinha sido colado em nenhuma das Issues que lemos.

3. As categorias de Details e se o modelo é trocado

A palavra em Details:, no fim da mensagem, corresponde ao valor de stop_details.category devolvido pela API. A documentação da API lista cinco categorias. Repare que todas, exceto reasoning_extraction, trazem a observação de que também podem disparar em trabalhos inofensivos.

DetailsDescrição oficial (resumo)Como o Claude Code trata
cyberPode ser usado em ciberataques, como no desenvolvimento de malware ou exploitsFable 5.1, Fable 5, Opus 5.5 e Opus 5 trocam para o Opus 4.8, e o Sonnet 5.5 troca para o Sonnet 5, reenviando a mesma solicitação
bioPode levar a danos biológicos, como técnicas de laboratório perigosasFable 5.1, Fable 5 e Opus 5.5 trocam para o Opus 5; Opus 5 e Sonnet 5.5 não têm substituto e terminam em recusa
frontier_llmPode ajudar a desenvolver modelos de IA concorrentes (restrito pelos termos comerciais)Segundo a Central de Ajuda, o Opus 5.5 troca para o Opus 5 (o Opus 5 não troca nesta categoria)
reasoning_extractionTenta fazer o raciocínio interno do modelo ser reproduzido como texto da respostaÉ a categoria de "destilação" (distillation) da Central de Ajuda; não troca para outro modelo e para ali mesmo
general_harmsSe enquadra numa área da política de uso diferente das quatro acimaA documentação do Claude Code não indica modelo substituto

Fontes: a tabela de categorias de "Refusals and fallback" da API do Claude, a seção Automatic model fallback de "Model configuration" do Claude Code e o artigo da Central de Ajuda "Why Claude switched models in your conversation with Opus 5 or Opus 5.5" (todos verificados em 29 de setembro de 2026).

Quando há troca de modelo

Por padrão, quando o Claude Code é barrado numa categoria que tem substituto, ele reenvia automaticamente a mesma solicitação no modelo substituto e publica um aviso na conversa. O resto da sessão continua no modelo substituto. Para voltar ao modelo original, escolha-o de novo com /model.

A Central de Ajuda alerta, porém, que mesmo voltando ao modelo original, as mesmas salvaguardas podem trocar o modelo de novo se a solicitação sinalizada ainda estiver na conversa, e que editar a mensagem anterior antes de reenviar costuma ajudar. As situações típicas em que a troca não resolve e você acaba barrado com uma mensagem como as do início são: ser barrado numa categoria sem substituto, como reasoning_extraction; ser barrado também no modelo substituto; o modelo substituto não estar permitido em availableModels; e rodar num modo não interativo, como -p, com a configuração "perguntar antes de trocar" ativada.

4. A culpa é do seu trabalho? O que a Anthropic diz sobre falsos positivos

Se você sente que "não fiz nada de errado e mesmo assim fui barrado", isso é perfeitamente possível. A documentação da Anthropic reconhece claramente os falsos positivos em vários pontos.

✅ O que diz a documentação oficial

  • A própria mensagem: "This sometimes happens with safe, normal conversations" (às vezes acontece com conversas seguras e normais) e "intentionally broad safeguards" (salvaguardas intencionalmente amplas)
  • A documentação da API: cyber, bio, frontier_llm e general_harms trazem, cada uma, a observação de que também podem disparar em trabalhos inofensivos
  • A documentação do Claude Code: em trabalhos de segurança ofensiva ou de biologia, a troca costuma acontecer já na primeira solicitação; nessas áreas, isso é um roteamento esperado, e não uma marcação da conta (account flag)
  • A Central de Ajuda: os classificadores estão sendo ajustados para reduzir falsos positivos e também vão levar em conta vários sinais de confiabilidade da conta
  • A explicação do CVP: mesmo usuários aprovados podem ter trabalhos legítimos barrados

Por outro lado, o artigo da Central de Ajuda indicado na mensagem (Our Approach to User Safety) diz que usuários que violam as políticas repetidamente podem ter, temporariamente, filtros de segurança com detecção reforçada aplicados a eles. Não está escrito oficialmente se as vezes em que você foi barrado por falsos positivos contam para isso. Depois de ser barrado, é mais seguro trocar de conversa seguindo os passos da seção 6 do que ficar jogando o mesmo pedido de novo mudando só a redação.

Como encarar uma parada por reasoning_extraction

A Central de Ajuda dá exemplos do que esta categoria barra: pedidos para repetir o raciocínio palavra por palavra ou para escrever toda a cadeia de pensamento (chain of thought) numa saída externa. Por outro lado, diz que você ainda pode pedir ao Claude que explique o raciocínio, ensine um conceito ou percorra uma revisão de código passo a passo, e que perguntas de conversa como "por que você fez isso?" não são afetadas.

Lendo os relatos das Issues, houve casos em que a parada veio logo depois de pedidos como os seguintes. Todos são relatos de usuários, e a Anthropic não explicou por que o classificador reagiu.

  • Perguntou se a tela poderia mostrar o "raciocínio" no lugar das chamadas de ferramentas (#96118)
  • Pediu a um subagente que citasse, do próprio contexto, a linha com o nome do modelo em que estava rodando (#96139)
  • No fim de uma tarefa longa, pediu que ele escrevesse um resumo da sessão num arquivo (#96874)
  • Pediu que anotasse num diagrama de arquitetura, para cada decisão, "as opções consideradas e por que foram descartadas" (#98108)

O que eles têm em comum é pedir ao modelo que escreva "o próprio processo de pensamento" ou "o próprio contexto" tal como estão. Se você precisa disso como entregável, trocar para uma redação que peça um resumo curto do resultado, como "a conclusão e os motivos da escolha, em três linhas", aproxima o pedido do lado "explicar o raciocínio", que a Anthropic descreve como permitido. Ainda assim, há casos como o relato adicional na #96118, em que uma pergunta curta em alemão foi barrada sozinha, então reformular não garante que você escape.

5. Casos relatados desde 22 de setembro

Desde o lançamento do Opus 5.5, em 22 de setembro de 2026, relatos desse tipo vêm se acumulando nas Issues de anthropics/claude-code. Quando contamos com a busca do GitHub em 29 de setembro, havia 67 Issues criadas entre 22 e 28 de setembro com "safeguards" no título ou no corpo (de 7 a 12 por dia; o número muda conforme os termos de busca). Nas Issues a partir de 22 de setembro que lemos, não encontramos respostas da equipe da Anthropic, e muitas tinham o rótulo "duplicate".

🟡 Casos relatados no GitHub cuja causa não foi estabelecida (verificado em 29 de setembro de 2026)

  • Barrado só por um cumprimento: "hi" foi classificado como [cyber] e trocou para o Opus 4.8 (#96298), "ola" foi barrado (#96495) e "hi" recebeu [reasoning_extraction] (#97560). O autor da #96495 supõe que usar o Kali Linux como root pode ter influenciado.
  • Barrado durante o /compact: a mensagem com [reasoning_extraction] apareceu no meio da compactação da conversa (#96648, v2.1.281).
  • Depois de uma parada, a conversa inteira fica inutilizável: todas as mensagens seguintes na mesma sessão foram barradas (#96874), e a frase sinalizada ficou no registro da conversa, de modo que sessões posteriores que o liam também foram barradas (#97452).
  • Subagentes são barrados: uma contagem feita numa única máquina encontrou 14 de 866 subagentes do Opus 5 (1,62%) barrados com [reasoning_extraction]. Todos os barrados eram pedidos do tipo revisão (#97492).
  • Barrado mesmo com aprovação no CVP: usuários aprovados ainda assim receberam [cyber] no Opus 5.5 (#96090, #96298, #96592, #97946). Como a seção 7 explica, isso bate com a explicação oficial.
  • Barrado ao trabalhar nas próprias máquinas ou no próprio código: investigar um "Permission denied" de SSH nos sistemas da própria empresa (#97373), desmontar (disassemble) um binário de um produto da própria empresa (#97891) e remover credenciais escritas diretamente no código-fonte (#97605).

Os casos barrados só por um cumprimento talvez se expliquem pela afirmação oficial da seção 1, de que "os classificadores olham a conversa inteira e as informações do ambiente de trabalho". A ideia é que, mesmo que a última mensagem fosse inofensiva, o classificador tenha reagido ao CLAUDE.md, à conversa anterior ou a arquivos lidos. No entanto, nenhum relato mostra a que ele reagiu, e não foi publicada nenhuma forma de verificar isso.

6. O que fazer quando você é barrado

Estes são os passos indicados pela referência de erros oficial e pela documentação de configuração de modelos, organizados do menor para o maior esforço. Se aconteceu só uma vez, o passo 3 geralmente basta.

01

Veja Details e se o modelo foi trocado

Se aparecer Switched to ou um aviso de troca, seu trabalho já está continuando em outro modelo. Se continuar parado, compare a categoria em Details: com a tabela da seção 3.

02

Confira as operações de arquivo que estavam em andamento

Se ele foi barrado no meio da resposta, a saída até ali está incompleta. Primeiro use git status e git diff para ver se ficaram alterações pela metade (seção 8).

03

Pressione Esc duas vezes para voltar e envie de outro jeito

Pressionar Esc duas vezes com o campo de entrada vazio, ou executar /rewind, abre o menu de retrocesso. Escolha um ponto anterior ao turno barrado, mude a forma de redigir ou de abordar o pedido e envie de novo. É a primeira solução que a Anthropic indica para esta mensagem.

04

Se não souber qual turno causou a parada, comece uma conversa nova

Use /clear para começar uma conversa nova no mesmo projeto. A conversa original não é apagada e pode ser aberta pelo /resume. Porém, se você retomar a conversa original com --continue ou --resume, o conteúdo sinalizado volta junto, e é provável que você seja barrado do mesmo jeito.

05

Troque para outro modelo com /model

A própria mensagem recomenda "try a different model with /model". Isso porque modelos diferentes têm classificadores diferentes. Por exemplo, o anúncio do Sonnet 5.5 diz que ele é o primeiro Sonnet lançado com um classificador contra a extração de raciocínio, e o Sonnet 5, da geração anterior, não tem esse classificador.

06

Descubra se o CLAUDE.md ou algo parecido é a causa

Se você é barrado já na primeira mensagem, inicie com claude --safe-mode. Ele começa sem carregar CLAUDE.md, skills, servidores MCP nem hooks; então, se você não for barrado assim, algo entre o que estava sendo carregado continha o conteúdo que disparou a parada. O git status e o nome do diretório continuam sendo enviados nesse modo.

07

Se for falso positivo, informe com /feedback

A Anthropic orienta que, se o assunto não era cibersegurança, você informe o falso positivo com /feedback. O Request ID e o Message ID que aparecem na mensagem são úteis na hora de relatar. O registro da conversa contém o código em que você estava trabalhando e caminhos de arquivos, então, se for publicar num lugar público como o GitHub, cole só as linhas necessárias.

Se você prefere escolher a cada vez em vez de trocar automaticamente

Se você sente que a qualidade do trabalho cai no modelo substituto, desative "Switch models when a message is flagged" em /config ou escreva o seguinte no arquivo de configurações. A sessão passará a pausar a cada parada e deixará você escolher entre trocar para o modelo substituto e editar o prompt para reenviá-lo no modelo atual.

{
  "switchModelsOnFlag": false
}

No entanto, nas categorias sem substituto (como bio no Sonnet 5.5 ou no Opus 5), nenhuma escolha é oferecida e tudo termina em recusa. No modo não interativo -p e em integrações via SDK que não conseguem exibir a pergunta, o turno barrado também termina em recusa. Nas sessões na nuvem usadas pelo app de celular, a opção de editar e reenviar não está disponível.

Se parar durante o /compact

Compactar uma conversa também faz o modelo ler a conversa inteira, então isso também pode ser barrado (#96648). O CHANGELOG da v2.1.282 diz que corrigiu a falha na compactação quando a solicitação de resumo era recusada e que agora ela é tentada de novo no modelo substituto. Se claude --version mostrar uma versão anterior à 2.1.282, atualize primeiro com claude update. Explicamos quando vale a pena compactar no artigo sobre quando executar o /compact.

7. O Cyber Verification Program (CVP) ajuda?

O CVP é um programa gratuito, mediante inscrição, que torna menos provável que quem faz trabalho de cibersegurança com fins legítimos de defesa seja barrado pelas salvaguardas. O artigo sobre o CVP na Central de Ajuda divide os trabalhos barrados em dois tipos.

Uso proibido (Prohibited use)

Trabalhos usados quase só para abuso, como exfiltração de dados em massa ou desenvolvimento de ransomware. Barrados mesmo com aprovação no CVP.

Uso duplo de alto risco (High Risk Dual use)

Trabalhos que também servem à defesa, como explorar vulnerabilidades ou desenvolver ferramentas ofensivas. Barrados por padrão, mas você pode pedir a flexibilização pelo CVP.

O ponto-chave aqui é que em 29 de setembro de 2026, o CVP não se aplica ao Opus 5.5 nem ao Sonnet 5.5. O artigo do CVP diz logo no início que ele se aplica aos modelos Opus e Sonnet, mas não ao Opus 5.5 nem ao Sonnet 5.5, e que em breve será estendido ao Opus 5.5, ao Sonnet 5.5 e aos modelos da classe Mythos. Tanto o anúncio do Opus 5.5 quanto o do Sonnet 5.5 também descrevem a ampliação do CVP como algo para "em breve". Os relatos vistos na seção 5, de "aprovado no CVP, mas ainda barrado no Opus 5.5", são coerentes com essa explicação.

O artigo da Central de Ajuda sobre o Opus 5.5 dá mais uma pista: uma frase dizendo que organizações que já usam o Opus 4.8 pelo CVP podem começar a usar imediatamente o Opus 5, que tem menos restrições de cyber. Se você está aprovado e mesmo assim é barrado pelo Opus 5.5, escolher por enquanto o Opus 5 ou o Opus 4.8 com /model é a alternativa alinhada à explicação oficial.

O que verificarO que diz a Central de Ajuda
Quem pode se inscreverInscrição pelo Verification Portal (Claude.ai, Claude Code, API da Anthropic) / só administradores com as permissões adequadas veem a tela de inscrição / é preciso verificar a identidade / a meta é informar o resultado da análise por e-mail em até 2 dias úteis
Ambientes não cobertosOrganizações com Zero Data Retention (ZDR) não são elegíveis no momento / não é oferecido no Amazon Bedrock
Se continuar barrado após a aprovaçãoA aprovação é vinculada a um ID de organização específico; compare-o com o ID de organização do e-mail de aprovação para garantir que você não está usando outra organização, como um workspace pessoal / o uso proibido continua barrado mesmo após a aprovação
Se algo ainda parecer erradoPelo formulário do artigo, você pode relatar um falso positivo ou contestar uma recusa

Para organizações cuja pesquisa em biologia é barrada por [bio], existe outro programa de verificação, o Life Sciences Verification Program (LSVP). O anúncio do Opus 5.5 diz que as organizações aprovadas na análise podem usar o Opus 5.5 em suas pesquisas.

8. Cobrança das solicitações barradas e trabalho pela metade

A cobrança depende da categoria e do momento da parada

Segundo a documentação da API e a Central de Ajuda, as solicitações barradas são cobradas assim. Em todos os casos, elas contam para os seus limites de taxa (limites de uso).

Barrada antes de qualquer saída: cobrada

bio, frontier_llm, reasoning_extraction. A explicação oficial é que essas categorias têm poucos falsos positivos (em setembro de 2026).

Barrada antes de qualquer saída: não cobrada

cyber, general_harms ou quando não há categoria (null).

Barrada no meio da resposta

A entrada e a saída transmitida até a parada são cobradas pelos preços normais.

A resposta no modelo substituto

Cobrada à parte, pelos preços do modelo substituto. O custo da perda do cache é compensado com créditos.

Se você usa uma assinatura, o efeito aparece na velocidade com que seu limite de uso se esgota. O autor da #97335 relata que o cache de prompt gravado por uma solicitação barrada não foi usado pela solicitação seguinte; assim, numa conversa longa de cerca de 700 mil tokens, cada parada significava regravar a conversa inteira. Ele observou que quatro recusas esgotaram a janela de 5 horas de um plano Pro. É um relato não confirmado pela Anthropic, mas, se você continua sendo barrado numa conversa longa, trocar com /clear gasta menos do seu limite do que insistir na mesma conversa.

Operações de arquivo pela metade podem ficar para trás

A documentação da API pede que a saída de uma resposta interrompida no meio seja descartada como incompleta. A nota que o Claude Code acrescenta à conversa depois de ser barrado, no texto colado na #97335, também diz que as chamadas de ferramentas que não tinham terminado não foram executadas.

Porém, a #97311 relata quatro casos em que o modelo foi barrado enquanto escrevia uma edição de arquivo (Edit), uma gravação de arquivo (Write) ou uma chamada de Bash, e o conteúdo truncado foi executado do jeito que estava (v2.1.219–2.1.280, numa única máquina Linux). No Edit e no Write, aparecia "sucesso", mas o arquivo gravado ou as linhas reescritas estavam cortados no meio. Ainda não há resposta oficial, mas, logo depois de ser barrado, o mais seguro é conferir as alterações com git diff antes de seguir, como no passo 2 da seção 6.

# Lista os arquivos alterados
git status

# Examina o conteúdo em busca de edições cortadas no meio
git diff

# Restaura um arquivo ao estado do último commit (depois de conferir)
git restore path/to/file

Alterações feitas com as ferramentas de edição de arquivos do Claude Code também podem ser desfeitas com o retrocesso de checkpoints. No entanto, arquivos reescritos via Bash não são cobertos pelo retrocesso.

9. O que está confirmado e o que não está

✅ Confirmado oficialmente

  • Os classificadores rodam no lado do servidor; as atualizações do Claude Code mudaram só o texto
  • Eles não olham a última frase, e sim tudo o que foi lido: a conversa, os arquivos, o CLAUDE.md etc.
  • Conversas seguras e normais também podem ser barradas
  • reasoning_extraction não troca para outro modelo
  • Em 29 de setembro, o CVP não cobre o Opus 5.5 nem o Sonnet 5.5
  • Desde a v2.1.282, um /compact recusado é tentado de novo no modelo substituto

🟡 Relatado, mas não confirmado

  • Ser barrado só por "hi" ou "ola" (#96298, #96495, #97560)
  • Depois de uma parada, as sessões que leem aquela conversa continuam sendo barradas (#96874, #97452)
  • Operações de arquivo truncadas são executadas (#97311)
  • O cache de uma solicitação barrada não é reaproveitado (#97335)

🔴 Não divulgado

  • A que cada mensagem reagiu
  • Se as vezes em que você foi barrado por falsos positivos afetam o tratamento da sua conta
  • A data em que o CVP será estendido ao Opus 5.5 e ao Sonnet 5.5
  • O texto do aviso do Sonnet alterado na v2.1.284

10. Resumo

"safeguards flagged this message" significa que o classificador de segurança do modelo reagiu ao conteúdo da conversa e impediu que aquele modelo respondesse. Os classificadores rodam no lado do servidor e olham não só a última mensagem, mas a conversa inteira, os arquivos lidos e até o CLAUDE.md. Tanto a própria mensagem quanto a documentação oficial reconhecem que conversas comuns também podem ser barradas.

Quando for barrado, olhe primeiro a categoria em Details: e, se havia uma operação de arquivo em andamento, confira com git diff. Depois tente, nesta ordem: voltar com Esc duas vezes e reformular, começar uma conversa nova com /clear e trocar de modelo com /model. Se o [cyber] está travando seu trabalho, o CVP é uma opção, mas, em 29 de setembro, o Opus 5.5 e o Sonnet 5.5 ainda não estão cobertos. Para a visão geral das salvaguardas do lado do modelo, veja nosso guia do Opus 5.5; para outras mensagens do tipo "barrado por um filtro", veja nosso artigo sobre The model returned no content; e para outros erros, veja nosso resumo dos erros comuns do Claude Code e como resolvê-los.

FAQ

Q. O que significa "safeguards flagged this message"?
A. Significa que o classificador de segurança do modelo que você estava usando (como o Opus 5.5 ou o Fable 5.1) reagiu ao conteúdo da conversa e interrompeu a resposta. Não é um defeito do Claude Code nem um erro de rede. Details:, na última linha, traz o nome da categoria que reagiu.

Q. Só mandei "hi" e fui barrado. O que eu fiz de errado?
A. Sua última mensagem não é necessariamente a causa. Os classificadores olham a conversa inteira, os arquivos lidos e até o CLAUDE.md e o git status. Se você iniciar com claude --safe-mode e não for barrado, é possível que ele tenha reagido ao conteúdo das configurações ou dos arquivos que estavam sendo carregados. Se achar que é um falso positivo, informe com /feedback.

Q. Minha conta pode ser suspensa?
A. A documentação do Claude Code diz que a troca de modelo durante trabalhos de segurança ou biologia é um roteamento esperado, e não uma marcação da conta. Por outro lado, um artigo da Central de Ajuda diz que usuários que violam as políticas repetidamente podem ter filtros mais fortes aplicados temporariamente, e não foi divulgado se os falsos positivos contam para isso.

Q. Por que sou barrado mesmo tendo aprovação no CVP?
A. Porque, em 29 de setembro de 2026, o CVP não se aplica ao Opus 5.5 nem ao Sonnet 5.5. A Anthropic diz que ele será estendido em breve. A Anthropic também escreve que organizações que já usam o Opus 4.8 pelo CVP podem usar o Opus 5 com menos restrições de cyber, então, por enquanto, a alternativa é escolher o Opus 5 ou o Opus 4.8 com /model. Confira também se o ID de organização vinculado à sua aprovação é o mesmo da organização que você está usando.

Q. Continuo sendo barrado na mesma conversa, não importa o que eu mande. O que fazer?
A. Enquanto o conteúdo sinalizado permanecer na conversa, qualquer coisa que você enviar tende a receber o mesmo julgamento. Pressione Esc duas vezes para voltar a um turno anterior à parada ou comece uma conversa nova com /clear. Você pode abrir a conversa original com /resume, mas retomá-la traz o conteúdo sinalizado de volta.

Fontes primárias consultadas