«safeguards flagged this message» significa que un clasificador de seguridad (classifier) asociado al modelo de Claude reaccionó al contenido de tu conversación y detuvo la respuesta de ese modelo. No es un fallo de Claude Code ni un error de red. Puede aparecer no solo al trabajar en ciberseguridad o biología, sino también con peticiones corrientes, como un saludo o la planificación de una tarea, y la propia Anthropic reconoce que puede haber falsos positivos.

El mensaje empieza con el nombre del modelo que se detuvo. En las Issues de GitHub abiertas entre el 22 y el 29 de septiembre de 2026, el texto que se veía en pantalla era sobre todo uno de estos dos (los saltos de línea no son exactamente los de la pantalla).

API Error: Opus 5.5's safeguards flagged this message (https://www.anthropic.com/legal/aup). This sometimes happens with safe, normal conversations. Claude Code can't respond to this message with Opus 5.5.

Double press esc to edit your last message, or try a different model with /model.

Send feedback with /feedback or learn more: https://support.claude.com/en/articles/8106465

Details: `[reasoning_extraction]`
API Error: Opus 5.5's safeguards flagged this session (https://www.anthropic.com/legal/aup). You may be seeing this for the first time on an Opus model: Opus 5.5 is more capable and has stronger safeguards as a result, which can sometimes flag non-cybersecurity work. We're improving these safeguards to reduce the amount of incorrectly flagged messages. Claude Code can't respond to your last message with Opus 5.5.

Double press esc to edit your last message, or try a different model with /model.

Send feedback with /feedback or learn more: https://support.claude.com/en/articles/8106465

Details: `[cyber]`

En los títulos de las Issues suele aparecer «Message flagged by safeguards», pero lo que se ve en pantalla es el texto de arriba. La parte Opus 5.5 cambia a Fable 5.1, Opus 5, Opus 4.8, etc., según el modelo que estuvieras usando.

Mira primero la última línea, «Details:»

Lo que funciona depende del clasificador que te detuvo

[reasoning_extraction]
Se consideró que intentabas extraer el razonamiento interno del modelo
→ Reformular y volver a enviar
No hay cambio automático a otro modelo
[cyber]
Se consideró un trabajo que podría servir para un ciberataque
→ Seguir con el modelo de respaldo
Si es trabajo profesional, comprueba si te corresponde el CVP
[bio]
Se consideró que podía tratarse de usos peligrosos de la biología
→ Ver cómo lo trata cada modelo
Hay un programa de verificación para organizaciones de investigación
[general_harms] / [frontier_llm]
Se consideró que entraba en otros ámbitos de la política de uso o en el desarrollo de IA de frontera
→ Ver qué significan las categorías
Si es un falso positivo, notifícalo con /feedback
Diagrama basado en las categorías de la documentación oficial de la API de Claude «Refusals and fallback» y en las explicaciones de la documentación de configuración de modelos de Claude Code y del Centro de ayuda.

1. Qué significa el mensaje: lo detuvo un clasificador que leyó la conversación

Según la documentación oficial de la API de Claude «Refusals and fallback», Fable 5.1, Fable 5, Opus 5.5, Opus 5 y Sonnet 5.5 llevan clasificadores de seguridad que pueden rechazar solicitudes. Cuando uno rechaza, la API no devuelve un error, sino una respuesta normal (HTTP 200), con el motivo de parada stop_reason: "refusal" y el ámbito del rechazo en stop_details.category. Claude Code lo recibe y lo muestra como un mensaje que empieza por «API Error:».

Lo importante es que el clasificador no mira solo la última frase que enviaste. El artículo del Centro de ayuda que explica las salvaguardas de Opus 5.5 dice que los clasificadores miran todo lo que lee el modelo. Eso incluye la memoria, el contenido de los conectores, los resultados de búsquedas web y los archivos, así que puedes quedarte detenido por contenido que ni siquiera escribiste tú.

Tus instrucciones

El último mensaje que enviaste y todo el intercambio anterior.

Lo que ha leído Claude

Archivos que abrió, la salida de comandos, resultados de búsquedas web y contenido que llega por MCP o conectores.

Contexto adjunto desde el inicio

La información del espacio de trabajo que Claude Code añade a la primera solicitud, como el contenido de CLAUDE.md y git status.

La propia salida del modelo

También puede detenerse a mitad de la respuesta. En ese caso, lo que se había transmitido hasta entonces también se trata como incompleto.

Sobre el tercer punto, la documentación de configuración de modelos de Claude Code dice expresamente que un clasificador puede activarse en la primera solicitud de una sesión, antes de que hayas enviado nada fuera de lo normal. Como la primera solicitud incluye el contenido de CLAUDE.md y git status, un repositorio que contenga material de seguridad o de biología puede activar el clasificador solo con esa información: esa es la explicación. El cuarto punto se corresponde con lo que dice la documentación de la API: un rechazo puede llegar antes de la salida o en mitad de ella y, en ambos casos, la salida parcial debe descartarse por incompleta.

2. El texto cambia según el modelo y la versión

El mismo mecanismo produce varios textos distintos. El ejemplo actual que recoge la referencia de errores oficial es este.

API Error: Opus 4.8's safeguards flagged this message. Our intentionally broad safeguards allow us to deliver more capabilities faster, but can sometimes flag legitimate cybersecurity work. Apply to the Cyber Verification Program to reduce these interruptions. Send feedback with /feedback or learn more: https://support.claude.com/en/articles/14604842-real-time-cyber-safeguards-on-claude

La referencia de errores añade que, en Opus 5.5 y Sonnet 5.5, el mensaje empieza por <model>'s safeguards flagged this session. Los dos mensajes citados al principio de este artículo se pegaron en Issues abiertas a partir del 22 de septiembre de 2026. En lo que leímos, el mensaje flagged this session venía con [cyber] o [bio], mientras que el mensaje This sometimes happens with safe, normal conversations venía sobre todo con [reasoning_extraction].

Cómo empieza el mensajeDónde se confirmóQué viene después
<model>'s safeguards flagged this message. Our intentionally broad safeguards…Referencia de errores oficial (en las Issues se notificó junto con [cyber])Una indicación para solicitar el CVP (cuando hay cambio, también aparece el modelo de respaldo, como en Switched to Opus 4.8.)
<model>'s safeguards flagged this sessionReferencia de errores oficial (Opus 5.5 y Sonnet 5.5) e Issues de v2.1.280–2.1.283Una explicación de que quizá lo veas por primera vez en un modelo Opus porque es más capaz y, por eso, tiene salvaguardas más estrictas
<model>'s safeguards flagged this message (…aup). This sometimes happens…Issues de v2.1.278–2.1.284 (sin ejemplo en la referencia oficial)Dice que «a veces ocurre con conversaciones seguras y normales» y sugiere editar con Esc o usar /model
<model> has safety measures that flagged this message for a cybersecurity topicReferencia de errores oficial (texto antiguo, v2.1.203–2.1.218)Un enlace al Centro de ayuda (antes de v2.1.203, un enlace al formulario de solicitud de excepción)
<model> can't help with this. Start a new session to continue.Referencia de errores oficial (Usage Policy refusal)Un rechazo de la comprobación de la política de uso (Usage Policy) (en Amazon Bedrock, Agent Platform de Google Cloud y Microsoft Foundry, las detecciones de ciberseguridad también usan este texto)

La referencia de errores dice que los clasificadores en sí funcionan en el servidor y ya existían antes de v2.1.203; lo que cambiaron las actualizaciones posteriores de Claude Code fue solo el texto del mensaje. No es que actualizar Claude Code haya hecho que empiecen a detenerte.

Qué cambió en v2.1.284

El CHANGELOG de v2.1.284, publicada el 28 de septiembre de 2026, tiene dos entradas relacionadas con este mensaje.

  • Se cambió el aviso que aparece cuando las salvaguardas de un modelo Sonnet marcan un mensaje, para que explique por qué ocurrió y ofrezca la opción de editarlo y volver a enviarlo.
  • Se cambió el cambio de modelo provocado por las salvaguardas en las sesiones que fijan un modelo Opus con ANTHROPIC_DEFAULT_OPUS_MODEL o modelOverrides. En la API de Anthropic, ahora es la API la que elige el modelo de respaldo según el tipo de detección, en lugar de usar el modelo fijado.

A 29 de septiembre, el texto del nuevo aviso de Sonnet no figuraba en la referencia de errores oficial y no se había pegado en ninguna de las Issues que leímos.

3. Las categorías de Details y si se cambia de modelo

La palabra que aparece en Details: al final del mensaje coincide con el valor de stop_details.category que devuelve la API. La documentación de la API enumera cinco categorías. Ten en cuenta que todas, salvo reasoning_extraction, llevan una nota que advierte de que también pueden activarse con trabajo inofensivo.

DetailsDescripción oficial (resumen)Cómo lo trata Claude Code
cyberPodría servir para ciberataques, como desarrollar malware o exploitsFable 5.1, Fable 5, Opus 5.5 y Opus 5 cambian a Opus 4.8, y Sonnet 5.5 cambia a Sonnet 5, y se reenvía la misma solicitud
bioPodría causar daños biológicos, como técnicas de laboratorio peligrosasFable 5.1, Fable 5 y Opus 5.5 cambian a Opus 5; Opus 5 y Sonnet 5.5 no tienen modelo de respaldo y terminan en un rechazo
frontier_llmPodría ayudar a desarrollar modelos de IA de la competencia (restringido por las condiciones comerciales)Según el Centro de ayuda, Opus 5.5 cambia a Opus 5 (Opus 5 no cambia en esta categoría)
reasoning_extractionIntenta que el razonamiento interno del modelo se reproduzca como texto de la respuestaEs la categoría de «destilación» (distillation) del Centro de ayuda; no cambia a otro modelo y se detiene ahí mismo
general_harmsEntra en un ámbito de la política de uso distinto de los cuatro anterioresLa documentación de Claude Code no indica ningún modelo de respaldo

Fuentes: la tabla de categorías de «Refusals and fallback» de la API de Claude, el apartado Automatic model fallback de «Model configuration» de Claude Code y el artículo del Centro de ayuda «Why Claude switched models in your conversation with Opus 5 or Opus 5.5» (todo comprobado el 29 de septiembre de 2026).

Cuando hay un cambio de modelo

Por defecto, cuando Claude Code se detiene en una categoría que tiene modelo de respaldo, reenvía automáticamente la misma solicitud con el modelo de respaldo y publica un aviso en la conversación. El resto de la sesión continúa con el modelo de respaldo. Para volver al modelo original, vuelve a elegirlo con /model.

Aun así, el Centro de ayuda advierte de que, aunque vuelvas al modelo original, las mismas salvaguardas pueden cambiarte de nuevo si la solicitud marcada sigue en la conversación, y de que editar el mensaje anterior antes de reenviarlo suele ayudar. Las situaciones típicas en las que el cambio no sirve y acabas detenido con un mensaje como los del principio son: detenerse en una categoría sin modelo de respaldo, como reasoning_extraction; que también se detenga el modelo de respaldo; que el modelo de respaldo no esté permitido por availableModels, y trabajar en un modo no interactivo como -p con el ajuste «preguntar antes de cambiar» activado.

4. ¿Hiciste algo mal? Lo que dice Anthropic sobre los falsos positivos

Si sientes que «no he hecho nada malo y aun así me ha detenido», es perfectamente posible. La documentación de Anthropic reconoce con claridad los falsos positivos en varios lugares.

✅ Lo que dice la documentación oficial

  • El propio mensaje: «This sometimes happens with safe, normal conversations» (a veces ocurre con conversaciones seguras y normales) e «intentionally broad safeguards» (salvaguardas deliberadamente amplias)
  • La documentación de la API: cyber, bio, frontier_llm y general_harms llevan cada una una nota de que también pueden activarse con trabajo inofensivo
  • La documentación de Claude Code: en trabajos de seguridad ofensiva o de biología, el cambio suele producirse desde la primera solicitud; en estos ámbitos es el enrutamiento esperado, no una marca en la cuenta (account flag)
  • El Centro de ayuda: los clasificadores se están ajustando para reducir los falsos positivos y también tendrán en cuenta diversas señales de la fiabilidad de la cuenta
  • La explicación del CVP: incluso a los usuarios aprobados se les puede detener un trabajo legítimo

Por otro lado, el artículo del Centro de ayuda enlazado desde el mensaje (Our Approach to User Safety) dice que a los usuarios que infringen las políticas de forma reiterada se les pueden aplicar temporalmente filtros de seguridad con una detección más sensible. No se dice oficialmente si las veces que te detuvo un falso positivo cuentan para esto. Después de una detención, es más prudente cambiar de conversación con los pasos de la sección 6 que seguir lanzando la misma petición cambiando solo la redacción.

Cómo interpretar una detención por reasoning_extraction

El Centro de ayuda pone ejemplos de lo que detiene esta categoría: pedir que repita su razonamiento palabra por palabra o que vuelque toda su cadena de pensamiento (chain of thought) en una salida externa. En cambio, dice que sí puedes pedirle a Claude que explique su razonamiento, que enseñe un concepto o que recorra paso a paso una revisión de código, y que las preguntas conversacionales como «¿por qué hiciste eso?» no se ven afectadas.

Al leer las Issues, hubo casos en los que la detención llegó justo después de peticiones como las siguientes. Todas son notificaciones de usuarios, y Anthropic no ha explicado por qué reaccionó el clasificador.

  • Preguntó si la pantalla podía mostrar su «pensamiento» en lugar de las llamadas a herramientas (#96118)
  • Pidió a un subagente que citara, de su contexto, la línea con el nombre del modelo en el que se ejecutaba (#96139)
  • Al final de una tarea larga, le pidió que escribiera un resumen de la sesión en un archivo (#96874)
  • Le pidió que anotara en un diagrama de diseño, para cada decisión, «las opciones consideradas y por qué se descartaron» (#98108)

Lo que tienen en común es pedirle al modelo que vuelque tal cual «su proceso de pensamiento» o «su propio contexto». Si lo necesitas como entregable, pasar a una redacción que pida un resumen breve del resultado, como «la conclusión y los motivos para elegirla, en tres líneas», acerca la petición al lado de «explicar su razonamiento» que Anthropic describe como permitido. Aun así, hay casos como la notificación adicional en #96118, donde una pregunta breve en alemán bastó para que se detuviera, así que reformular no garantiza evitarlo.

5. Casos notificados desde el 22 de septiembre

Desde que se lanzó Opus 5.5, el 22 de septiembre de 2026, las notificaciones de este tipo se han ido acumulando en las Issues de anthropics/claude-code. Al contarlas con la búsqueda de GitHub el 29 de septiembre, había 67 Issues creadas entre el 22 y el 28 de septiembre que contenían «safeguards» en el título o el cuerpo (de 7 a 12 al día; la cifra cambia según los términos de búsqueda). En las Issues del 22 de septiembre en adelante que leímos no encontramos respuestas del personal de Anthropic, y muchas llevaban la etiqueta «duplicate».

🟡 Casos notificados en GitHub cuya causa no se ha establecido (comprobado el 29 de septiembre de 2026)

  • Detenido con solo un saludo: «hi» se consideró [cyber] y cambió a Opus 4.8 (#96298), «ola» se detuvo (#96495) y «hi» recibió [reasoning_extraction] (#97560). El autor de #96495 supone que pudo influir el hecho de usar Kali Linux como root.
  • Detenido durante /compact: el mensaje de [reasoning_extraction] apareció en mitad de la compactación de la conversación (#96648, v2.1.281).
  • Tras una detención, toda la conversación queda inservible: todos los mensajes posteriores de la misma sesión se detuvieron (#96874), y la frase marcada se quedó en el registro de la conversación, de modo que las sesiones posteriores que lo leían también se detenían (#97452).
  • Se detienen subagentes: un recuento en una sola máquina encontró que 14 de 866 subagentes de Opus 5 (1,62 %) se detuvieron con [reasoning_extraction]. Todos los detenidos eran peticiones de tipo revisión (#97492).
  • Detenidos incluso con la aprobación del CVP: usuarios aprobados recibieron igualmente [cyber] en Opus 5.5 (#96090, #96298, #96592, #97946). Como explica la sección 7, esto coincide con la explicación oficial.
  • Detenidos al trabajar en sus propios equipos o su propio código: investigar un «Permission denied» de SSH en los sistemas de su propia empresa (#97373), desensamblar un binario de un producto de su propia empresa (#97891) y eliminar credenciales escritas directamente en el código fuente (#97605).

Los casos detenidos con solo un saludo podrían explicarse con lo que dice la documentación oficial citada en la sección 1: «los clasificadores miran toda la conversación y la información del espacio de trabajo». La idea es que, aunque el último mensaje fuera inofensivo, el clasificador reaccionó a CLAUDE.md, al intercambio anterior o a archivos que se habían leído. Sin embargo, ninguna notificación muestra a qué reaccionó, y no se ha publicado ninguna forma de comprobarlo.

6. Qué hacer cuando te detiene

Estos son los pasos que recogen la referencia de errores oficial y la documentación de configuración de modelos, ordenados de menor a mayor esfuerzo. Si solo ha pasado una vez, normalmente bastará con el paso 3.

01

Revisa Details y si el modelo cambió

Si ves Switched to o un aviso de cambio, tu trabajo ya continúa con otro modelo. Si sigue detenido, compara la categoría de Details: con la tabla de la sección 3.

02

Revisa las operaciones de archivos que estaban en curso

Si se detuvo a mitad de la respuesta, la salida hasta ese punto está incompleta. Usa primero git status y git diff para ver si quedaron cambios a medio escribir (sección 8).

03

Pulsa Esc dos veces para volver atrás y envíalo de otra forma

Si pulsas Esc dos veces con el cuadro de entrada vacío, o ejecutas /rewind, se abre el menú para retroceder. Elige un punto anterior al turno detenido, cambia cómo redactas o enfocas la petición y vuelve a enviarla. Es el primer remedio que Anthropic indica para este mensaje.

04

Si no sabes qué turno lo causó, empieza una conversación nueva

Usa /clear para empezar una conversación nueva en el mismo proyecto. La conversación original no se borra y puede abrirse desde /resume. Sin embargo, si retomas la conversación original con --continue o --resume, el contenido marcado vuelve con ella, así que es probable que te detenga de la misma forma.

05

Cambia a otro modelo con /model

El propio mensaje recomienda «try a different model with /model» (probar otro modelo con /model). Es porque cada modelo lleva clasificadores distintos. Por ejemplo, el anuncio de Sonnet 5.5 dice que es el primer Sonnet que sale con un clasificador que protege contra la extracción del razonamiento, y el Sonnet 5 de la generación anterior no tiene este clasificador.

06

Averigua si la causa es CLAUDE.md u otro archivo similar

Si te detiene desde el primer mensaje, arranca con claude --safe-mode. Se inicia sin cargar CLAUDE.md, skills, servidores MCP ni hooks, así que, si así no te detiene, algo de lo que se estaba cargando contenía lo que lo activó. En este modo se siguen enviando git status y el nombre del directorio.

07

Si es un falso positivo, notifícalo con /feedback

Anthropic aconseja que, si no se trataba de un tema de ciberseguridad, notifiques el falso positivo con /feedback. El Request ID y el Message ID que aparecen en el mensaje son útiles al notificarlo. El registro de la conversación contiene el código con el que trabajabas y rutas de archivos, así que, si lo publicas en un lugar público como GitHub, pega solo las líneas necesarias.

Si prefieres elegir cada vez en lugar de cambiar automáticamente

Si notas que la calidad del trabajo baja con el modelo de respaldo, desactiva «Switch models when a message is flagged» en /config o escribe lo siguiente en tu archivo de configuración. A partir de entonces, la sesión se pausará cada vez que la detengan y te dejará elegir entre cambiar al modelo de respaldo o editar el prompt para reenviarlo con el modelo actual.

{
  "switchModelsOnFlag": false
}

Sin embargo, en las categorías sin modelo de respaldo (como bio en Sonnet 5.5 u Opus 5) no se ofrece ninguna opción y termina en un rechazo. En el modo no interactivo -p y en las integraciones con el SDK que no pueden mostrar una pregunta, el turno detenido también termina en un rechazo. En las sesiones en la nube que se usan desde la app para móvil, no está disponible la opción de editar y volver a enviar.

Si se detiene durante /compact

Compactar una conversación también hace que el modelo lea toda la conversación, así que también puede detenerse (#96648). El CHANGELOG de v2.1.282 dice que se corrigió el fallo de la compactación cuando se rechazaba la solicitud de resumen y que ahora se reintenta con el modelo de respaldo. Si claude --version muestra una versión anterior a 2.1.282, actualiza primero con claude update. Cuándo merece la pena compactar lo explicamos en nuestro artículo sobre cuándo ejecutar /compact.

7. ¿Sirve el Cyber Verification Program (CVP)?

El CVP es un programa gratuito de solicitud que hace menos probable que las salvaguardas detengan a quienes trabajan en ciberseguridad con fines defensivos legítimos. El artículo del Centro de ayuda sobre el CVP divide en dos tipos el trabajo que se detiene.

Uso prohibido (Prohibited use)

Trabajo que se usa casi exclusivamente para abusos, como la exfiltración masiva de datos o el desarrollo de ransomware. Se detiene incluso con la aprobación del CVP.

Doble uso de alto riesgo (High Risk Dual use)

Trabajo que también puede servir para la defensa, como explotar vulnerabilidades o desarrollar herramientas ofensivas. Se detiene por defecto, pero puedes solicitar a través del CVP que se flexibilice.

La clave es que, a 29 de septiembre de 2026, el CVP no se aplica a Opus 5.5 ni a Sonnet 5.5. El artículo del CVP dice al principio que se aplica a los modelos Opus y Sonnet, pero no a Opus 5.5 ni a Sonnet 5.5, y que pronto se ampliará a Opus 5.5, Sonnet 5.5 y los modelos de la clase Mythos. Tanto el anuncio de Opus 5.5 como el de Sonnet 5.5 describen también la ampliación del CVP como algo que llegará «pronto». Las notificaciones que vimos en la sección 5 de «aprobado en el CVP pero detenido igualmente en Opus 5.5» encajan con esta explicación.

El artículo del Centro de ayuda sobre Opus 5.5 ofrece una pista más: una frase que dice que las organizaciones que ya usan Opus 4.8 a través del CVP pueden empezar a usar de inmediato Opus 5, que tiene menos restricciones de ciberseguridad. Si tienes la aprobación y Opus 5.5 te sigue deteniendo, elegir por ahora Opus 5 u Opus 4.8 con /model es la solución provisional que se ajusta a la explicación oficial.

Qué comprobarQué dice el Centro de ayuda
Quién puede solicitarloSe solicita a través del Verification Portal (Claude.ai, Claude Code, API de Anthropic) / solo los administradores con los permisos adecuados ven la pantalla de solicitud / se exige verificación de identidad / el objetivo es comunicar el resultado de la revisión por correo en un plazo de 2 días hábiles
Entornos no incluidosLas organizaciones con Zero Data Retention (ZDR) no pueden optar por ahora / no se ofrece en Amazon Bedrock
Si te sigue deteniendo tras la aprobaciónLa aprobación está ligada a un ID de organización concreto, así que compáralo con el ID de organización del correo de aprobación para asegurarte de que no usas otra organización, como un espacio de trabajo personal / el uso prohibido se detiene incluso tras la aprobación
Si algo sigue sin cuadrarPuedes notificar un falso positivo o recurrir un rechazo con el formulario del artículo

Para las organizaciones cuya investigación biológica se detiene con [bio], existe un programa de verificación aparte llamado Life Sciences Verification Program (LSVP). El anuncio de Opus 5.5 dice que las organizaciones que superen la revisión pueden usar Opus 5.5 en su investigación.

8. La facturación de las solicitudes detenidas y el trabajo a medias

La facturación depende de la categoría y del momento en que se detuvo

Según la documentación de la API y el Centro de ayuda, las solicitudes detenidas se facturan así. En todos los casos, cuentan para tus límites de frecuencia (límites de uso).

Detenida antes de cualquier salida: se factura

bio, frontier_llm, reasoning_extraction. La explicación oficial es que estas categorías tienen pocos falsos positivos (a septiembre de 2026).

Detenida antes de cualquier salida: no se factura

cyber, general_harms o cuando no hay categoría (null).

Detenida a mitad de la respuesta

La entrada y la salida transmitida antes de la detención se facturan a la tarifa normal.

La respuesta del modelo de respaldo

Se factura aparte, a la tarifa del modelo de respaldo. El coste de perder la caché se compensa con créditos.

Si usas una suscripción, el efecto se nota en lo rápido que se agota tu límite de uso. El autor de #97335 escribe que la caché de prompts escrita por una solicitud detenida no se usó en la siguiente solicitud, de modo que, en una conversación larga de unos 700.000 tokens, cada detención obligaba a reescribir la conversación entera. Observó que agotó la ventana de 5 horas de un plan Pro con cuatro rechazos. Es una notificación no confirmada por Anthropic, pero si una conversación larga te sigue deteniendo, cambiar con /clear te cuesta menos límite que insistir en la misma conversación.

Pueden quedar operaciones de archivos a medias

La documentación de la API pide que la salida de una respuesta detenida a mitad se descarte por incompleta. La nota que Claude Code añade a la conversación tras la detención, en el texto pegado en #97335, también dice que las llamadas a herramientas que no habían terminado no se ejecutaron.

Sin embargo, #97311 notifica cuatro casos en los que el modelo se detuvo mientras escribía una edición de archivo (Edit), una escritura de archivo (Write) o una llamada a Bash, y el contenido cortado se ejecutó tal cual (v2.1.219–2.1.280, en una sola máquina Linux). En Edit y Write se mostró «éxito», pero el archivo escrito o las líneas reescritas estaban cortados a medias. Aún no hay respuesta oficial, pero justo después de una detención lo más seguro es revisar los cambios con git diff antes de seguir, como en el paso 2 de la sección 6.

# Enumera los archivos que cambiaron
git status

# Revisa el contenido por si hay ediciones cortadas a medias
git diff

# Restaura un archivo a su estado del último commit (tras comprobarlo)
git restore path/to/file

Los cambios hechos con las herramientas de edición de archivos de Claude Code también se pueden deshacer con el retroceso a un punto de control. Sin embargo, los archivos reescritos mediante Bash no están cubiertos por el retroceso.

9. Qué está confirmado y qué no

✅ Confirmado oficialmente

  • Los clasificadores funcionan en el servidor; las actualizaciones de Claude Code solo cambiaron el texto
  • No miran la última frase, sino todo lo leído: la conversación, los archivos, CLAUDE.md, etc.
  • También pueden detenerse conversaciones seguras y normales
  • reasoning_extraction no cambia a otro modelo
  • A 29 de septiembre, el CVP no cubre Opus 5.5 ni Sonnet 5.5
  • Desde v2.1.282, un /compact rechazado se reintenta con el modelo de respaldo

🟡 Notificado pero sin confirmar

  • Detenerse con solo «hi» u «ola» (#96298, #96495, #97560)
  • Tras una detención, las sesiones que leen esa conversación siguen deteniéndose (#96874, #97452)
  • Se ejecutan operaciones de archivos cortadas (#97311)
  • La caché de una solicitud detenida no se reutiliza (#97335)

🔴 No revelado

  • A qué reaccionó cada mensaje concreto
  • Si las veces que te detuvo un falso positivo afectan al trato que recibe tu cuenta
  • La fecha en que el CVP se ampliará a Opus 5.5 y Sonnet 5.5
  • El texto del aviso de Sonnet cambiado en v2.1.284

10. Resumen

«safeguards flagged this message» significa que el clasificador de seguridad del modelo reaccionó al contenido de la conversación y detuvo la respuesta de ese modelo. Los clasificadores funcionan en el servidor y no miran solo el último mensaje, sino toda la conversación, los archivos leídos e incluso CLAUDE.md. Tanto el propio mensaje como la documentación oficial reconocen que también pueden detenerse conversaciones corrientes.

Cuando te detenga, mira primero la categoría de Details: y, si había una operación de archivos en curso, revísala con git diff. Después prueba, por este orden: volver atrás con Esc dos veces y reformular, empezar una conversación nueva con /clear y cambiar de modelo con /model. Si [cyber] te bloquea el trabajo, el CVP es una opción, pero a 29 de septiembre Opus 5.5 y Sonnet 5.5 aún no están cubiertos. Para una visión general de las salvaguardas del lado del modelo, consulta nuestro análisis de Opus 5.5; para otros mensajes de «bloqueado por un filtro», nuestro artículo sobre The model returned no content, y para otros errores, nuestro repaso de los errores habituales de Claude Code y sus soluciones.

Preguntas frecuentes

P. ¿Qué significa «safeguards flagged this message»?
R. Significa que el clasificador de seguridad del modelo que estabas usando (como Opus 5.5 o Fable 5.1) reaccionó al contenido de la conversación y detuvo la respuesta. No es una avería de Claude Code ni un error de red. Details:, en la última línea, contiene el nombre de la categoría que reaccionó.

P. Solo envié «hi» y me detuvo. ¿Qué hice mal?
R. Tu último mensaje no tiene por qué ser la causa. Los clasificadores miran toda la conversación, los archivos leídos e incluso CLAUDE.md y git status. Si arrancas con claude --safe-mode y no te detiene, puede que reaccionara al contenido de la configuración o de los archivos que se cargaban. Si crees que es un falso positivo, notifícalo con /feedback.

P. ¿Pueden suspender mi cuenta?
R. La documentación de Claude Code dice que los cambios de modelo durante trabajos de seguridad o biología son el enrutamiento esperado, no una marca en la cuenta. Por otro lado, un artículo del Centro de ayuda dice que a los usuarios que infringen las políticas de forma reiterada se les pueden aplicar temporalmente filtros más estrictos, y no se ha revelado si los falsos positivos cuentan para eso.

P. ¿Por qué me detiene aunque tengo la aprobación del CVP?
R. Porque, a 29 de septiembre de 2026, el CVP no se aplica a Opus 5.5 ni a Sonnet 5.5. Anthropic dice que se ampliará pronto. También escribe que las organizaciones que ya usan Opus 4.8 a través del CVP pueden usar Opus 5 con menos restricciones de ciberseguridad, así que, por ahora, la solución provisional es elegir Opus 5 u Opus 4.8 con /model. Comprueba también que el ID de organización ligado a tu aprobación coincide con la organización que estás usando.

P. En la misma conversación me detiene envíe lo que envíe. ¿Qué hago?
R. Mientras el contenido marcado siga en la conversación, cualquier cosa que envíes tiende a recibir el mismo dictamen. Pulsa Esc dos veces para volver a un turno anterior a la detención o empieza una conversación nueva con /clear. Puedes abrir la conversación original con /resume, pero al retomarla vuelve con ella el contenido marcado.

Fuentes primarias consultadas