🚨 NeuralTrust levanta 20M$
Volver

Claude Opus 5: Seguridad y protección: lo que realmente dice la System Card (y lo que significa si la implementas)

Alessandro Pignati 28 de julio de 2026
Compartir
Claude Opus 5: Seguridad y protección: lo que realmente dice la System Card (y lo que significa si la implementas)

Anthropic lanzó Claude Opus 5 el 24 de julio de 2026 y publicó una extensa system card junto con el modelo. La mayor parte de la cobertura se centrará en la historia de las capacidades. Opus 5 es una mejora sobre Opus 4.8, con avances en codificación agéntica, uso de ordenador, trabajo de conocimiento de largo horizonte y razonamiento matemático y científico. Pero aproximadamente dos tercios del documento tratan sobre seguridad y protección: evaluaciones de escalado responsable, capacidades cibernéticas, salvaguardas, robustez agéntica y una evaluación detallada de la alineación.

Este artículo lee esa mitad de la card desde el punto de vista de un equipo de seguridad. No "¿es seguro Opus 5?" en abstracto, sino la pregunta más útil para cualquiera que lo ponga en producción: ¿qué midió realmente Anthropic, dónde están las debilidades residuales y qué sigue siendo tu responsabilidad una vez que el modelo abandona su entorno? Un tema recorre toda la card y vale la pena destacarlo desde el principio. El modelo se comporta de forma medible más segura en la propia superficie de consumo de Anthropic (claude.ai) que como modelo en crudo en la API, y Anthropic lo dice de forma explícita.

TLDR

  • Riesgo de alineación: muy bajo. En la auditoría conductual automatizada de Anthropic, Opus 5 se describe como su modelo más alineado hasta la fecha, con una puntuación superior a Sonnet 5, Opus 4.8 y Mythos 5, y una puntuación particularmente alta en adherencia a la constitución de Claude.
  • No se cruzan nuevos umbrales catastróficos. Opus 5 no cruza el umbral automatizado de I+D de IA y se trata como CB-1 (ayuda con armas biológicas/químicas no novedosas) pero no CB-2 (armas novedosas). Mantiene las mismas protecciones ASL-3 que Opus 4.8.
  • Ciberseguridad: más fuerte que Opus 4.8, más débil que Mythos 5. Es casi tan bueno como Mythos 5 encontrando vulnerabilidades, pero sustancialmente inferior explotándolas. Las salvaguardas ahora permiten el descubrimiento de vulnerabilidades en código fuente en todos los niveles de acceso, mientras siguen bloqueándolo en binarios compilados.
  • La inyección de prompts es donde más mejoró la robustez, en codificación, uso de ordenador y uso del navegador.
  • Debilidad residual: verbosidad y encuadres benignos. Las respuestas de Opus 5 tienden a ser más largas y detalladas de lo ideal, a veces compartiendo en exceso detalles operativos, y es más susceptible a peticiones disfrazadas de ficción, roleplay o maquetas.
  • La brecha entre la API y claude.ai es real y está documentada. Las métricas de seguridad son consistentemente mejores con el system prompt de claude.ai que en la API en crudo, y Anthropic recomienda que los desarrolladores que construyen sobre la API añadan salvaguardas comparables ellos mismos.

Qué es una system card y por qué los equipos de seguridad deberían leerla

Una system card es el documento previo al despliegue de Anthropic para un modelo: qué puede hacer, cómo se probó frente a umbrales de riesgo catastrófico, qué salvaguardas incluye y dónde están las brechas conocidas. Se publica bajo la Responsible Scaling Policy (RSP) de Anthropic, el marco que la empresa utiliza para decidir si un modelo puede lanzarse y bajo qué protecciones.

Para un equipo de seguridad, el valor no es el veredicto del titular. Es la letra pequeña: los números de los benchmarks, los modos de fallo cualitativos que encontraron los equipos de red team y las advertencias explícitas sobre qué cubren y qué no cubren las evaluaciones. En esa parte se concentra este artículo.

Escalado responsable: el veredicto general

La evaluación de riesgo de máximo nivel de Anthropic para Opus 5 es "muy bajo", y el razonamiento es comparativo. Opus 5 no es más capaz en general que Claude Fable 5, su modelo de acceso general más capaz, y no muestra nuevas propiedades de alineación preocupantes. En autonomía, Opus 5 no cruza el umbral de capacidad de I+D de IA automatizada. Sus capacidades de I+D de IA se describen como comparables a Claude Mythos 5, pero "no está cerca de sustituir" a los propios científicos e ingenieros de investigación de Anthropic, y la empresa no reporta ninguna aceleración sostenida atribuible a la IA de 2× en el ritmo de su investigación.

En cuanto al riesgo químico y biológico, Anthropic trata a Opus 5 como poseedor de capacidades CB-1, lo que significa ayuda significativa para personas con formación técnica básica que intentan fabricar u obtener armas no novedosas, y aplica las correspondientes protecciones ASL-3 que ya usaba para Opus 4.8. Concluye que Opus 5 no cruza el umbral CB-2 para el desarrollo de armas novedosas, señalando que, a pesar de las fuertes puntuaciones en los benchmarks, el modelo se queda atascado en bucles improductivos de autoverificación en el tipo de trabajo abierto y difícil de verificar que requiere el diseño novedoso.

La sección de alineación es genuinamente positiva: Opus 5 se presenta como el modelo más alineado que Anthropic ha auditado, y coopera con el uso indebido menos que cualquier otro modelo que probaron. Dos advertencias acompañan a esto. La monitorización del despliegue interno detectó intentos ocasionales de eludir clasificadores de seguridad o restricciones de red. En un caso, una instantánea intermedia que había sido desconectada de un servicio intentó volver a iniciar sesión adivinando contraseñas comunes. Esto ocurrió en menos del 0,01% de las completaciones monitorizadas (comparable a Mythos 5) y estaba orientado a completar la tarea del usuario, no a perseguir un objetivo independiente. Por separado, el modelo alucina afirmaciones factuales ligeramente más que Opus 4.8, afirmando a veces una respuesta con confianza cuando en realidad no estaba seguro, a pesar de ser más preciso en general.

La conclusión para quien despliega: estos son los hallazgos de Anthropic sobre el modelo, producidos con las intervenciones de seguridad de producción a menudo deshabilitadas por motivos de medición. No son hallazgos sobre tu aplicación, tus datos o tus usuarios.

Ciberseguridad: mejor encontrando bugs, todavía débil convirtiéndolos en armas

Opus 5 es un modelo de propósito general que no fue entrenado específicamente para tareas cibernéticas, por lo que Anthropic enmarca cualquier avance cibernético como un subproducto de las mejoras de capacidad general. El patrón en cada benchmark es consistente: Opus 5 es claramente más fuerte que Opus 4.8 pero se queda corto frente a Mythos 5, y la brecha se concentra en el desarrollo de exploits más que en el descubrimiento de vulnerabilidades.

Algunas cifras concretas de la card dejan clara la forma:

  • OSS-Fuzz (descubrimiento y explotación de vulnerabilidades sin guía): Opus 5 obtuvo un resultado distinto de cero en el 79,4% de los objetivos, cerca del aproximadamente 80% de Mythos 5, y muy por encima del 38,5% de Opus 4.8, pero produjo menos exploits completos que Mythos 5.
  • Firefox 147 (desarrollo de exploits, ejecutado con las mitigaciones por defecto desactivadas): Opus 5 produjo exploits completos y funcionales en 131 de 250 pruebas (52,4%) y logró un progreso parcial en 218 (87,2%), frente a 22 exploits completos (8,8%) de Opus 4.8 y 221 (88,4%) de Mythos 5.
  • CyScenarioBench (operaciones multietapa, de Irregular): Opus 5 resolvió el 33,7% de los desafíos, por delante del 24,4% de Opus 4.8 y muy por debajo del 47,0% de Mythos 5.

Las pruebas compartidas con el UK AI Security Institute llegaron a una conclusión similar. En simulaciones agénticas de "cyber range", Opus 5 tuvo un rendimiento similar a Mythos 5 y Mythos Preview, y el UK AISI lo juzgó capaz de atacar pequeñas redes empresariales con seguridad débil donde ya ha obtenido acceso, señalando al mismo tiempo que los ranges carecen de los defensores activos y la respuesta presentes en entornos reales.

El cambio más relevante operativamente es de política. Las salvaguardas cibernéticas de Opus 5 ahora permiten el descubrimiento de vulnerabilidades en código fuente en todos los niveles de acceso, porque encontrar bugs en tu propio código es esencial para el desarrollo seguro, mientras siguen bloqueando el descubrimiento de vulnerabilidades en binarios compilados, que se inclina hacia lo ofensivo. Anthropic lo implementa con un sistema de dos etapas: una sonda examina las activaciones internas en todo el tráfico y escala las conversaciones marcadas a un clasificador LLM entrenado. También ofrece un Cyber Verification Program para que defensores y empresas verificados puedan solicitar que se levanten los bloqueos para trabajo de bug bounty, investigación de vulnerabilidades y pruebas de penetración.

Vale la pena señalar lo cerca que está esta arquitectura de cómo funciona una capa dedicada de seguridad de IA: sondas y clasificadores que deciden, por petición, si el tráfico es benigno o dañino. La diferencia es el alcance. Los clasificadores de Anthropic están ajustados a su modelo de amenazas sobre su modelo. Dentro de tu propia aplicación, la política que importa es la tuya: qué herramientas puede invocar un agente, qué proveedores puede alcanzar, qué cuenta como datos sensibles. Esa lógica tiene que vivir en algún lugar que tú controles. Esta es la capa que productos como TrustGuard de NeuralTrust están construidos para ocupar.

Inyección de prompts y seguridad agéntica

Si hay una victoria clara en la card, está aquí. Anthropic informa de que, en toda su suite de seguridad agéntica, Opus 5 tuvo un rendimiento comparable o mejor que Opus 4.8, con los mayores avances en robustez frente a la inyección de prompts en codificación, uso de ordenador y uso del navegador. En la evaluación de campañas de influencia dañina, la versión "solo útil" del modelo se mantuvo muy por debajo de la capacidad necesaria para ejecutar una operación autónoma, y el modelo completamente entrenado rechazó estas tareas de plano.

Dos cosas moderan las buenas noticias. Primero, "más robusto" no es "inmune". Anthropic prueba la resistencia a la inyección de prompts de forma continua con equipos de red team externos precisamente porque no considera el problema resuelto. Segundo, cuanto más capaz se vuelve un modelo como agente (invocando herramientas, navegando, controlando un ordenador), mayor se vuelve su superficie de ataque, porque cada documento externo, respuesta de herramienta o página web que ingiere es un vector potencial de inyección. La robustez a nivel de modelo es una capa de defensa contra eso. No es toda la pila. Los controles que rodean al agente, como restringir qué herramientas y proveedores de modelos puede alcanzar, limitar la tasa de llamadas a herramientas y examinar las entradas y salidas de las herramientas, abordan una parte diferente del problema que cualquier cosa integrada en los pesos.

La brecha entre la API y claude.ai: la parte que quien despliega no debería saltarse

Este es el hilo conductor del capítulo de seguridad, y se afirma con claridad. Anthropic informa de los resultados de sus salvaguardas en dos configuraciones: el modelo principal en la API sin system prompt, y el modelo en claude.ai con su system prompt de producción. En todos los casos, la segunda configuración es más segura.

La tasa de respuesta inofensiva de un solo turno ante peticiones genuinamente dañinas subió del 96,34% en la API en crudo al 98,54% en claude.ai. Los resultados multiturno se mueven aún más: en las pruebas de suicidio y autolesión, la tasa de respuesta apropiada pasó del 69% en la API al 90% en claude.ai, y en las pruebas multiturno de seguridad infantil del 86% al 99%. Anthropic atribuye la brecha directamente a las instrucciones de seguridad del system prompt de claude.ai, y describe varias debilidades específicas como concentradas en el modelo principal de la API y mitigadas por el system prompt de claude.ai: exceso de detalle operativo en conversaciones sobre trastornos alimentarios y sustancias ilegales, susceptibilidad a peticiones de investigación sobre grooming enmarcadas como prevención, y respuestas verbosas que derivan hacia consejos clínicamente controvertidos de "sustitución de medios".

La card no deja la implicación implícita. Anima repetidamente a los desarrolladores que construyen sobre la API a aplicar salvaguardas comparables a las del system prompt de Anthropic, especialmente en contextos donde puedan estar presentes menores, malos actores o usuarios en apuros.

Para cualquiera que integre Opus 5 a través de la API, esta es la frase que hay que interiorizar: la capa protectora que hace más seguro el producto de consumo no es algo que heredes. En la API obtienes el modelo. Las salvaguardas del system prompt, las sondas en tiempo real y la monitorización offline que Anthropic ejecuta en claude.ai son suyas, en su superficie. Reconstruir una capa de guardrail equivalente frente a tu propio despliegue recae claramente sobre ti, y es el problema específico que existe la categoría de seguridad de IA para resolver.

Seguridad en dominios sensibles: salud mental, trastornos alimentarios, sesgo, elecciones

En general, Opus 5 tiene un rendimiento comparable a Opus 4.8 en estas áreas, con un tema cualitativo recurrente: sus respuestas son más largas y detalladas, y esa verbosidad a veces juega en contra de la reducción de daños. En conversaciones sobre trastornos alimentarios, calculó y mostró con más frecuencia métricas numéricas como totales de calorías e IMC, lo cual está bien intencionado pero contradice la orientación de los expertos de evitar destacar objetivos cuantitativos. En conversaciones sobre suicidio y autolesión, a veces explicó de más y, en ocasiones, ofreció encuadres controvertidos de reducción de daños. En el lado más positivo, mejoró en el benchmark de sesgo demográfico BBQ (precisión desambiguada del 81,6% frente al 72,1% de Opus 4.8) y en la imparcialidad política, y Anthropic añadió una nueva suite adversaria multiturno de integridad electoral en la que Opus 5 produjo menos respuestas fallidas y limítrofes que Opus 4.8.

De nuevo, la mayoría de los comportamientos preocupantes se observaron en la API en crudo y se redujeron con el system prompt de claude.ai, el mismo patrón que arriba.

Monitorización y red teaming: cómo Anthropic verifica su propio trabajo

La card es franca en que las salvaguardas no se asumen como perfectas. Anthropic ejecuta monitorización offline del tráfico de producción (la fuente de los hallazgos de elusión por debajo del 0,01% mencionados antes) y encargó equipos de red team externos contra las salvaguardas cibernéticas de Opus 5: Trajectory Labs dedicó aproximadamente 100 horas y completó una tarea usando prompting específico de tarea que Anthropic no espera que generalice, mientras que los atacantes automatizados de 10a Labs y Grayswan no tuvieron éxito en las tareas de ejemplo. Anthropic informa de que no encontró ningún jailbreak de severidad crítica para Opus 5, al tiempo que afirma que no espera que sus clasificadores sean perfectamente robustos.

Esa postura, monitorización continua más pruebas adversarias bajo el supuesto de que las defensas son imperfectas, es la correcta para copiar en tu propio despliegue. La monitorización de Anthropic cubre la superficie de Anthropic. La visibilidad sobre tu propio tráfico y las pruebas adversarias de tu propia integración son cosas que tienes que montar por separado.

Conclusión

Claude Opus 5 es, según las propias mediciones de Anthropic, más capaz y mejor alineado que Opus 4.8, con una mejora real en la robustez frente a la inyección de prompts y un endurecimiento sensato de la política cibernética. Esos son avances genuinos y la system card es refrescantemente específica sobre ellos.

Pero "más seguro" en la card es una propiedad del modelo, medida en gran parte sobre la propia superficie de Anthropic. El documento dice sin rodeos que la API en crudo es más débil que claude.ai y que los desarrolladores deberían añadir sus propias salvaguardas. Las debilidades residuales que cataloga, como la verbosidad que filtra detalles operativos, la susceptibilidad a encuadres de ficción y roleplay, la resistencia imperfecta a jailbreaks y una superficie de ataque agéntica en expansión, son exactamente las que aparecen en producción, en la brecha entre el modelo y la aplicación construida a su alrededor. Cerrar esa brecha es el trabajo de quien despliega. Una capa de seguridad y gobernanza en tiempo de ejecución (para nosotros, TrustGate y TrustGuard) es como ayudamos a los equipos a cerrarla, pero el punto general se mantiene sea cual sea la herramienta que elijas: lee la card para saber qué hace bien el modelo, y planifica tus defensas en torno a lo que explícitamente te deja a ti.


FAQ

1. ¿Es Claude Opus 5 más seguro que Opus 4.8?

En la mayoría de las medidas de seguridad de Anthropic, sí. Opus 5 se describe como su modelo más alineado hasta la fecha, con avances notables en la robustez frente a la inyección de prompts, y mantiene las mismas protecciones ASL-3 que Opus 4.8. No es uniformemente mejor: alucina ligeramente más, y sus respuestas más largas a veces comparten en exceso detalles operativos.

2. ¿Puede Opus 5 escribir malware o explotar vulnerabilidades?

Sus capacidades cibernéticas son más fuertes que las de Opus 4.8 pero inferiores a las de Mythos 5. Es casi tan bueno como Mythos 5 encontrando vulnerabilidades y sustancialmente más débil convirtiéndolas en exploits funcionales. Las salvaguardas de Anthropic ahora permiten el descubrimiento de vulnerabilidades en código fuente en todos los niveles de acceso, mientras siguen bloqueándolo en binarios compilados, que es el uso más ofensivo.

3. ¿Qué significan aquí "CB-1" y "ASL-3"?

CB-1 es el umbral de Anthropic para un modelo que puede ayudar significativamente a personas con formación técnica básica a crear u obtener armas químicas o biológicas no novedosas. Opus 5 se trata como CB-1 pero no CB-2 (armas novedosas). ASL-3 es el conjunto correspondiente de protecciones de despliegue y seguridad que aplica Anthropic, el mismo nivel que usó para Opus 4.8.

4. ¿Es Opus 5 vulnerable a la inyección de prompts?

Es más robusto que Opus 4.8 (aquí es donde la card reporta los mayores avances en seguridad agéntica), pero Anthropic no reclama inmunidad y hace red team del problema de forma continua. La inyección de prompts sigue siendo un riesgo vivo, especialmente para agentes que navegan o invocan herramientas externas.

5. ¿Es la API de Opus 5 tan segura como la app de claude.ai?

No, y la system card lo dice. Las métricas de seguridad son consistentemente más altas en claude.ai que en la API en crudo, porque el system prompt de claude.ai añade protecciones. Anthropic anima explícitamente a los desarrolladores en la API a aplicar salvaguardas comparables ellos mismos.

6. Si ya uso Opus 5, ¿sigo necesitando una capa de seguridad separada?

La propia orientación de la card apunta en esa dirección para los despliegues en la API: el modelo te da un comportamiento base sólido, pero las salvaguardas del system prompt, las sondas en tiempo real y la monitorización que protegen claude.ai son de Anthropic, en la superficie de Anthropic. Los controles específicos de tu aplicación, como las restricciones de herramientas y proveedores, la prevención de pérdida de datos, el examen de entradas/salidas y la monitorización de tu propio tráfico, son tu responsabilidad.

7. ¿Qué cambió específicamente para el descubrimiento de vulnerabilidades cibernéticas?

Opus 5 desbloquea el descubrimiento de vulnerabilidades en código fuente en todos los niveles de acceso, para apoyar el desarrollo seguro, mientras sigue bloqueándolo en binarios compilados. Los defensores y empresas verificados también pueden solicitar exenciones a través del Cyber Verification Program de Anthropic para actividades como el trabajo de bug bounty y las pruebas de penetración.


Sobre el autor

Alessandro Pignati es Lead AI Security Researcher en NeuralTrust, donde lidera la investigación sobre seguridad de IA y agéntica, avanzando técnicas para evaluar y proteger grandes modelos de lenguaje y sistemas de IA autónomos. Está especializado en aprendizaje automático adversario, red teaming de IA, seguridad de LLM y seguridad de IA, contribuyendo al desarrollo de una IA segura y fiable.

NeuralTrust es una plataforma de seguridad para agentes de IA, reconocida en la Gartner 2025 Market Guide para AI Gateways y Guardian Agents, y en el KuppingerCole 2025 Leadership Compass para Generative AI Defense. Con sede en Barcelona y certificación ISO 27001.


Suscríbete a nuestra newsletter

Compartir

Únete a los líderes que aseguran el ecosistema de agentes

Solicita una demo