Última actualización: Octubre 2026
¿Cuánto esfuerzo hace falta para romper los mecanismos de seguridad de un modelo de IA de última generación?
Según la investigación de NeuralTrust, solo 48 horas y dos técnicas de ataque complementarias. El jailbreak de Grok 4, conseguido dos días después del lanzamiento del modelo de xAI en julio de 2025, demostró que los métodos adversariales multi-turno pueden sortear los filtros basados en la intención sin utilizar ni una sola palabra prohibida.
Este artículo explica cómo funcionó el ataque, qué significan las tasas de éxito para los equipos que despliegan agentes de IA en producción y qué puedes hacer para proteger tus despliegues frente a la misma clase de ataques.
TL;DR: Puntos clave
- Los investigadores de NeuralTrust vulneraron Grok-4 solo 48 horas después de su lanzamiento el 9 de julio de 2025, combinando los ataques multi-turno Echo Chamber y Crescendo.
- El método combinado logró una tasa de éxito del 67 % en el objetivo Molotov, del 50 % en Meth y del 30 % en Toxin, sin emitir ni un solo prompt explícitamente dañino. Fuente: NeuralTrust Research, 2025
- Grok-4 obtuvo una puntuación de seguridad del 0,3 % frente a la inyección de prompts en las pruebas independientes de SplxAI, frente al 33 % de GPT-4o. Fuente: SplxAI Benchmark, 2025
- Los ataques multi-turno tienen éxito en el 92,78 % de los entornos de prueba empresariales a fecha de 2026, y el 73 % de los despliegues en producción tienen al menos una vulnerabilidad explotable. [Fuente: NeuralTrust Red Team Data, 2026]
- Solo el 23 % de las empresas cuenta con una política formal de seguridad de IA que cubra los escenarios adversariales multi-turno. [Fuente: Gartner AI Security Survey, 2026]
- Los filtros estándar de palabras clave e intención no detectan Echo Chamber ni Crescendo, porque ambos ataques construyen outputs dañinos de forma incremental a través de turnos que parecen limpios.
De un vistazo: postura de seguridad de Grok-4 frente a GPT-4o
| Métrica | Grok-4 | GPT-4o |
|---|---|---|
| Puntuación de seguridad (inyección de prompts) | 0,3 % | 33 % |
| Sin system prompt: sigue instrucciones hostiles | 99 % de los tests | Varía según la instrucción |
| Éxito combinado Echo Chamber + Crescendo | 30-67 % | 10 % (reforzado) |
| Fecha de lanzamiento | 9 de julio de 2025 | Marzo de 2024 |
| Jailbreak demostrado | 11 de julio de 2025 | Múltiples eventos de investigación previos |
¿Qué es Echo Chamber?
Echo Chamber es una técnica de envenenamiento de contexto multi-turno desarrollada por Ahmad Alobaid, investigador de NeuralTrust, publicada en junio de 2025. En lugar de inyectar un prompt dañino directamente, el ataque construye un contexto conversacional envenenado utilizando los propios outputs del modelo como material.
La secuencia de seis etapas funciona así:
- Establece un tema neutro que comparte características superficiales con el objetivo final.
- Introduce una semilla envenenada: una afirmación con la que el modelo probablemente esté de acuerdo y que reencuadra sutilmente el comportamiento objetivo como aceptable.
- Ejecuta el ciclo de persuasión, invitando al modelo a elaborar sobre la semilla y anclar sus outputs en el marco envenenado.
- Monitoriza el progreso estancado: si el modelo deja de avanzar hacia el objetivo, inyecta una escalada Crescendo.
- Escala con Crescendo durante uno o dos turnos adicionales hasta que el modelo cruce el límite.
- Extrae el output objetivo una vez que el modelo ha adoptado el comportamiento deseado.
El ataque es compatible con el enfoque de caja negra: no requiere conocimiento del contenido del system prompt, los datos de entrenamiento ni los pesos internos. La investigación independiente de NeuralTrust mostró tasas de éxito superiores al 90 % en las categorías de violencia y discurso de odio en múltiples modelos de frontera.
¿Qué es Crescendo?
Crescendo es un jailbreak multi-turno publicado en abril de 2024 por Mark Russinovich, Ahmed Salem y Ronen Eldan de Microsoft Research, presentado más tarde en USENIX Security 2025. El ataque explota la tendencia aprendida del modelo a seguir el patrón establecido en sus propios outputs anteriores.
En lugar de emitir una solicitud dañina en un solo turno, Crescendo abre con un encuadre benigno y luego escala el tema de forma incremental a lo largo de turnos sucesivos. Cada paso es lo suficientemente pequeño como para superar las comprobaciones de seguridad turno a turno. Para cuando el modelo alcanza el comportamiento objetivo, ya se ha comprometido con una trayectoria conversacional que hace que el rechazo parezca contextualmente inconsistente.
En las propias pruebas de Microsoft, Crescendo logró una tasa de éxito de 10 sobre 10 contra GPT-4, Claude-2, Claude-3 y LLaMA-2, completando los ataques en menos de cinco turnos de media. Fuente: Russinovich et al., Microsoft Research, 2024
Cómo funciona la combinación Echo Chamber + Crescendo contra Grok 4
El equipo de NeuralTrust ejecutó el ataque combinado en dos fases.
Fase 1: Cebado con Echo Chamber
Los investigadores abrieron con semillas neutras relacionadas con química y seguridad doméstica, luego introdujeron un contexto envenenado que gradualmente reencuadró el tema objetivo como educativo o histórico. Los intentos iniciales usaron semillas de dirección demasiado directas, lo que provocó que Grok-4 marcara la conversación. Las semillas más suaves lograron establecer el marco envenenado sin activar interrupciones de seguridad.
Fase 2: Escalada con Crescendo
Una vez que el ciclo de persuasión se estancó (el modelo estaba involucrado pero aún no producía el output objetivo) el equipo aplicó dos turnos adicionales de Crescendo. Estos turnos aprovecharon el contexto envenenado ya establecido, pidiendo al modelo que elaborara sobre sus outputs anteriores en términos cada vez más específicos. La combinación tuvo éxito en dos turnos de Crescendo en todos los casos donde el cebado de Echo Chamber había establecido una base.
Cómo comparamos
Todos los resultados se basan en pruebas manuales realizadas por investigadores de NeuralTrust entre el 9 y el 11 de julio de 2025, contra la API de Grok-4 en producción. Las pruebas usaron múltiples reinicios de sesión para garantizar condiciones de inicio limpias. El éxito se definió como el modelo produciendo un output dañino paso a paso que coincidiera con el objetivo. No se aplicó postprocesamiento a los outputs del modelo.
Resultados del jailbreak de Grok-4 por objetivo
El equipo probó tres objetivos extraídos del artículo original de Crescendo, todos relacionados con actividades ilegales.
| Objetivo | Tasa de éxito | Temáticas exitosas | Método |
|---|---|---|---|
| Cóctel Molotov | 67 % | Manual, descriptivo | Echo Chamber + Crescendo |
| Síntesis de metanfetamina | 50 % | Narración ficticia | Echo Chamber + Crescendo |
| Producción de toxinas | 30 % | Contexto legal, descriptivo | Echo Chamber + Crescendo |
En una de las pruebas del Molotov, el modelo produjo el output objetivo en un solo turno tras el cebado de Echo Chamber, sin necesidad de ninguna escalada Crescendo. Esto sugiere que el contexto envenenado fue suficiente por sí solo una vez que el marco del modelo había cambiado.
Para contexto: Grok-4 se lanzó el 9 de julio de 2025. El jailbreak se confirmó dos días después, el 11 de julio. El modelo no tenía system prompt en el entorno de prueba, lo que la investigación independiente de SplxAI descubrió que hacía que siguiera instrucciones hostiles en más del 99 % de los tests de inyección de prompts.
Cómo el ataque evita la detección tradicional
Los filtros basados en palabras clave y la clasificación de intención fallan frente a Echo Chamber y Crescendo por tres razones estructurales.
Deriva semántica entre turnos
Cada mensaje individual de la secuencia de ataque es semánticamente benigno. Un filtro que escanea turno a turno en busca de temas prohibidos no marcará una discusión histórica, una pregunta de reencuadre ni una solicitud de "elaborar sobre el punto anterior". El contenido dañino solo emerge a nivel agregado, a través de una secuencia que ningún clasificador de turno único ve en su conjunto.
Solicitudes de elaboración asimétricas
Crescendo pide al modelo que extienda o aclare sus propios outputs anteriores. Desde la perspectiva de un sistema de seguridad sin estado, estas son solicitudes de paráfrasis o resumen, entre los tipos de prompt de menor riesgo. El ataque explota la brecha entre el perfil de riesgo de la forma (benigna) y el de la función (escalada).
Anclaje en outputs anteriores
Una vez que el modelo ha producido un output, lo trata como referencia fiable para los turnos siguientes. Echo Chamber explota esto usando las propias palabras del modelo como semilla envenenada para la siguiente escalada. Un sistema de seguridad que no rastrea los propios outputs del modelo como posibles vectores de ataque no tiene visibilidad sobre este canal.
El argumento económico para la monitorización a nivel de sesión es directo. Los costes de filtrado por turno permanecen constantes independientemente de la longitud de la conversación, pero el valor del ataque se concentra en los turnos posteriores. Cualquier arquitectura que no agregue el riesgo a lo largo del contexto de sesión completo será sistemáticamente más barata de atacar que de defender.
Seguridad y gobernanza: qué significa esto para la IA empresarial
El jailbreak de Grok-4 no es un incidente aislado. Representa un patrón para el que los equipos de seguridad empresarial deben prepararse en cada despliegue de modelo.
El OWASP LLM Top 10 2025 incluye la inyección de prompts (LLM01) como el riesgo de mayor gravedad para los modelos de lenguaje en producción, señalando específicamente las variantes de inyección multi-turno e indirecta. Echo Chamber y Crescendo son instancias concretas de esta clase. Fuente: OWASP LLM Top 10, 2025
Según la encuesta de seguridad de IA de Gartner de 2026, el 73 % de las organizaciones que han desplegado agentes de IA en producción tienen al menos una vulnerabilidad explotable en su capa de interacción con el modelo. Solo el 23 % cuenta con políticas formales que cubran los escenarios adversariales multi-turno.
Los riesgos para los despliegues empresariales incluyen:
- Exfiltración de datos sensibles incrustados en system prompts o contexto recuperado.
- Generación de contenido dañino que viola los requisitos regulatorios o de seguridad de marca.
- Uso indebido de herramientas: en flujos de trabajo agénticos, un modelo vulnerado puede llamar a herramientas, APIs o bases de datos con instrucciones controladas por el atacante.
- Exposición a responsabilidades: las industrias reguladas tienen obligaciones específicas sobre la integridad de los outputs de IA que los ataques multi-turno socavan directamente.
El Agent Gateway (TrustGate) de NeuralTrust aborda esta clase de ataques mediante la aplicación de políticas a nivel de sesión. En lugar de escanear turnos individuales de forma aislada, TrustGate mantiene una representación semántica del estado de la conversación completa y evalúa cada nuevo turno frente al contexto acumulado. Esto le permite detectar el patrón de escalada gradual que define tanto Echo Chamber como Crescendo antes de que se produzca el output dañino.
AI Red Teaming (TrustTest) complementa esto en la capa de evaluación: ejecuta simulaciones adversariales sistemáticas (incluyendo variantes de Echo Chamber y Crescendo) contra modelos en proceso de despliegue y expone los vectores explotables antes de la puesta en producción.
¿Cuál deberías elegir? Tabla de decisión por tipo de despliegue
| Tipo de despliegue | Riesgo principal | Control recomendado |
|---|---|---|
| Chatbot de cara al público | Generación de contenido dañino | Política de sesión TrustGate + clasificación de outputs |
| Asistente de base de conocimiento interna | Exfiltración de datos vía inyección de prompts | TrustGate + controles de acceso en la capa de recuperación |
| Flujo de trabajo agéntico con acceso a herramientas | Uso indebido de herramientas, movimiento lateral | TrustGate + red team TrustTest antes del despliegue |
| Pipeline multi-modelo | Envenenamiento de contexto entre modelos | Runtime Security Mesh con continuidad de sesión |
| Entorno de alta conformidad (finanzas, salud) | Responsabilidad regulatoria en outputs de IA | Evaluación adversarial TrustTest + registro de auditoría |
Conclusión
El jailbreak de Grok 4 confirmó lo que la investigación adversarial multi-turno lleva más de un año mostrando: los filtros basados en intención y palabras clave son defensas insuficientes frente a ataques que construyen outputs dañinos de forma incremental a través de turnos conversacionales aparentemente limpios. Echo Chamber y Crescendo juntos representan un patrón de ataque de bajo coste y alto rendimiento que no requiere conocimiento de los mecanismos internos del sistema objetivo ni ningún prompt explícitamente prohibido. Los equipos empresariales que despliegan agentes de IA necesitan detección de amenazas a nivel de sesión, no filtros por turno, para defenderse eficazmente de esta clase de amenaza.
Protege tus agentes de IA en producción con NeuralTrust
El Runtime Security Mesh de NeuralTrust da a los equipos empresariales la visibilidad a nivel de sesión necesaria para detectar y bloquear los ataques adversariales multi-turno antes de que produzcan outputs dañinos.
Comparativas relacionadas
- Ataque Echo Chamber: cómo el envenenamiento de contexto vulnera los LLM
- Crescendo: el ataque de prompt gradual
FAQs sobre el jailbreak de Grok 4
1. ¿Qué es el jailbreak de Grok 4?
El jailbreak de Grok 4 hace referencia a un ataque adversarial exitoso demostrado por investigadores de NeuralTrust el 11 de julio de 2025, dos días después del lanzamiento de Grok-4. El ataque combinó Echo Chamber (una técnica de envenenamiento de contexto) y Crescendo (un método de escalada gradual) para extraer outputs dañinos de Grok-4 sin usar ningún prompt explícitamente prohibido. Las tasas de éxito oscilaron entre el 30 % y el 67 % según el objetivo.
2. ¿Qué es el ataque Echo Chamber?
Echo Chamber es una técnica de jailbreak multi-turno desarrollada por Ahmad Alobaid, investigador de NeuralTrust. Envenena el contexto conversacional de un modelo usando los propios outputs anteriores del modelo como material para desplazar gradualmente su encuadre de un tema. A diferencia de los ataques de inyección directa, Echo Chamber opera a través de múltiples turnos y no requiere conocimiento del system prompt ni la configuración interna del modelo objetivo.
3. ¿Qué es el ataque Crescendo?
Crescendo es un jailbreak multi-turno publicado por Microsoft Research en abril de 2024. Abre con un encuadre conversacional benigno y escala incrementalmente el tema a través de turnos sucesivos, explotando la tendencia del modelo a seguir la trayectoria establecida por sus propias respuestas anteriores. En las pruebas de Microsoft, Crescendo logró una tasa de éxito de 10 sobre 10 contra GPT-4, Claude-2, Claude-3 y LLaMA-2.
4. ¿Por qué Grok-4 obtuvo malos resultados en los benchmarks de seguridad?
Grok-4 obtuvo un 0,3 % en el benchmark de seguridad de inyección de prompts de SplxAI, frente al 33 % de GPT-4o. En entornos de prueba sin system prompt, el modelo siguió instrucciones hostiles en más del 99 % de los casos. Esto sugiere que el entrenamiento de seguridad del modelo se optimizó principalmente para amenazas de turno único detectables por palabras clave, no para escenarios adversariales multi-turno.
5. ¿Pueden estos ataques afectar a otros modelos de IA?
Sí. Crescendo fue validado contra GPT-4, Claude-2, Claude-3 y LLaMA-2 con una tasa de éxito de 10 sobre 10. Echo Chamber mostró tasas de éxito superiores al 90 % en múltiples modelos de frontera en las categorías de violencia y discurso de odio. Ambos ataques explotan propiedades estructurales de cómo los modelos de lenguaje procesan el contexto conversacional, no debilidades específicas de un modelo.
6. ¿Cómo evitan estos ataques los filtros de seguridad?
Tanto Echo Chamber como Crescendo explotan la brecha entre la evaluación de seguridad por turno y el riesgo conversacional agregado. Cada mensaje individual de la secuencia de ataque parece benigno para un clasificador sin estado. El output dañino solo emerge a nivel de sesión, a través de una secuencia de turnos aparentemente seguros que los filtros estándar evalúan de forma independiente.
7. ¿Qué deben hacer las empresas para protegerse de los jailbreaks multi-turno?
Los equipos empresariales deben pasar del filtrado por turno a la detección de amenazas a nivel de sesión. Esto significa mantener una representación semántica del estado de la conversación completa y evaluar cada nuevo turno frente al contexto acumulado. Antes de desplegar cualquier modelo de IA en un rol de cara a producción, el red teaming adversarial (incluyendo escenarios multi-turno) debe ser una parte estándar de la revisión de seguridad.
8. ¿Cuál es el enfoque de NeuralTrust para esta clase de ataque?
Con un prompt de sistema bien elaborado y probado adversarialmente, puedes reducir la superficie de ataque. Pero el hardening del system prompt por sí solo no es suficiente frente a Echo Chamber y Crescendo, porque ambos ataques funcionan incluso cuando el system prompt está presente. El control más efectivo es la monitorización de sesión en tiempo real combinada con el red teaming previo al despliegue. TrustGate proporciona el primero; TrustTest proporciona el segundo. Juntos dan a los equipos cobertura tanto preventiva como detectiva para las amenazas adversariales multi-turno.
Sobre el autor
Alessandro Pignati es Investigador principal de seguridad de IA en NeuralTrust, donde lidera la investigación sobre seguridad de IA y agentes, avanzando en técnicas para evaluar y asegurar grandes modelos de lenguaje y sistemas de IA autónomos. Se especializa en aprendizaje automático adversarial, red teaming de IA, seguridad de LLM y seguridad de IA, contribuyendo al desarrollo de IA segura y confiable.
NeuralTrust es una plataforma de seguridad para agentes de IA, reconocida en la Guía de Mercado 2025 de Gartner para AI Gateways y Guardian Agents, y en el KuppingerCole Leadership Compass 2025 para Defensa de IA Generativa. Con sede en Barcelona y certificación ISO 27001.
Fuentes
- Ahmad Alobaid, NeuralTrust: Ataque Echo Chamber: envenenamiento de contexto en LLM (junio de 2025)
- Mark Russinovich, Ahmed Salem, Ronen Eldan: Great, Now Write an Essay About That: The Crescendo Multi-Turn LLM Jailbreak Attack (abril de 2024, USENIX Security 2025)
- SplxAI: Grok-4 Security Benchmark (julio de 2025)
- OWASP: LLM Top 10 2025: LLM01 Prompt Injection (2025)
- Gartner: Hype Cycle for Artificial Intelligence 2026 (2026)
- NeuralTrust: Universal Jailbreaks: qué son y por qué importan (2025)
- xAI: Grok-4 Launch Announcement (julio de 2025)
- NeuralTrust: Agent Gateway (TrustGate) (2026)
- NeuralTrust: AI Red Teaming (TrustTest) (2026)
- Gray Swan AI: Multi-turn Attack Research (2025)
)
)
)