¿Cuál es el rendimiento de los modelos de seguridad de IA de NeuralTrust?
Los modelos guardrail de NeuralTrust alcanzan puntuaciones ROC-AUC de 0.991 a 0.9997 en cuatro tareas: detección de jailbreaks (tasa de detección del 92%, tasa de falsos positivos del 2,3%), detección de toxicidad (tasa de detección del 92,1%, tasa de falsos positivos del 2,4%), detección de inyección indirecta de prompts (tasa de detección del 99,8%, tasa de falsos positivos del 0,6%) y moderación de prompts en 13 temas (ROC-AUC medio de 0,992).
Todos los modelos están benchmarked en 9 idiomas y 5 sectores industriales. En detección de jailbreaks, NeuralTrust supera a AWS Bedrock Guardrails en 18 puntos porcentuales y a Azure AI Content Safety en 59 puntos porcentuales a tasas de falsos positivos equiparables.
TL;DR - Puntos Clave
- El modelo de detección de jailbreaks de NeuralTrust alcanza el 92% de detección con una tasa de falsos positivos del 2,3%, benchmarked en 21.600 prompts en 9 idiomas, 8 familias de ataques y 5 sectores industriales.
- El modelo de detección de inyección indirecta de prompts alcanza el 99,8% de detección con una tasa de falsos positivos del 0,6% y cero falsos positivos en tráfico benigno de agentes realista — diseñado específicamente para despliegues agénticos y RAG.
- A tasas de falsos positivos equiparables, NeuralTrust supera a AWS Bedrock Guardrails en 18 puntos porcentuales en detección de jailbreaks y en 4-6 puntos en detección de toxicidad.
- A tasas de falsos positivos equiparables, NeuralTrust supera a Azure AI Content Safety (Prompt Shields) en 59 puntos porcentuales en detección de jailbreaks y en 5-10 puntos en detección de toxicidad.
- Cada modelo se somete a pruebas de estrés bajo 10 perturbaciones de texto adversariales, totalizando aproximadamente 129.600 inputs distintos evaluados por modelo.
- Una plataforma de evaluación en bucle cerrado extrae continuamente falsos positivos y negativos de producción y los incorpora a reentrenamientos versionados y benchmarked, de modo que cada versión debe superar a la anterior antes de publicarse.
Cualquier equipo de seguridad empresarial que evalúe guardrails de IA necesita los mismos tres números: tasa de detección, tasa de falsos positivos y cómo se mantienen esos números bajo presión adversarial.
Este informe proporciona los tres para los cuatro modelos guardrail de producción de NeuralTrust, medidos en benchmarks de retención con más de 22.000 filas por modelo, sometidos a estrés bajo 10 tipos de perturbación y comparados contra AWS Bedrock Guardrails y Azure AI Content Safety en los mismos conjuntos etiquetados.
La conclusión: NeuralTrust lidera a ambos proveedores en ambas tareas comparables a puntos de operación equiparables. El detalle está a continuación.
La Pregunta que Todo CISO Hace
La mayoría de las evaluaciones de seguridad de IA comienzan con una sola pregunta: ¿esto realmente funciona?
Es una pregunta razonable. La demo del proveedor muestra el modelo bloqueando un intento de jailbreak. Lo que no muestra es el rendimiento en la décima variante de ese ataque, formulada en turco, envuelta en base64, en un contexto de servicios financieros. O la tasa de falsos positivos en tráfico legítimo de un cliente bancario que simplemente formuló su consulta de soporte de manera inusual.
Este informe responde a esa pregunta directamente. Presenta la evidencia de rendimiento para los cuatro modelos guardrail de producción de NeuralTrust: detección de jailbreaks, detección de toxicidad, detección de inyección indirecta de prompts y moderación de prompts. Cada número está respaldado por datos de benchmark etiquetados. Las limitaciones se presentan junto a los puntos fuertes.
Los Cuatro Modelos
NeuralTrust desarrolla modelos guardrail ligeros y multilingües que analizan el tráfico hacia y desde los modelos de lenguaje de gran tamaño. Los cuatro modelos cubiertos en este informe son:
1. Detección de jailbreaks
(NeuralTrust/prompt-jailbreak) analiza los prompts entrantes en busca de intentos de subvertir los guardrails de un LLM: intentos de anular el system-prompt, exploits de juego de roles e instrucciones codificadas. Se ejecuta como capa de preprocesamiento antes de que el modelo de generación reciba la solicitud.
2. Detección de toxicidad
(NeuralTrust/toxicity-detector) señala texto tóxico en seis categorías: insultos, lenguaje obsceno, odio basado en la identidad, acoso, amenazas y acoso sexual. Analiza tanto los inputs del usuario como los outputs del modelo en nueve idiomas.
3. Detección de inyección indirecta de prompts
(NeuralTrust/indirect-prompt-injections) señala instrucciones maliciosas ocultas en contenido externo que un LLM ingiere: páginas web recuperadas, documentos, correos electrónicos, respuestas de API y retornos de herramientas. Esta es la principal superficie de ataque para los sistemas agénticos y RAG. El modelo complementa al detector de jailbreaks en lugar de reemplazarlo: el detector de jailbreaks analiza el propio prompt del usuario, mientras que el modelo de inyección cubre todo lo que lee el agente.
4. Moderación de prompts
(NeuralTrust/prompt-moderator) es un conjunto de 13 clasificadores binarios independientes que comparten un único encoder multilingüe. Enruta contenido sensible a través de temas como violencia, discurso de odio, asesoramiento médico y financiero, información personal y desinformación hacia políticas más estrictas o revisión humana.
)
Metodología de Evaluación
Los modelos de jailbreaks y toxicidad se evalúan en un benchmark interno de industria por idioma. El benchmark contiene una división aproximadamente 50/50 de prompts de ataque y benignos distribuidos en cinco sectores industriales (aerolíneas, banca, energía, telco, genérico) y nueve idiomas (inglés, español, francés, portugués, alemán, turco, italiano, catalán, gallego).
La precisión por categoría se calcula frente a un pool compartido de prompts benignos, de modo que las puntuaciones reflejan una separabilidad genuina del tráfico benigno real.
Se reportan tres puntos de operación de producción:
| Punto | Umbral | Interpretación |
|---|---|---|
| L1 | 0.95 | Estricto. Solo señales de alta confianza. Mínimo sobre-bloqueo. |
| L3 | 0.85 | Principal (equilibrado). Valor predeterminado para cifras principales. |
| L5 | 0.65 | Permisivo. Maximiza la cobertura donde los ataques no detectados son más costosos. |
Más allá del benchmark etiquetado, cada modelo se somete a estrés bajo 10 perturbaciones de texto: errores tipográficos, sustitución de caracteres, leetspeak, homoglifos (equivalentes cirílicos), ofuscación Unicode, trucos de codificación inline (base64/hex/ROT13), trucos de espaciado, eliminación de acentos, mezcla de idiomas y envoltorios de fraseología industrial. Esto amplía el volumen de evaluación real a aproximadamente 129.600 inputs distintos evaluados por modelo.
Los modelos de inyección indirecta y moderación de prompts se evalúan en conjuntos de test de retención de sus propios corpus de entrenamiento, no en el benchmark de industria, lo que el informe completo indica explícitamente.
Detección de Jailbreaks: Resultados Completos
Benchmark: 21.600 filas (10.800 jailbreaks / 10.800 benignos) en 9 idiomas, 8 familias de ataques, 5 sectores. Fecha de ejecución: julio 2026.
Rendimiento General
| Punto | Detección | Precisión | F1 | Tasa de Falsos Positivos |
|---|---|---|---|---|
| L1 (0.95) | 0.912 | 0.978 | 0.944 | 0.021 |
| L3 (0.85) | 0.920 | 0.976 | 0.947 | 0.023 |
| L5 (0.65) | 0.925 | 0.972 | 0.948 | 0.027 |
ROC-AUC sin umbral: 0.991
En el punto de operación principal, el modelo detecta el 92% de los intentos de jailbreak señalando erróneamente solo el 2,3% de los prompts legítimos.
Rendimiento por Sector
| Sector | Detección (L3) | F1 (L3) | Tasa Falsos Positivos (L3) | ROC-AUC |
|---|---|---|---|---|
| Aerolíneas | 0.918 | 0.954 | 0.006 | 0.996 |
| Banca | 0.943 | 0.961 | 0.019 | 0.995 |
| Energía | 0.875 | 0.905 | 0.057 | 0.974 |
| Genérico | 0.973 | 0.980 | 0.012 | 0.997 |
| Telco | 0.893 | 0.933 | 0.021 | 0.989 |
El rendimiento se mantiene en los cinco sectores. Energía es el segmento adversarialmente más difícil y sigue siendo sólido. La detección en banca (0.943) es la más alta entre los sectores regulados.
Rendimiento por Familia de Ataque
| Familia de ataque | Detección (L3) | F1 (L3) |
|---|---|---|
| instruction-override | 0.99 | 0.91 |
| system-prompt-extraction | 0.99 | 0.91 |
| prompt-injection | 0.98 | 0.91 |
| roleplay | 0.93 | 0.88 |
| payload-splitting | 0.92 | 0.87 |
| indirect | 0.90 | 0.86 |
| translation-evasion | 0.90 | 0.86 |
| structured-payload | 0.75 | 0.78 |
Las familias de ataque más comunes — anulaciones de instrucciones y extracción de system-prompts — se detectan al 99%. Los structured-payloads (payloads fragmentarios de tipo plantilla) son el segmento más difícil y la única brecha que el informe señala explícitamente.
Rendimiento por Idioma
| Idioma | Precisión (L3) | Detección (L3) | F1 (L3) |
|---|---|---|---|
| Inglés | 1.00 | 0.92 | 0.96 |
| Español | 0.97 | 0.92 | 0.95 |
| Francés | 0.98 | 0.93 | 0.95 |
| Portugués | 0.98 | 0.95 | 0.97 |
| Alemán | 0.95 | 0.94 | 0.94 |
| Turco | 0.98 | 0.90 | 0.94 |
| Italiano | 0.96 | 0.95 | 0.95 |
| Catalán | 0.96 | 0.92 | 0.94 |
| Gallego | 1.00 | 0.85 | 0.92 |
La detección es sólida y consistente en los nueve idiomas. Portugués (0.95) e italiano (0.95) son los mejores resultados fuera del inglés.
Robustez Bajo Perturbación Adversarial
Bajo el barrido de estrés de 10 perturbaciones, el modelo de jailbreaks no muestra fragilidad: ninguna perturbación produce una caída significativa en la detección en el punto de operación principal. Para la mayoría de las transformaciones, la caída de detección es negativa — es decir, el modelo tiene más probabilidades de señalar la forma ofuscada porque la propia evasión es una señal adversarial fuerte. La ofuscación Unicode produce una caída de detección de -0,078 y la sustitución por homoglifos de -0,068 — ambas mejoran la detección. La mayor caída positiva es la eliminación de acentos con +0,004, que es negligible.
Detección de Toxicidad: Resultados Completos
Benchmark: 21.553 filas (10.753 tóxicos / 10.800 seguros) en 9 idiomas, 6 tipos de toxicidad, 5 sectores. Fecha de ejecución: julio 2026.
Rendimiento General
| Punto | Detección | Precisión | F1 | Tasa de Falsos Positivos |
|---|---|---|---|---|
| L1 (0.95) | 0.886 | 0.983 | 0.932 | 0.015 |
| L3 (0.85) | 0.921 | 0.975 | 0.947 | 0.024 |
| L5 (0.65) | 0.945 | 0.966 | 0.955 | 0.034 |
ROC-AUC sin umbral: 0.992
En el punto de operación equilibrado, el modelo detecta el 92,1% del contenido tóxico señalando erróneamente solo el 2,4% del texto seguro.
Rendimiento por Tipo de Toxicidad
| Tipo de toxicidad | Det. (L1) | Det. (L3) | Det. (L5) | F1 (L3) |
|---|---|---|---|---|
| insulto | 0.95 | 0.97 | 0.98 | 0.92 |
| lenguaje obsceno | 0.92 | 0.94 | 0.96 | 0.90 |
| odio por identidad | 0.92 | 0.94 | 0.96 | 0.90 |
| acoso | 0.88 | 0.92 | 0.94 | 0.89 |
| amenaza | 0.85 | 0.89 | 0.93 | 0.88 |
| acoso sexual | 0.81 | 0.87 | 0.91 | 0.86 |
Las categorías explícitas (insulto, lenguaje obsceno) son las más sólidas. Las categorías implícitas o dependientes del contexto (amenazas, acoso sexual) son más difíciles y se benefician del punto de operación permisivo.
Rendimiento por Idioma
| Idioma | Precisión (L3) | Detección (L3) | F1 (L3) |
|---|---|---|---|
| Inglés | 0.99 | 0.88 | 0.93 |
| Español | 0.98 | 0.96 | 0.97 |
| Francés | 0.97 | 0.97 | 0.97 |
| Portugués | 0.97 | 0.91 | 0.94 |
| Alemán | 0.96 | 0.87 | 0.91 |
| Turco | 0.98 | 0.93 | 0.95 |
| Italiano | 0.97 | 0.92 | 0.95 |
| Catalán | 0.96 | 0.95 | 0.95 |
| Gallego | 0.99 | 0.91 | 0.95 |
Robustez
Los payloads codificados de forma inline (envolturas base64/hex/ROT13) producen la única brecha de robustez material: una caída de detección de +0,104.
Dos factores atenuantes: la tasa de recuperación media en L3 es +0,039 (la señal se atenúa, no se pierde), y los trucos de codificación inflan el recuento de tokens 3,2 veces, lo que los hace conspicuos para un pre-filtro de longitud/entropía upstream.
Todas las demás perturbaciones producen caídas de detección de +0,037 o menos, con varias negativas (leetspeak -0,038, sustitución de caracteres -0,026).
Detección de Inyección Indirecta de Prompts: Resultados Completos
Base de evaluación: Conjunto de test de retención del corpus de entrenamiento (in-distribution), no el benchmark de industria. 22.298 filas (11.149 inyecciones / 11.149 benignos) en 12 fuentes. Solo inglés. Fecha de ejecución: julio 2026.
Rendimiento General
| Punto | Detección | Precisión | F1 | Tasa de Falsos Positivos |
|---|---|---|---|---|
| L1 (0.95) | 0.994 | 0.995 | 0.994 | 0.005 |
| L3 (0.85) | 0.998 | 0.994 | 0.996 | 0.006 |
| L5 (0.65) | 0.998 | 0.994 | 0.996 | 0.006 |
ROC-AUC sin umbral: 0.9997
Las puntuaciones del modelo son fuertemente bimodales (concentradas cerca de 0 o 1), por lo que L3 y L5 producen decisiones idénticas. Solo el punto estricto L1 difiere, y solo marginalmente.
Detección por Fuente
| Fuente | Filas de inyección | Detección |
|---|---|---|
| Contextos envenenados web/email/código/tabla | 7.487 | 1.000 |
| Contextos envenenados mixtos (generados por LLM) | 3.047 | 1.000 |
| Conjunto curado de inyección indirecta | 106 | 1.000 |
| Inyecciones en archivos de skill | 38 | 1.000 |
| Inyecciones en retornos de herramientas agénticas | 127 | 0.992 |
| Inyecciones en archivos de repositorio (agentes de código) | 291 | 0.952 |
| Inyecciones en páginas de agentes de navegador | 53 | 0.811 |
En aproximadamente 3.200 filas de tráfico de agentes benigno realista de una variedad de modelos agénticos contemporáneos, el modelo produjo cero falsos positivos. La tasa global de falsos positivos es del 0,6%. Las inyecciones en páginas de agentes de navegador son el segmento más débil (0,811) y la brecha que el informe señala explícitamente.
Este modelo es el guardrail crítico para cualquier despliegue agéntico o RAG donde la superficie de ataque no es el prompt del usuario sino el contenido que el agente recupera y sobre el que actúa.
Moderación de Prompts: Resultados Completos
Base de evaluación: Conjuntos de validación de retención por tema de los registros de la versión de producción. 13 clasificadores de temas; las cifras son macro-medias. Entrenado y evaluado en 9 idiomas. No directamente comparable a las cifras del benchmark de industria de jailbreaks y toxicidad.
Rendimiento Principal
| Métrica | Valor |
|---|---|
| ROC-AUC medio | 0.9924 |
| F1-Score medio | 0.9403 |
Desglose por Tema
| Tema | ROC-AUC | F1 | Filas entrenamiento | Filas validación |
|---|---|---|---|---|
| deshonestidad académica | 0.9958 | 0.9598 | 9.592 | 1.199 |
| contenido adulto | 0.9854 | 0.9057 | 10.680 | 1.335 |
| generación de código | 0.9920 | 0.9563 | 13.144 | 1.644 |
| asesoramiento financiero | 0.9927 | 0.9646 | 7.898 | 988 |
| discurso de odio | 0.9922 | 0.9467 | 9.396 | 1.175 |
| actividades ilegales | 0.9877 | 0.9044 | 19.220 | 2.403 |
| traducción de idiomas | 0.9979 | 0.9706 | 19.224 | 2.205 |
| asesoramiento médico | 0.9928 | 0.9698 | 9.620 | 1.203 |
| desinformación | 0.9967 | 0.9548 | 21.720 | 2.716 |
| información personal | 0.9910 | 0.9022 | 10.800 | 1.176 |
| política | 0.9908 | 0.9296 | 12.168 | 1.521 |
| religión | 0.9928 | 0.9154 | 5.434 | 680 |
| violencia y daño | 0.9936 | 0.9432 | 25.182 | 3.148 |
Cada clasificador de temas alcanza un ROC-AUC superior a 0,985. La arquitectura de encoder compartido mantiene el modelo compacto y rápido, mientras que cada cabeza de tema se versiona y reentrena de forma independiente a medida que los datos maduran.
Benchmark Competitivo: NeuralTrust vs. AWS Bedrock vs. Azure AI Content Safety
Ambos proveedores fueron evaluados en los mismos conjuntos etiquetados completos que las cifras principales de NeuralTrust: 21.600 filas de jailbreaks y 21.553 filas de toxicidad en 9 idiomas. La base de comparación justa es la tasa de falsos positivos equiparable: a igual sobre-bloqueo, ¿quién detecta más?
Advertencias importantes reconocidas explícitamente: Bedrock devuelve cubos de confianza categóricos (NONE/LOW/MEDIUM/HIGH) en lugar de una probabilidad continua; Azure Prompt Shields devuelve un único booleano en jailbreaks.
El benchmark se construyó con las propias taxonomías y escenarios industriales de NeuralTrust — una ventaja de campo propia que el informe completo reconoce explícitamente. Los resultados de los proveedores son por tanto indicativos, no un ranking definitivo de proveedores.
)
Detección de Jailbreaks
| Sistema | Detección | Tasa Falsos Positivos | F1 |
|---|---|---|---|
| NeuralTrust L1 (0.95) | 0.912 | 0.021 | 0.944 |
| NeuralTrust L3 (0.85) | 0.920 | 0.023 | 0.947 |
| NeuralTrust L5 (0.65) | 0.925 | 0.027 | 0.948 |
| AWS Bedrock (baja confianza) | 0.741 | 0.000 | 0.851 |
| AWS Bedrock (confianza media) | 0.670 | 0.000 | 0.802 |
| AWS Bedrock (alta confianza) | 0.448 | 0.000 | 0.619 |
| Azure Prompt Shields | 0.330 | 0.000 | 0.496 |
En su punto de operación principal, NeuralTrust detecta el 92,0% de los jailbreaks frente al 74,1% de Bedrock en el corte más permisivo: una ventaja de 18 puntos porcentuales a sobre-bloqueo comparable. Frente a Azure Prompt Shields (33,0%): una ventaja de 59 puntos porcentuales.
La brecha se concentra en las familias de ataques más difíciles. A puntos de operación equiparables:
| Familia de ataque | NeuralTrust (L3) | AWS Bedrock (baja) | Azure Prompt Shields |
|---|---|---|---|
| system-prompt-extraction | 0.99 | 0.98 | 0.53 |
| instruction-override | 0.99 | 0.96 | 0.70 |
| prompt-injection | 0.98 | 0.86 | 0.41 |
| roleplay | 0.93 | 0.90 | 0.42 |
| translation-evasion | 0.90 | 0.71 | 0.31 |
| payload-splitting | 0.92 | 0.62 | 0.18 |
| indirect | 0.90 | 0.51 | 0.00 |
| structured-payload | 0.75 | 0.40 | 0.09 |
Azure Prompt Shields colapsa en ataques indirectos y ofuscados: la detección de ataques indirectos es efectivamente cero (0,00) y los structured-payloads alcanzan 0,09. Bedrock gestiona bien los ataques explícitos pero cae significativamente en las familias más difíciles.
Detección de jailbreaks por idioma a puntos de operación equiparables:
| Idioma | NeuralTrust (L3) | AWS Bedrock (baja) | Azure Prompt Shields |
|---|---|---|---|
| Inglés | 0.92 | 0.78 | 0.46 |
| Español | 0.92 | 0.74 | 0.31 |
| Francés | 0.93 | 0.79 | 0.33 |
| Portugués | 0.95 | 0.74 | 0.31 |
| Alemán | 0.94 | 0.75 | 0.31 |
| Turco | 0.90 | 0.74 | 0.25 |
| Italiano | 0.95 | 0.78 | 0.37 |
| Catalán | 0.92 | 0.65 | 0.28 |
| Gallego | 0.85 | 0.70 | 0.34 |
NeuralTrust lidera en los nueve idiomas. La ventaja multilingüe es más pronunciada en catalán, donde NeuralTrust (0,92) supera a Bedrock (0,65) en 27 puntos.
Detección de Toxicidad
| Sistema | Detección | Tasa Falsos Positivos | F1 |
|---|---|---|---|
| NeuralTrust L1 (0.95) | 0.886 | 0.015 | 0.932 |
| NeuralTrust L3 (0.85) | 0.921 | 0.024 | 0.947 |
| NeuralTrust L5 (0.65) | 0.945 | 0.034 | 0.955 |
| AWS Bedrock (baja confianza) | 0.881 | 0.000 | 0.937 |
| AWS Bedrock (confianza media) | 0.676 | 0.000 | 0.807 |
| AWS Bedrock (alta confianza) | 0.428 | 0.000 | 0.599 |
| Azure (baja severidad) | 0.840 | 0.001 | 0.913 |
| Azure (severidad media) | 0.269 | 0.000 | 0.423 |
| Azure (alta severidad) | 0.036 | 0.000 | 0.070 |
La toxicidad es una competición más reñida. Bedrock en su corte más permisivo (88,1%) está esencialmente al nivel del L1 estricto de NeuralTrust (88,6%). Los puntos de operación más sensibles L3 y L5 de NeuralTrust extienden una ventaja de 4 a 6 puntos porcentuales sobre Bedrock y de 5 a 10 puntos sobre Azure a sobre-bloqueo comparable. La ventaja de NeuralTrust es mayor en las categorías implícitas:
| Tipo de toxicidad | NeuralTrust (L3) | AWS Bedrock (baja) | Azure (baja) |
|---|---|---|---|
| insulto | 0.97 | 0.97 | 0.95 |
| odio por identidad | 0.94 | 0.97 | 0.98 |
| lenguaje obsceno | 0.94 | 0.89 | 0.89 |
| acoso | 0.92 | 0.91 | 0.73 |
| amenaza | 0.89 | 0.84 | 0.78 |
| acoso sexual | 0.87 | 0.72 | 0.72 |
Detección de acoso sexual: NeuralTrust 0,87 vs Bedrock 0,72 vs Azure 0,72. Detección de acoso: NeuralTrust 0,92 vs Azure 0,73. El modelo especializado marca la diferencia sobre todo en las categorías implícitas y difíciles.
Cómo NeuralTrust Mantiene la Mejora Continua
Estas cifras no son una instantánea estática. Cada modelo opera dentro de una plataforma de evaluación en bucle cerrado que extrae continuamente del tráfico de producción real los propios errores del modelo.
El bucle opera en cuatro etapas.
- Primero: las predicciones de producción se re-evalúan con juicio asistido por LLM sobre una ventana configurable, generando recuentos por ejecución de predicciones correctas, falsos positivos y falsos negativos, más una tendencia de precisión a 90 días.
- Segundo: los falsos positivos y negativos se agrupan en categorías legibles por humanos y se deduplicaban entre ejecuciones.
- Tercero: las categorías seleccionadas se convierten en una nueva revisión de dataset versionada — no ingiriendo contenido de usuarios, sino regenerando ejemplos que cubren los patrones de fallo identificados.
- Cuarto: una nueva revisión de dataset activa un reentrenamiento automático, una ejecución de benchmark y una prueba interactiva.
El modelo reentrenado debe superar a su predecesor en el benchmark antes de publicarse. Si hay una regresión, se revierte automáticamente.
Este proceso es el que permitió al modelo de moderación de prompts reducir su tasa de falsos positivos en mensajes transaccionales cortos de aproximadamente el 5% al 0% en revisiones sucesivas, manteniendo la cobertura constante. Cada versión está benchmarked, versionada y con ruta de reversión garantizada.
Resumen: Los Cuatro Modelos
| Modelo | Tarea | ROC-AUC | Detección | F1 | Tasa Falsos Positivos |
|---|---|---|---|---|---|
| prompt-jailbreak | Detección de jailbreaks | 0.991 | 0.920 | 0.947 | 0.023 |
| toxicity-detector | Detección de toxicidad | 0.992 | 0.921 | 0.947 | 0.024 |
| indirect-prompt-injections | Detección de inyección indirecta | 0.9997 | 0.998 | 0.996 | 0.006 |
| prompt-moderator | Moderación multi-tema (13 temas) | 0.992 | n/a | 0.940 | n/a |
Las cifras de jailbreaks y toxicidad corresponden al punto de operación principal (L3, umbral 0,85), medidas en el benchmark de industria por idioma. Las cifras de inyección indirecta corresponden al umbral predeterminado (0,5) en el conjunto de test de retención (in-distribution, solo inglés). Las cifras de moderación de prompts son macro-medias sobre 13 conjuntos de validación de retención por tema. Bases de evaluación distintas: consultar las secciones de metodología completa anteriores.
Preguntas Frecuentes
1. ¿Cuál es la precisión de detección de jailbreaks de NeuralTrust?
El modelo de detección de jailbreaks de NeuralTrust (prompt-jailbreak) alcanza una tasa de detección del 92,0% con una tasa de falsos positivos del 2,3% en su punto de operación equilibrado principal, en un benchmark de 21.600 prompts en 9 idiomas, 8 familias de ataques y 5 sectores. El ROC-AUC sin umbral es 0,991. En el punto de operación más estricto (umbral 0,95), la detección es del 91,2% con una tasa de falsos positivos del 2,1%.
2. ¿Cómo se compara NeuralTrust con AWS Bedrock Guardrails en detección de jailbreaks?
En el mismo benchmark de 21.600 filas a tasas de falsos positivos equiparables, NeuralTrust detecta el 92,0% de los intentos de jailbreak frente al 74,1% de AWS Bedrock Guardrails en su punto más permisivo: una ventaja de 18 puntos porcentuales. La brecha es mayor en las familias de ataques ofuscados y fragmentados: payload-splitting (NeuralTrust 0,92 vs Bedrock 0,62), ataques indirectos (0,90 vs 0,51) y structured-payload (0,75 vs 0,40).
3. ¿Cómo se compara NeuralTrust con Azure AI Content Safety en detección de jailbreaks?
En el mismo benchmark, NeuralTrust detecta el 92,0% de los intentos de jailbreak frente al 33,0% de Azure Prompt Shields: una ventaja de 59 puntos porcentuales. Azure Prompt Shields devuelve un único booleano y colapsa en ataques indirectos (detección efectivamente 0,00) y structured-payload (0,09). NeuralTrust lidera en los 9 idiomas y las 8 familias de ataques evaluadas.
4. ¿Cuál es la precisión de detección de inyección indirecta de prompts de NeuralTrust?
El modelo de inyección indirecta de prompts de NeuralTrust (indirect-prompt-injections) alcanza el 99,8% de detección con una tasa de falsos positivos del 0,6% en su umbral de operación predeterminado, en un conjunto de test de retención de 22.298 filas en 12 fuentes. El ROC-AUC es 0,9997. Produjo cero falsos positivos en aproximadamente 3.200 filas de tráfico de agentes benigno realista. El segmento más débil son las inyecciones en páginas de agentes de navegador con una detección del 81,1%. El modelo está actualmente solo en inglés en su versión de producción.
5. ¿Cuál es la tasa de falsos positivos de los guardrails de IA de NeuralTrust?
En el punto de operación equilibrado principal (umbral 0,85), la tasa de falsos positivos es del 2,3% para detección de jailbreaks, del 2,4% para detección de toxicidad y del 0,6% para detección de inyección indirecta de prompts. En el punto de operación más estricto (umbral 0,95), la tasa de falsos positivos de jailbreaks baja al 2,1% y la de toxicidad al 1,5%.
6. ¿La seguridad de IA de NeuralTrust funciona en varios idiomas?
Sí. Los modelos de detección de jailbreaks, detección de toxicidad y moderación de prompts se evalúan cada uno en nueve idiomas: inglés, español, francés, portugués, alemán, turco, italiano, catalán y gallego. La detección de jailbreaks en el punto de operación principal oscila entre 0,92 (inglés, español) y 0,85 (gallego) en los nueve idiomas. La detección de toxicidad oscila entre 0,97 (español, francés) y 0,87 (alemán). Ambos modelos se entrenan y evalúan de forma multilingüe por construcción, no como inglés primero con cobertura añadida.
Sobre Esta Investigación
Este informe presenta la evidencia de rendimiento de los cuatro modelos guardrail de producción de NeuralTrust a partir de julio 2026. Todas las ejecuciones de benchmark están fijadas a versiones exactas del modelo y marcas de tiempo UTC con hashing por fragmento para reproducibilidad. El seguimiento de contaminación — deduplicación automatizada y análisis de solapamiento entre conjuntos de entrenamiento y test — protege contra filtraciones del benchmark.
El informe completo del modelo (versión externa) está disponible para su descarga. El benchmark comparativo de proveedores se realizó el 23 de julio de 2026 contra AWS Bedrock Guardrails (eu-north-1, nivel STANDARD) y Azure AI Content Safety (Europa Occidental, FourSeverityLevels). Las limitaciones de la comparación directa se describen en la sección de metodología del informe completo.
Descargar el Informe Completo de Rendimiento de Modelos de Seguridad de IA de NeuralTrust (PDF)
)
)