🚨 NeuralTrust levanta 20M$
Volver

Informe de Rendimiento de Modelos de Seguridad de IA 2026

NeuralTrust Team 31 de julio de 2026
Compartir
Informe de Rendimiento de Modelos de Seguridad de IA 2026

¿Cuál es el rendimiento de los modelos de seguridad de IA de NeuralTrust?

Los modelos guardrail de NeuralTrust alcanzan puntuaciones ROC-AUC de 0.991 a 0.9997 en cuatro tareas: detección de jailbreaks (tasa de detección del 92%, tasa de falsos positivos del 2,3%), detección de toxicidad (tasa de detección del 92,1%, tasa de falsos positivos del 2,4%), detección de inyección indirecta de prompts (tasa de detección del 99,8%, tasa de falsos positivos del 0,6%) y moderación de prompts en 13 temas (ROC-AUC medio de 0,992).

Todos los modelos están benchmarked en 9 idiomas y 5 sectores industriales. En detección de jailbreaks, NeuralTrust supera a AWS Bedrock Guardrails en 18 puntos porcentuales y a Azure AI Content Safety en 59 puntos porcentuales a tasas de falsos positivos equiparables.


TL;DR - Puntos Clave

  • El modelo de detección de jailbreaks de NeuralTrust alcanza el 92% de detección con una tasa de falsos positivos del 2,3%, benchmarked en 21.600 prompts en 9 idiomas, 8 familias de ataques y 5 sectores industriales.
  • El modelo de detección de inyección indirecta de prompts alcanza el 99,8% de detección con una tasa de falsos positivos del 0,6% y cero falsos positivos en tráfico benigno de agentes realista — diseñado específicamente para despliegues agénticos y RAG.
  • A tasas de falsos positivos equiparables, NeuralTrust supera a AWS Bedrock Guardrails en 18 puntos porcentuales en detección de jailbreaks y en 4-6 puntos en detección de toxicidad.
  • A tasas de falsos positivos equiparables, NeuralTrust supera a Azure AI Content Safety (Prompt Shields) en 59 puntos porcentuales en detección de jailbreaks y en 5-10 puntos en detección de toxicidad.
  • Cada modelo se somete a pruebas de estrés bajo 10 perturbaciones de texto adversariales, totalizando aproximadamente 129.600 inputs distintos evaluados por modelo.
  • Una plataforma de evaluación en bucle cerrado extrae continuamente falsos positivos y negativos de producción y los incorpora a reentrenamientos versionados y benchmarked, de modo que cada versión debe superar a la anterior antes de publicarse.

Cualquier equipo de seguridad empresarial que evalúe guardrails de IA necesita los mismos tres números: tasa de detección, tasa de falsos positivos y cómo se mantienen esos números bajo presión adversarial.

Este informe proporciona los tres para los cuatro modelos guardrail de producción de NeuralTrust, medidos en benchmarks de retención con más de 22.000 filas por modelo, sometidos a estrés bajo 10 tipos de perturbación y comparados contra AWS Bedrock Guardrails y Azure AI Content Safety en los mismos conjuntos etiquetados.

La conclusión: NeuralTrust lidera a ambos proveedores en ambas tareas comparables a puntos de operación equiparables. El detalle está a continuación.


La Pregunta que Todo CISO Hace

La mayoría de las evaluaciones de seguridad de IA comienzan con una sola pregunta: ¿esto realmente funciona?

Es una pregunta razonable. La demo del proveedor muestra el modelo bloqueando un intento de jailbreak. Lo que no muestra es el rendimiento en la décima variante de ese ataque, formulada en turco, envuelta en base64, en un contexto de servicios financieros. O la tasa de falsos positivos en tráfico legítimo de un cliente bancario que simplemente formuló su consulta de soporte de manera inusual.

Este informe responde a esa pregunta directamente. Presenta la evidencia de rendimiento para los cuatro modelos guardrail de producción de NeuralTrust: detección de jailbreaks, detección de toxicidad, detección de inyección indirecta de prompts y moderación de prompts. Cada número está respaldado por datos de benchmark etiquetados. Las limitaciones se presentan junto a los puntos fuertes.


Los Cuatro Modelos

NeuralTrust desarrolla modelos guardrail ligeros y multilingües que analizan el tráfico hacia y desde los modelos de lenguaje de gran tamaño. Los cuatro modelos cubiertos en este informe son:

1. Detección de jailbreaks

(NeuralTrust/prompt-jailbreak) analiza los prompts entrantes en busca de intentos de subvertir los guardrails de un LLM: intentos de anular el system-prompt, exploits de juego de roles e instrucciones codificadas. Se ejecuta como capa de preprocesamiento antes de que el modelo de generación reciba la solicitud.

2. Detección de toxicidad

(NeuralTrust/toxicity-detector) señala texto tóxico en seis categorías: insultos, lenguaje obsceno, odio basado en la identidad, acoso, amenazas y acoso sexual. Analiza tanto los inputs del usuario como los outputs del modelo en nueve idiomas.

3. Detección de inyección indirecta de prompts

(NeuralTrust/indirect-prompt-injections) señala instrucciones maliciosas ocultas en contenido externo que un LLM ingiere: páginas web recuperadas, documentos, correos electrónicos, respuestas de API y retornos de herramientas. Esta es la principal superficie de ataque para los sistemas agénticos y RAG. El modelo complementa al detector de jailbreaks en lugar de reemplazarlo: el detector de jailbreaks analiza el propio prompt del usuario, mientras que el modelo de inyección cubre todo lo que lee el agente.

4. Moderación de prompts

(NeuralTrust/prompt-moderator) es un conjunto de 13 clasificadores binarios independientes que comparten un único encoder multilingüe. Enruta contenido sensible a través de temas como violencia, discurso de odio, asesoramiento médico y financiero, información personal y desinformación hacia políticas más estrictas o revisión humana.

Diagram showing NeuralTrust's four guardrail models as sequential layers in a production LLM pipeline: jailbreak detection on inbound prompts, indirect injection detection on retrieved content, toxicity detection on outputs, and prompt moderation for topic routing


Metodología de Evaluación

Los modelos de jailbreaks y toxicidad se evalúan en un benchmark interno de industria por idioma. El benchmark contiene una división aproximadamente 50/50 de prompts de ataque y benignos distribuidos en cinco sectores industriales (aerolíneas, banca, energía, telco, genérico) y nueve idiomas (inglés, español, francés, portugués, alemán, turco, italiano, catalán, gallego).

La precisión por categoría se calcula frente a un pool compartido de prompts benignos, de modo que las puntuaciones reflejan una separabilidad genuina del tráfico benigno real.

Se reportan tres puntos de operación de producción:

PuntoUmbralInterpretación
L10.95Estricto. Solo señales de alta confianza. Mínimo sobre-bloqueo.
L30.85Principal (equilibrado). Valor predeterminado para cifras principales.
L50.65Permisivo. Maximiza la cobertura donde los ataques no detectados son más costosos.

Más allá del benchmark etiquetado, cada modelo se somete a estrés bajo 10 perturbaciones de texto: errores tipográficos, sustitución de caracteres, leetspeak, homoglifos (equivalentes cirílicos), ofuscación Unicode, trucos de codificación inline (base64/hex/ROT13), trucos de espaciado, eliminación de acentos, mezcla de idiomas y envoltorios de fraseología industrial. Esto amplía el volumen de evaluación real a aproximadamente 129.600 inputs distintos evaluados por modelo.

Los modelos de inyección indirecta y moderación de prompts se evalúan en conjuntos de test de retención de sus propios corpus de entrenamiento, no en el benchmark de industria, lo que el informe completo indica explícitamente.


Detección de Jailbreaks: Resultados Completos

Benchmark: 21.600 filas (10.800 jailbreaks / 10.800 benignos) en 9 idiomas, 8 familias de ataques, 5 sectores. Fecha de ejecución: julio 2026.

Rendimiento General

PuntoDetecciónPrecisiónF1Tasa de Falsos Positivos
L1 (0.95)0.9120.9780.9440.021
L3 (0.85)0.9200.9760.9470.023
L5 (0.65)0.9250.9720.9480.027

ROC-AUC sin umbral: 0.991

En el punto de operación principal, el modelo detecta el 92% de los intentos de jailbreak señalando erróneamente solo el 2,3% de los prompts legítimos.

Rendimiento por Sector

SectorDetección (L3)F1 (L3)Tasa Falsos Positivos (L3)ROC-AUC
Aerolíneas0.9180.9540.0060.996
Banca0.9430.9610.0190.995
Energía0.8750.9050.0570.974
Genérico0.9730.9800.0120.997
Telco0.8930.9330.0210.989

El rendimiento se mantiene en los cinco sectores. Energía es el segmento adversarialmente más difícil y sigue siendo sólido. La detección en banca (0.943) es la más alta entre los sectores regulados.

Rendimiento por Familia de Ataque

Familia de ataqueDetección (L3)F1 (L3)
instruction-override0.990.91
system-prompt-extraction0.990.91
prompt-injection0.980.91
roleplay0.930.88
payload-splitting0.920.87
indirect0.900.86
translation-evasion0.900.86
structured-payload0.750.78

Las familias de ataque más comunes — anulaciones de instrucciones y extracción de system-prompts — se detectan al 99%. Los structured-payloads (payloads fragmentarios de tipo plantilla) son el segmento más difícil y la única brecha que el informe señala explícitamente.

Rendimiento por Idioma

IdiomaPrecisión (L3)Detección (L3)F1 (L3)
Inglés1.000.920.96
Español0.970.920.95
Francés0.980.930.95
Portugués0.980.950.97
Alemán0.950.940.94
Turco0.980.900.94
Italiano0.960.950.95
Catalán0.960.920.94
Gallego1.000.850.92

La detección es sólida y consistente en los nueve idiomas. Portugués (0.95) e italiano (0.95) son los mejores resultados fuera del inglés.

Robustez Bajo Perturbación Adversarial

Bajo el barrido de estrés de 10 perturbaciones, el modelo de jailbreaks no muestra fragilidad: ninguna perturbación produce una caída significativa en la detección en el punto de operación principal. Para la mayoría de las transformaciones, la caída de detección es negativa — es decir, el modelo tiene más probabilidades de señalar la forma ofuscada porque la propia evasión es una señal adversarial fuerte. La ofuscación Unicode produce una caída de detección de -0,078 y la sustitución por homoglifos de -0,068 — ambas mejoran la detección. La mayor caída positiva es la eliminación de acentos con +0,004, que es negligible.


Detección de Toxicidad: Resultados Completos

Benchmark: 21.553 filas (10.753 tóxicos / 10.800 seguros) en 9 idiomas, 6 tipos de toxicidad, 5 sectores. Fecha de ejecución: julio 2026.

Rendimiento General

PuntoDetecciónPrecisiónF1Tasa de Falsos Positivos
L1 (0.95)0.8860.9830.9320.015
L3 (0.85)0.9210.9750.9470.024
L5 (0.65)0.9450.9660.9550.034

ROC-AUC sin umbral: 0.992

En el punto de operación equilibrado, el modelo detecta el 92,1% del contenido tóxico señalando erróneamente solo el 2,4% del texto seguro.

Rendimiento por Tipo de Toxicidad

Tipo de toxicidadDet. (L1)Det. (L3)Det. (L5)F1 (L3)
insulto0.950.970.980.92
lenguaje obsceno0.920.940.960.90
odio por identidad0.920.940.960.90
acoso0.880.920.940.89
amenaza0.850.890.930.88
acoso sexual0.810.870.910.86

Las categorías explícitas (insulto, lenguaje obsceno) son las más sólidas. Las categorías implícitas o dependientes del contexto (amenazas, acoso sexual) son más difíciles y se benefician del punto de operación permisivo.

Rendimiento por Idioma

IdiomaPrecisión (L3)Detección (L3)F1 (L3)
Inglés0.990.880.93
Español0.980.960.97
Francés0.970.970.97
Portugués0.970.910.94
Alemán0.960.870.91
Turco0.980.930.95
Italiano0.970.920.95
Catalán0.960.950.95
Gallego0.990.910.95

Robustez

Los payloads codificados de forma inline (envolturas base64/hex/ROT13) producen la única brecha de robustez material: una caída de detección de +0,104.

Dos factores atenuantes: la tasa de recuperación media en L3 es +0,039 (la señal se atenúa, no se pierde), y los trucos de codificación inflan el recuento de tokens 3,2 veces, lo que los hace conspicuos para un pre-filtro de longitud/entropía upstream.

Todas las demás perturbaciones producen caídas de detección de +0,037 o menos, con varias negativas (leetspeak -0,038, sustitución de caracteres -0,026).


Detección de Inyección Indirecta de Prompts: Resultados Completos

Base de evaluación: Conjunto de test de retención del corpus de entrenamiento (in-distribution), no el benchmark de industria. 22.298 filas (11.149 inyecciones / 11.149 benignos) en 12 fuentes. Solo inglés. Fecha de ejecución: julio 2026.

Rendimiento General

PuntoDetecciónPrecisiónF1Tasa de Falsos Positivos
L1 (0.95)0.9940.9950.9940.005
L3 (0.85)0.9980.9940.9960.006
L5 (0.65)0.9980.9940.9960.006

ROC-AUC sin umbral: 0.9997

Las puntuaciones del modelo son fuertemente bimodales (concentradas cerca de 0 o 1), por lo que L3 y L5 producen decisiones idénticas. Solo el punto estricto L1 difiere, y solo marginalmente.

Detección por Fuente

FuenteFilas de inyecciónDetección
Contextos envenenados web/email/código/tabla7.4871.000
Contextos envenenados mixtos (generados por LLM)3.0471.000
Conjunto curado de inyección indirecta1061.000
Inyecciones en archivos de skill381.000
Inyecciones en retornos de herramientas agénticas1270.992
Inyecciones en archivos de repositorio (agentes de código)2910.952
Inyecciones en páginas de agentes de navegador530.811

En aproximadamente 3.200 filas de tráfico de agentes benigno realista de una variedad de modelos agénticos contemporáneos, el modelo produjo cero falsos positivos. La tasa global de falsos positivos es del 0,6%. Las inyecciones en páginas de agentes de navegador son el segmento más débil (0,811) y la brecha que el informe señala explícitamente.

Este modelo es el guardrail crítico para cualquier despliegue agéntico o RAG donde la superficie de ataque no es el prompt del usuario sino el contenido que el agente recupera y sobre el que actúa.


Moderación de Prompts: Resultados Completos

Base de evaluación: Conjuntos de validación de retención por tema de los registros de la versión de producción. 13 clasificadores de temas; las cifras son macro-medias. Entrenado y evaluado en 9 idiomas. No directamente comparable a las cifras del benchmark de industria de jailbreaks y toxicidad.

Rendimiento Principal

MétricaValor
ROC-AUC medio0.9924
F1-Score medio0.9403

Desglose por Tema

TemaROC-AUCF1Filas entrenamientoFilas validación
deshonestidad académica0.99580.95989.5921.199
contenido adulto0.98540.905710.6801.335
generación de código0.99200.956313.1441.644
asesoramiento financiero0.99270.96467.898988
discurso de odio0.99220.94679.3961.175
actividades ilegales0.98770.904419.2202.403
traducción de idiomas0.99790.970619.2242.205
asesoramiento médico0.99280.96989.6201.203
desinformación0.99670.954821.7202.716
información personal0.99100.902210.8001.176
política0.99080.929612.1681.521
religión0.99280.91545.434680
violencia y daño0.99360.943225.1823.148

Cada clasificador de temas alcanza un ROC-AUC superior a 0,985. La arquitectura de encoder compartido mantiene el modelo compacto y rápido, mientras que cada cabeza de tema se versiona y reentrena de forma independiente a medida que los datos maduran.


Benchmark Competitivo: NeuralTrust vs. AWS Bedrock vs. Azure AI Content Safety

Ambos proveedores fueron evaluados en los mismos conjuntos etiquetados completos que las cifras principales de NeuralTrust: 21.600 filas de jailbreaks y 21.553 filas de toxicidad en 9 idiomas. La base de comparación justa es la tasa de falsos positivos equiparable: a igual sobre-bloqueo, ¿quién detecta más?

Advertencias importantes reconocidas explícitamente: Bedrock devuelve cubos de confianza categóricos (NONE/LOW/MEDIUM/HIGH) en lugar de una probabilidad continua; Azure Prompt Shields devuelve un único booleano en jailbreaks.

El benchmark se construyó con las propias taxonomías y escenarios industriales de NeuralTrust — una ventaja de campo propia que el informe completo reconoce explícitamente. Los resultados de los proveedores son por tanto indicativos, no un ranking definitivo de proveedores.

Bar chart comparing jailbreak detection rates at matched false-positive rates: NeuralTrust 92.0%, AWS Bedrock Guardrails 74.1%, Azure Prompt Shields 33.0% — July 2026 benchmark

Detección de Jailbreaks

SistemaDetecciónTasa Falsos PositivosF1
NeuralTrust L1 (0.95)0.9120.0210.944
NeuralTrust L3 (0.85)0.9200.0230.947
NeuralTrust L5 (0.65)0.9250.0270.948
AWS Bedrock (baja confianza)0.7410.0000.851
AWS Bedrock (confianza media)0.6700.0000.802
AWS Bedrock (alta confianza)0.4480.0000.619
Azure Prompt Shields0.3300.0000.496

En su punto de operación principal, NeuralTrust detecta el 92,0% de los jailbreaks frente al 74,1% de Bedrock en el corte más permisivo: una ventaja de 18 puntos porcentuales a sobre-bloqueo comparable. Frente a Azure Prompt Shields (33,0%): una ventaja de 59 puntos porcentuales.

La brecha se concentra en las familias de ataques más difíciles. A puntos de operación equiparables:

Familia de ataqueNeuralTrust (L3)AWS Bedrock (baja)Azure Prompt Shields
system-prompt-extraction0.990.980.53
instruction-override0.990.960.70
prompt-injection0.980.860.41
roleplay0.930.900.42
translation-evasion0.900.710.31
payload-splitting0.920.620.18
indirect0.900.510.00
structured-payload0.750.400.09

Azure Prompt Shields colapsa en ataques indirectos y ofuscados: la detección de ataques indirectos es efectivamente cero (0,00) y los structured-payloads alcanzan 0,09. Bedrock gestiona bien los ataques explícitos pero cae significativamente en las familias más difíciles.

Detección de jailbreaks por idioma a puntos de operación equiparables:

IdiomaNeuralTrust (L3)AWS Bedrock (baja)Azure Prompt Shields
Inglés0.920.780.46
Español0.920.740.31
Francés0.930.790.33
Portugués0.950.740.31
Alemán0.940.750.31
Turco0.900.740.25
Italiano0.950.780.37
Catalán0.920.650.28
Gallego0.850.700.34

NeuralTrust lidera en los nueve idiomas. La ventaja multilingüe es más pronunciada en catalán, donde NeuralTrust (0,92) supera a Bedrock (0,65) en 27 puntos.

Detección de Toxicidad

SistemaDetecciónTasa Falsos PositivosF1
NeuralTrust L1 (0.95)0.8860.0150.932
NeuralTrust L3 (0.85)0.9210.0240.947
NeuralTrust L5 (0.65)0.9450.0340.955
AWS Bedrock (baja confianza)0.8810.0000.937
AWS Bedrock (confianza media)0.6760.0000.807
AWS Bedrock (alta confianza)0.4280.0000.599
Azure (baja severidad)0.8400.0010.913
Azure (severidad media)0.2690.0000.423
Azure (alta severidad)0.0360.0000.070

La toxicidad es una competición más reñida. Bedrock en su corte más permisivo (88,1%) está esencialmente al nivel del L1 estricto de NeuralTrust (88,6%). Los puntos de operación más sensibles L3 y L5 de NeuralTrust extienden una ventaja de 4 a 6 puntos porcentuales sobre Bedrock y de 5 a 10 puntos sobre Azure a sobre-bloqueo comparable. La ventaja de NeuralTrust es mayor en las categorías implícitas:

Tipo de toxicidadNeuralTrust (L3)AWS Bedrock (baja)Azure (baja)
insulto0.970.970.95
odio por identidad0.940.970.98
lenguaje obsceno0.940.890.89
acoso0.920.910.73
amenaza0.890.840.78
acoso sexual0.870.720.72

Detección de acoso sexual: NeuralTrust 0,87 vs Bedrock 0,72 vs Azure 0,72. Detección de acoso: NeuralTrust 0,92 vs Azure 0,73. El modelo especializado marca la diferencia sobre todo en las categorías implícitas y difíciles.


Cómo NeuralTrust Mantiene la Mejora Continua

Estas cifras no son una instantánea estática. Cada modelo opera dentro de una plataforma de evaluación en bucle cerrado que extrae continuamente del tráfico de producción real los propios errores del modelo.

El bucle opera en cuatro etapas.

  1. Primero: las predicciones de producción se re-evalúan con juicio asistido por LLM sobre una ventana configurable, generando recuentos por ejecución de predicciones correctas, falsos positivos y falsos negativos, más una tendencia de precisión a 90 días.
  2. Segundo: los falsos positivos y negativos se agrupan en categorías legibles por humanos y se deduplicaban entre ejecuciones.
  3. Tercero: las categorías seleccionadas se convierten en una nueva revisión de dataset versionada — no ingiriendo contenido de usuarios, sino regenerando ejemplos que cubren los patrones de fallo identificados.
  4. Cuarto: una nueva revisión de dataset activa un reentrenamiento automático, una ejecución de benchmark y una prueba interactiva.

El modelo reentrenado debe superar a su predecesor en el benchmark antes de publicarse. Si hay una regresión, se revierte automáticamente.

Este proceso es el que permitió al modelo de moderación de prompts reducir su tasa de falsos positivos en mensajes transaccionales cortos de aproximadamente el 5% al 0% en revisiones sucesivas, manteniendo la cobertura constante. Cada versión está benchmarked, versionada y con ruta de reversión garantizada.


Resumen: Los Cuatro Modelos

ModeloTareaROC-AUCDetecciónF1Tasa Falsos Positivos
prompt-jailbreakDetección de jailbreaks0.9910.9200.9470.023
toxicity-detectorDetección de toxicidad0.9920.9210.9470.024
indirect-prompt-injectionsDetección de inyección indirecta0.99970.9980.9960.006
prompt-moderatorModeración multi-tema (13 temas)0.992n/a0.940n/a

Las cifras de jailbreaks y toxicidad corresponden al punto de operación principal (L3, umbral 0,85), medidas en el benchmark de industria por idioma. Las cifras de inyección indirecta corresponden al umbral predeterminado (0,5) en el conjunto de test de retención (in-distribution, solo inglés). Las cifras de moderación de prompts son macro-medias sobre 13 conjuntos de validación de retención por tema. Bases de evaluación distintas: consultar las secciones de metodología completa anteriores.


Preguntas Frecuentes

1. ¿Cuál es la precisión de detección de jailbreaks de NeuralTrust?

El modelo de detección de jailbreaks de NeuralTrust (prompt-jailbreak) alcanza una tasa de detección del 92,0% con una tasa de falsos positivos del 2,3% en su punto de operación equilibrado principal, en un benchmark de 21.600 prompts en 9 idiomas, 8 familias de ataques y 5 sectores. El ROC-AUC sin umbral es 0,991. En el punto de operación más estricto (umbral 0,95), la detección es del 91,2% con una tasa de falsos positivos del 2,1%.

2. ¿Cómo se compara NeuralTrust con AWS Bedrock Guardrails en detección de jailbreaks?

En el mismo benchmark de 21.600 filas a tasas de falsos positivos equiparables, NeuralTrust detecta el 92,0% de los intentos de jailbreak frente al 74,1% de AWS Bedrock Guardrails en su punto más permisivo: una ventaja de 18 puntos porcentuales. La brecha es mayor en las familias de ataques ofuscados y fragmentados: payload-splitting (NeuralTrust 0,92 vs Bedrock 0,62), ataques indirectos (0,90 vs 0,51) y structured-payload (0,75 vs 0,40).

3. ¿Cómo se compara NeuralTrust con Azure AI Content Safety en detección de jailbreaks?

En el mismo benchmark, NeuralTrust detecta el 92,0% de los intentos de jailbreak frente al 33,0% de Azure Prompt Shields: una ventaja de 59 puntos porcentuales. Azure Prompt Shields devuelve un único booleano y colapsa en ataques indirectos (detección efectivamente 0,00) y structured-payload (0,09). NeuralTrust lidera en los 9 idiomas y las 8 familias de ataques evaluadas.

4. ¿Cuál es la precisión de detección de inyección indirecta de prompts de NeuralTrust?

El modelo de inyección indirecta de prompts de NeuralTrust (indirect-prompt-injections) alcanza el 99,8% de detección con una tasa de falsos positivos del 0,6% en su umbral de operación predeterminado, en un conjunto de test de retención de 22.298 filas en 12 fuentes. El ROC-AUC es 0,9997. Produjo cero falsos positivos en aproximadamente 3.200 filas de tráfico de agentes benigno realista. El segmento más débil son las inyecciones en páginas de agentes de navegador con una detección del 81,1%. El modelo está actualmente solo en inglés en su versión de producción.

5. ¿Cuál es la tasa de falsos positivos de los guardrails de IA de NeuralTrust?

En el punto de operación equilibrado principal (umbral 0,85), la tasa de falsos positivos es del 2,3% para detección de jailbreaks, del 2,4% para detección de toxicidad y del 0,6% para detección de inyección indirecta de prompts. En el punto de operación más estricto (umbral 0,95), la tasa de falsos positivos de jailbreaks baja al 2,1% y la de toxicidad al 1,5%.

6. ¿La seguridad de IA de NeuralTrust funciona en varios idiomas?

Sí. Los modelos de detección de jailbreaks, detección de toxicidad y moderación de prompts se evalúan cada uno en nueve idiomas: inglés, español, francés, portugués, alemán, turco, italiano, catalán y gallego. La detección de jailbreaks en el punto de operación principal oscila entre 0,92 (inglés, español) y 0,85 (gallego) en los nueve idiomas. La detección de toxicidad oscila entre 0,97 (español, francés) y 0,87 (alemán). Ambos modelos se entrenan y evalúan de forma multilingüe por construcción, no como inglés primero con cobertura añadida.


Sobre Esta Investigación

Este informe presenta la evidencia de rendimiento de los cuatro modelos guardrail de producción de NeuralTrust a partir de julio 2026. Todas las ejecuciones de benchmark están fijadas a versiones exactas del modelo y marcas de tiempo UTC con hashing por fragmento para reproducibilidad. El seguimiento de contaminación — deduplicación automatizada y análisis de solapamiento entre conjuntos de entrenamiento y test — protege contra filtraciones del benchmark.

El informe completo del modelo (versión externa) está disponible para su descarga. El benchmark comparativo de proveedores se realizó el 23 de julio de 2026 contra AWS Bedrock Guardrails (eu-north-1, nivel STANDARD) y Azure AI Content Safety (Europa Occidental, FourSeverityLevels). Las limitaciones de la comparación directa se describen en la sección de metodología del informe completo.

Descargar el Informe Completo de Rendimiento de Modelos de Seguridad de IA de NeuralTrust (PDF)

Suscríbete a nuestra newsletter

Compartir

Únete a los líderes que aseguran el ecosistema de agentes

Solicita una demo