¿Qué es la soberanía de datos de IA para empresas?
La soberanía de datos de IA significa que tu organización controla qué leyes rigen los datos que envías a los sistemas de IA, y que tienes la arquitectura para aplicar ese control en la capa de inferencia. Sin ella, cada llamada a la API de tu LLM es una potencial transferencia transfronteriza, una exposición de datos de entrenamiento o una violación de HIPAA. No es un documento de política. Es un requisito técnico previo al despliegue seguro de LLMs.
TL;DR - Puntos clave
- En marzo de 2023, ingenieros de Samsung filtraron código fuente de semiconductores y notas de reuniones confidenciales a ChatGPT tres veces en 20 días, semanas después, Samsung prohibió todas las herramientas de IA generativa en la empresa
- La autoridad de protección de datos de Italia prohibió ChatGPT el 31 de marzo de 2023 por infracciones del RGPD, y posteriormente multó a OpenAI con 15 millones de euros en diciembre de 2024 por procesar datos de usuarios sin base jurídica adecuada
- El nivel estándar de la API de OpenAI no incluye un Acuerdo de Socio Comercial (BAA) requerido por HIPAA; enviar PHI sin un acuerdo empresarial es una violación de HIPAA
- Cada llamada a la API de un usuario de la UE a un LLM alojado en EE. UU. es una potencial transferencia internacional restringida bajo el Capítulo V del RGPD
- Un despliegue de LLM privado mantiene tus datos completamente dentro de tu perímetro: sin inferencia de terceros, sin transferencia transfronteriza, sin exposición al entrenamiento
- Una pasarela de IA es la capa de aplicación que te permite seguir usando modelos alojados mientras aplicas reglas de enrutamiento, redacción de datos personales y registro de auditoría en cada solicitud
Enviar datos empresariales a una API de LLM pública sin una estrategia de soberanía es como dejar archivos confidenciales en el vestíbulo de un hotel. Los datos están fuera de tu control en el momento en que salen de tu red.
Esta guía explica exactamente dónde vive el riesgo, cuál es la exposición al cumplimiento y qué arquitectura lo soluciona realmente antes de desplegar.
Tres incidentes. Veinte días. Una prohibición en toda la empresa.
En marzo de 2023, ingenieros de Samsung empezaron a usar ChatGPT para ayudar con revisiones de código. Un movimiento razonable de productividad. En 20 días se había convertido en un desastre de cumplimiento.
Tres incidentes por separado. En el primero, un ingeniero pegó código fuente propietario de una base de datos de semiconductores en ChatGPT para corregir un error. En el segundo, alguien envió algoritmos de detección de defectos utilizados en los equipos de fabricación de Samsung. En el tercero, la transcripción de una reunión interna confidencial se introdujo en el modelo para su resumen.
Todo fue a los servidores de OpenAI. Todo se convirtió potencialmente en datos de entrenamiento. La respuesta de Samsung fue inmediata: una prohibición en toda la empresa de todas las herramientas de IA generativa.
Los ingenieros no actuaron con malicia. Hacían exactamente lo que esperarías de ingenieros curiosos y centrados en la productividad. El problema no eran las personas. Era que nadie había construido los controles antes de darles acceso.
Ese es el problema de la soberanía de datos de IA en un ejemplo real.
Qué significa realmente "soberanía de datos de IA"
La soberanía de datos de IA es la extensión de los principios de soberanía de datos a la capa de inferencia de LLMs.
En la capa de almacenamiento, la soberanía de datos pregunta: ¿qué leyes rigen los datos almacenados en tu base de datos? En la capa de inferencia, pregunta: ¿qué leyes rigen los datos que estás enviando activamente a un modelo ahora mismo?
Las dos preguntas tienen respuestas diferentes, y la mayoría de las empresas solo han pensado en la primera.
Cada prompt que tu aplicación envía a un LLM alojado implica:
- Transmisión de datos a un endpoint de infraestructura de un tercero
- Procesamiento activo por los recursos de cómputo de ese proveedor
- Registro potencial por los sistemas de ese proveedor
- Inclusión potencial en entrenamiento si no te has dado de baja explícitamente
Eso no es almacenamiento. Es procesamiento de datos en tiempo real bajo la jurisdicción de otra persona. La guía completa de soberanía de datos para IA empresarial cubre la arquitectura legal. Este artículo trata sobre lo que eso significa específicamente cuando despliegas LLMs.
Tres vectores de fuga que necesitas entender
La mayoría de las empresas se centran en un riesgo. Hay tres.
1. Exposición de datos de entrenamiento
Cuando envías datos a una API de LLM pública, esos datos pueden usarse para mejorar el modelo a menos que te hayas dado de baja explícitamente. Las condiciones estándar de la API de OpenAI indican que los datos de la API no se usan para entrenamiento por defecto, pero esta política puede cambiar, varía según el nivel de producto, y muchos equipos empresariales despliegan integraciones sin leer nunca el DPA.
Los ingenieros de Samsung no pensaban que estaban contribuyendo a un conjunto de datos de entrenamiento. Estaban pegando en lo que parecía un cuadro de búsqueda.
2. Transferencia transfronteriza
Si tus usuarios están en la UE y tu API de LLM funciona en infraestructura de EE. UU., cada llamada a la API es una potencial transferencia transfronteriza bajo el Capítulo V del RGPD. Necesitas una base jurídica para esa transferencia: una decisión de adecuación, Cláusulas Contractuales Estándar o certificación DPF, y necesitas tenerlos en vigor antes de la primera solicitud, no después.
El caso Italia-OpenAI es el punto de referencia: 15 millones de euros por procesar datos sin base jurídica adecuada.
3. Brechas en los derechos contractuales de datos
Tu Acuerdo de Procesamiento de Datos con tu proveedor de LLM define qué pueden hacer con tus datos. La mayoría de los niveles estándar de API no incluyen un Acuerdo de Socio Comercial (BAA) requerido por HIPAA. La mayoría no se comprometen con plazos específicos de eliminación de datos.
La mayoría se reservan el derecho de registrar prompts para monitoreo de seguridad y abuso. Si despliegas LLMs para casos de uso de sanidad, RRHH, legal o financiero sin revisar el DPA, estás asumiendo un riesgo de cumplimiento que probablemente no puedes ver.
)
El stack de cumplimiento: RGPD, HIPAA y la Ley de IA de la UE
Tres marcos. Los tres aplican a los despliegues típicos de LLMs empresariales. Ninguno es opcional.
1. RGPD
El Capítulo V restringe las transferencias internacionales de datos personales fuera de la UE. Un empleado europeo que consulta tu chatbot LLM con nombres de clientes, detalles de cuentas o información de salud está iniciando una transferencia de datos personales a la infraestructura de inferencia del modelo.
Si esa infraestructura está en EE. UU., necesitas CCE, una decisión de adecuación o certificación DPF, y necesitas tenerlos en vigor antes de la primera solicitud. El caso Italia-OpenAI es el punto de referencia: 15 millones de euros por procesar datos sin base jurídica adecuada.
2. HIPAA
La Ley de Portabilidad y Responsabilidad del Seguro Médico requiere un Acuerdo de Socio Comercial (BAA) con cualquier proveedor que maneje PHI en tu nombre. La API estándar de OpenAI, la API de Anthropic y la mayoría de las APIs principales de LLM no incluyen un BAA a menos que estés en un plan empresarial. Desplegar una integración de LLM para documentación sanitaria, resúmenes clínicos o comunicación con pacientes sin verificar la cobertura del BAA es una violación directa de HIPAA. Sin zona gris.
3. Artículo 10 de la Ley de IA de la UE
La Ley de IA de la UE clasifica muchas aplicaciones de LLM empresariales como de alto riesgo (cribado de RRHH, scoring crediticio, servicio al cliente que afecta el acceso a servicios). El Artículo 10 requiere gobernanza de datos documentada para los conjuntos de datos que usan estos sistemas. La aplicación comenzó el 2 de agosto de 2026. Las multas alcanzan los 35 millones de euros o el 6% de la facturación global. Si tu despliegue de LLM es de alto riesgo y no puedes documentar qué datos procesa y dónde, tienes una brecha en el Artículo 10.
Opciones de arquitectura: despliegue de LLM privado
La siguiente tabla compara cinco arquitecturas de despliegue en las dimensiones relevantes para la soberanía de datos.
| Arquitectura | Los datos salen del perímetro | Riesgo transfronterizo | Compatible RGPD | Elegible HIPAA | Coste relativo | Mejor para |
|---|---|---|---|---|---|---|
| API LLM pública (sin controles) | Sí | Alto | No | No | Más bajo | Solo pruebas sin datos sensibles |
| API LLM pública + pasarela de IA | Parcial (redactado) | Medio | Posible | Posible | Bajo | Uso empresarial controlado |
| LLM en nube privada (proveedor UE) | No | Bajo | Sí | Sí | Medio | Cargas de trabajo reguladas RGPD |
| Inferencia on-premises | No | Ninguno | Sí | Sí | Alto | Defensa, sanidad, finanzas |
| RAG + inferencia privada | No | Ninguno | Sí | Sí | Medio-alto | Q&A de documentos, cumplimiento |
LLM privado
Se refiere a cualquier despliegue en el que la inferencia se ejecuta en infraestructura que tú controlas o que contractualmente permanece dentro de tu jurisdicción. Esto incluye modelos de código abierto auto-alojados (Llama 3, Mistral, Falcon), despliegues privados gestionados por el proveedor, o modelos alojados en la nube que se ejecutan en un tenant privado de un proveedor de incorporación europea. La propiedad clave: los datos no salen de tu perímetro durante la inferencia.
RAG con inferencia privada
Es el patrón más común para industrias reguladas: tus documentos permanecen en tus servidores, un sistema de recuperación extrae fragmentos relevantes y un modelo que se ejecuta localmente genera la respuesta. Nada sale de tu perímetro. Auditabilidad total. Lo cubrimos en profundidad en la guía de arquitectura de IA soberana y en la comparativa on-premises vs. nube privada vs. nube pública.
)
Cómo encaja una pasarela de IA
Un despliegue de LLM privado es la opción de mayor soberanía. No siempre es práctico, los modelos de código abierto tienen brechas de capacidad y desplegar inferencia on-premises tiene un coste de infraestructura significativo.
Para la mayoría de las empresas, la solución pragmática es una capa de pasarela controlada que te permite usar modelos alojados de forma segura.
Una pasarela de IA se sitúa entre tus aplicaciones y los endpoints de tu modelo. Aplica cuatro controles que importan para la soberanía de datos:
1. Aplicación de enrutamiento
Defines qué modelos y proveedores puede alcanzar tu tráfico de IA. Las solicitudes que enviarían datos regulados a un endpoint no conforme se bloquean o redirigen antes de que se realice la llamada. Este es el control que Samsung no tenía.
2. Detección y redacción de datos personales
La pasarela inspecciona cada prompt saliente en busca de patrones de datos sensibles antes de que lleguen al modelo. Nombres, números de cuenta, códigos sanitarios, nombres de proyectos internos, tú defines qué se redacta. Lo que el modelo nunca recibe, nunca puede filtrar.
3. Registro de auditoría
Cada solicitud registrada: marca temporal, decisión de enrutamiento, redacciones aplicadas, modelo usado, recuentos de tokens. Este es el registro de auditoría conforme al Artículo 10 que espera una inspección de la Ley de IA de la UE.
4. Retención cero de datos
Puedes aplicar que ningún dato de prompt se retenga más allá de tu política definida, independientemente de lo que retenga tu proveedor de modelos.
NeuralTrust TrustGate aplica los cuatro controles en la capa de inferencia. Combinado con monitorización de agentes y moderación de contenidos, te proporciona el plano de control para el despliegue soberano de LLMs, tanto si usas un modelo alojado como si ejecutas el tuyo propio.
La guía de pasarelas de IA y soberanía de datos profundiza en la arquitectura de enrutamiento.
Preguntas frecuentes acerca de la soberanía de datos de IA
1. ¿Se pueden desplegar LLMs sin compartir datos con un tercero?
Sí. El despliegue de LLM privado (donde la inferencia se ejecuta en infraestructura que controlas) significa que ningún dato sale nunca de tu perímetro. Las opciones incluyen modelos de código abierto auto-alojados (Llama 3, Mistral), despliegues en nube privada con proveedores de incorporación europea e inferencia on-premises. Para casos de uso basados en documentos, una arquitectura RAG con inferencia privada mantiene tus datos completamente locales. La compensación es la capacidad: los modelos frontier de OpenAI y Anthropic no están disponibles para despliegue privado. Los modelos de código abierto continúan cerrando la brecha.
2. ¿Enviar datos a ChatGPT es una violación del RGPD?
Depende de los datos, los usuarios y los mecanismos de transferencia vigentes. Si están implicados datos personales de la UE, necesitas una base jurídica para la transferencia internacional (CCE, decisión de adecuación o certificación DPF) y un Acuerdo de Procesamiento de Datos con OpenAI. El producto de consumo predeterminado no satisface automáticamente estos requisitos. La API de OpenAI para uso empresarial incluye un DPA, pero necesitas tenerlo en vigor y haberlo revisado antes de que comience el procesamiento. El Garante italiano encontró que OpenAI procesó datos de usuarios sin base jurídica adecuada, y emitió una multa de 15 millones de euros en diciembre de 2024.
3. ¿Permite HIPAA enviar datos de pacientes a un LLM público?
No en los niveles estándar de API. HIPAA requiere un Acuerdo de Socio Comercial (BAA) con cualquier proveedor que maneje PHI en tu nombre. La API estándar de OpenAI no incluye un BAA. OpenAI ofrece cumplimiento HIPAA a través de su oferta empresarial, que requiere un acuerdo separado. Si procesas cualquier PHI (nombres de pacientes, diagnósticos, notas de tratamiento) a través de una API de LLM pública sin verificar que haya un BAA válido vigente, estás en violación de HIPAA independientemente de si ocurre una brecha.
4. ¿Cuál es la diferencia entre un LLM privado y una pasarela de IA?
Un LLM privado es un modelo que se ejecuta en infraestructura que controlas, nada sale de tu perímetro. Una pasarela de IA es una capa de control que se sitúa frente a un endpoint de modelo alojado. Con un LLM privado, tienes soberanía plena pero renuncias al acceso a las capacidades de los modelos frontier. Con una pasarela de IA más un modelo alojado, puedes usar modelos frontier mientras aplicas controles de enrutamiento, redacción de datos personales y auditoría que te acercan a la soberanía para casos de uso regulados.
La mayoría de las empresas usan ambos: LLM privado para sus cargas de trabajo de mayor sensibilidad, modelos alojados controlados por pasarela para uso de productividad general. Consulta soberanía de datos vs. residencia de datos vs. localización de datos para ver cómo estas elecciones arquitectónicas se corresponden con las obligaciones legales.
Artículos relacionados
- La guía completa de soberanía de datos para IA empresarial (2026)
- Soberanía de datos vs. Residencia de datos vs. Localización de datos
Sobre el autor
Roger Howroyd es Head of Global SEO and AI en NeuralTrust, donde lidera la estrategia de búsqueda de la empresa en SEO, AEO, GEO y optimización LLM. Está especializado en búsqueda potenciada por IA, estrategia de contenido, desarrollo de backlinks y SEM. Conéctate en LinkedIn.
NeuralTrust es una plataforma de seguridad para agentes de IA, reconocida en el Gartner Hype Cycle for Application Security 2026, el Gartner Hype Cycle for Infrastructure Security 2026, la Guía de mercado de Gartner 2025 para pasarelas de IA y agentes guardianes y el Compás de liderazgo KuppingerCole 2025 para Defensa de IA Generativa. Certificada ISO 27001. Con sede en Barcelona.
)
)