Dados Sintéticos
Privacidade
LGPD
Conformidade
Dados

Datos sintéticos y privacidad: capacítese y pruebe sin exponer datos personales

Cómo utilizar datos sintéticos como herramienta de privacidad y cumplimiento del RGPD, y qué riesgos de fuga y reidentificación debe controlar un líder técnico.

Datos sintéticos y privacidad: capacítese y pruebe sin exponer datos personales

Toda empresa que trata con datos personales experimenta la misma tensión: el equipo necesita datos para trabajar, y los datos que necesita son precisamente los más protegidos. El científico quiere entrenar un modelo con el historial del cliente. El equipo de control de calidad quiere realizar pruebas con casos similares a los reales. El analista quiere explorar sobre una base de salud o crédito. En todos los casos, el camino más corto pasa por la información personal, y es ahí donde la LGPD](/post/lgpd-startups-compliance-protecao-dados) da la alarma.

Los datos sintéticos surgen como respuesta a esta tensión. La promesa es sencilla: se trabaja con datos que se comportan como los reales, pero que no corresponden a ninguna persona específica. Bien ejecutada, esta promesa reduce el riesgo regulatorio y libera al equipo. Si se ejecuta mal, crea una falsa sensación de seguridad, que puede ser peor que el riesgo conocido.

La anonimización tradicional no es suficiente

Durante años, la respuesta estándar a la privacidad fue mantener el anonimato: eliminar el nombre, el número de seguro social, el correo electrónico y seguir adelante. El problema es que la anonimización mediante la eliminación de campos es más frágil de lo que parece.

La combinación de datos aparentemente inofensivos identifica a las personas. El código postal, la fecha de nacimiento y el género juntos apuntan a un individuo único con una frecuencia sorprendente. Un patrón de compras, una ruta de viaje o una secuencia de servicios pueden actuar como una huella digital. Cuando esta base de datos "anonimizada" se cruza con otra fuente, se produce una reidentificación.

La LGPD trata los datos anonimizados como fuera de su alcance, pero sólo mientras la anonimización sea irreversible considerando esfuerzos razonables. Si la reidentificación es viable, los datos vuelven a ser personales y con ello regresan las obligaciones. En otras palabras, enmascarar campos no pone fin a la discusión, sólo la pospone.

Los datos sintéticos atacan el problema desde otro ángulo. En lugar de intentar borrar la identidad de registros reales, genera nuevos registros que nunca pertenecieron a nadie, preservando el patrón estadístico del conjunto. No hay ningún individuo detrás de cada línea que pueda ser reidentificado, porque la línea fue inventada.

Donde la privacidad sintética aporta valor

La ganancia aparece en varios frentes del ciclo de datos.

En el entrenamiento de modelos, puede utilizar una base de datos sintética derivada de la realidad para desarrollar e iterar sin mover datos confidenciales al entorno del científico. El equipo experimenta a voluntad y los datos personales permanecen restringidos.

En pruebas y aprobación, la copia de producción es uno de los mayores vectores de exposición que existen en las empresas. Cada réplica de la base real en un entorno menos protegido es un riesgo que se multiplica. Reemplazar esta copia con masa sintética corta el problema de raíz, tema que profundizo en datos sintéticos para pruebas y QA.

Al compartir, hay casos en los que es necesario entregar datos a un socio, proveedor o investigador externo. Compartir datos reales requiere una base legal, un contrato y un control sólidos. Compartir una versión sintética, validada para la privacidad, reduce drásticamente la superficie de riesgo.

En el sector público, el valor es aún mayor. Un organismo que quiera abrir datos para la innovación, los hackatones o la investigación académica no puede exponer a los ciudadanos. Una base sintética permite publicar algo útil, con estructura de datos verdaderos, sin violar la confidencialidad de quienes están detrás de los números.

El riesgo que nadie puede ignorar: la fuga de información

Aquí viene el punto que separa a quienes utilizan seriamente los datos sintéticos de quienes sólo utilizan la etiqueta. Un modelo generativo aprende de datos reales. Si aprende demasiado, memoriza. Y un modelo que memoriza puede reproducir registros reales casi intactos en los datos que genera.

Imaginemos una base sanitaria con un paciente con un perfil muy inusual, exclusivo de la base. Un generador mal calibrado puede producir una grabación sintética idéntica o casi idéntica a la de este paciente, porque fue el único ejemplo de ese patrón que vio. Los datos son técnicamente sintéticos, pero en la práctica exponen a la persona real. La promesa de privacidad se ha evaporado.

Ésta es la filtración de información de los datos originales y es el talón de Aquiles de los datos sintéticos. No es un teórico. Sucede especialmente en casos raros, valores atípicos y bases pequeñas, exactamente las situaciones en las que la privacidad individual es más importante.

También existe el riesgo de hacer inferencias. Incluso sin reproducir un registro completo, una base de datos sintética puede permitir a un atacante concluir si una persona específica estaba o no en la base de datos original, o deducir un atributo confidencial de ella. La privacidad no se trata sólo de evitar la copia literal, sino de evitar que se sepa algo sobre un individuo a partir de los datos publicados.

Cómo comprobar antes de confiar

La conclusión práctica es no rendirse, es validar. Los datos sintéticos no son privados por decreto, son privados cuando se miden. Unos cheques que cobro por cualquier iniciativa seria.

Mida la distancia al punto de referencia real. El equipo necesita comprobar si algún registro sintético se acerca demasiado al registro original. Los registros sintéticos que son casi copias de los reales deben tratarse como un defecto, no como un detalle.

Evaluar la resistencia a los ataques de inferencia. Existen pruebas que simulan a un atacante intentando averiguar si un individuo se encontraba en la base. Someter la base sintética a este tipo de evaluación da una medida concreta de riesgo, más que una promesa.

Aplicar garantías formales cuando los datos sean sensibles. En contextos de salud, finanzas o sector público, vale la pena considerar técnicas con garantía matemática de privacidad en el proceso de generación. Tienen un coste de fidelidad, pero intercambian fe por garantía, y este intercambio suele merecer la pena cuando los datos son críticos.

Decisiones de documentos. Desde el punto de vista del cumplimiento, demostrar que evaluó el riesgo de reidentificación y filtración, con método y evidencia, es lo que respalda la posición de que esos datos pueden tratarse fuera del régimen de datos personales.

El papel del líder y del equipo legal

Los datos sintéticos son una decisión técnica con consecuencias legales, por lo que no se pueden dejar solo en manos de la ingeniería. El equipo de datos construye y mide, pero la privacidad y la legalidad deben comprender lo que significa la medición y ayudar a definir límites aceptables.

Una buena práctica es tratar la generación de datos sintéticos como un proceso con propietario, criterios de aceptación y auditoría, y no como un script aislado que alguien ejecutó una vez. Quien toma las decisiones necesita saber qué nivel de fidelidad se entregó, qué riesgo residual de privacidad quedó y quién aprobó esta evaluación.

Cuando esto es correcto, los datos sintéticos dejan de ser un área gris y se convierten en un activo defendible: puedes explicar, ante la autoridad o ante una auditoría, por qué esos datos no exponen a las personas. Ese es el verdadero objetivo, no la etiqueta "sintética", sino la capacidad de respaldar la privacidad con evidencia.

Si hoy su organización copia una base de producción para probarla, capacitarla o compartirla, comience por ahí. Este es el rendimiento más rápido y el riesgo más obvio que se puede reducir. Genera una versión sintética, valida la privacidad con método y mide lo que ganaste en seguridad y velocidad.

Lea también