Pregunte a cualquier equipo de ingeniería de dónde proviene la gran cantidad de datos en el entorno de aprobación. En muchas empresas, la respuesta honesta es: a partir de una copia de producción. Alguien, en algún momento, replicó la base real para un entorno de prueba, porque era la forma más rápida de lograr que pareciera real. Y esa copia permaneció allí, siendo utilizada y copiada nuevamente, semestre tras semestre.
Este hábito resuelve un problema y crea uno mayor. Resuelve el realismo, porque los datos de producción son, por definición, realistas. Pero crea una enorme exposición a la privacidad, porque los datos personales de clientes reales ahora circulan en entornos menos protegidos, accesibles a más personas, en más copias y con menos control. Es uno de los riesgos más comunes y subestimados que encuentro.
Los datos sintéticos resuelven esta ecuación de forma limpia: generas una masa que se comporta como producción, sin que contenga un solo cliente real.
Por qué copiar la producción es un problema
Vale la pena nombrar los riesgos, porque normalmente se tratan como un coste invisible hasta el día en que se convierten en incidente.
El riesgo de privacidad es el más obvio. Según la LGPD, los datos personales en un entorno de aprobación son datos personales sujetos a las mismas obligaciones. Cada desarrollador con acceso, cada copia de seguridad de ese entorno, cada integración de prueba que toca esa base, todo esto es una superficie de exposición. Una filtración durante la aprobación duele tanto como una durante la producción, con la ventaja adicional de que nadie estaba prestando atención.
El riesgo de seguridad viene con ello. Los entornos de prueba suelen tener controles más flexibles, credenciales compartidas y menos supervisión. Poner datos reales en este contexto es mantener algo valioso en la habitación con la puerta abierta.
También existe un riesgo operativo. La copia de producción contiene lo que tiene la producción, y la producción rara vez tiene el caso límite que necesita probar. Se termina con una base grande, sensible pero incompleta para los escenarios que más importan.
Qué ofrece la masa sintética
Generar datos de prueba en lugar de copiarlos cambia el juego en varias dimensiones.
El primero es la seguridad mediante la construcción. Si los datos nunca fueron de una persona real, no hay datos personales que filtrar. El entorno de aprobación deja de ser un repositorio de riesgos y se convierte en lo que debe ser, un espacio para ejercitar el software. Este es el ángulo de la privacidad en el que profundizo en datos sintéticos y privacidad.
El segundo es el control sobre los escenarios. Con la masa sintética, generas intencionalmente lo que necesitas probar: el cliente con un nombre enorme que rompe el diseño, el valor negativo, la fecha no válida, el pedido con mil artículos, el usuario sin historial. Estos casos extremos son donde viven los errores, y la producción rara vez los entrega en bandeja.
El tercero es el volumen bajo demanda. ¿Necesita diez millones de registros para una prueba de carga? Generar. ¿Necesita una base eficiente para ejecutar la suite rápidamente en proceso? Generar más pequeños. Se deja de depender del tamaño de la producción y se empieza a definir el tamaño que requiere la prueba.
El cuarto es la estabilidad. Los datos de producción cambian todo el tiempo, lo que hace que las pruebas sean frágiles y difíciles de reproducir. La masa sintética generada a partir de reglas conocidas es determinista cuando se quiere, lo que genera pruebas que fallan por la razón correcta, no porque un dado haya cambiado debajo de ellas.
El realismo es el requisito que no puede faltar
La masa sintética solo es útil si utiliza las mismas rutas de código que utilizarían los datos reales. Los datos sintéticos ingenuos, todos llamados "prueba de prueba" con el mismo CPF no válido, no prueban casi nada. Pasa por validaciones de que los datos reales fallarían y oculta errores que solo aparecen con variedad.
Realismo, aquí, significa respetar la estructura y las reglas del dominio. CPF que pasa la validación de dígitos. código postal que existe. Fechas coincidentes entre sí, con registro antes de la primera compra. Distribuciones reales, con la combinación adecuada de clientes activos e inactivos, pedidos grandes y pequeños, casos comunes y raros. Relaciones que se sostienen, con el pedido apuntando al cliente que existe y al producto que existe.
Cuanto más dependa su sistema de estas reglas, más deberá respetarlas la multitud para que la prueba sea válida. Para el control de calidad, el nivel de fidelidad requerido suele tener más que ver con la estructura y las reglas que con la reproducción de la fina distribución estadística. Necesita que los datos sean válidos y variados, no que repliquen el comportamiento agregado de la base de datos con precisión científica.
##Cómo adoptar sin convertirse en un proyecto eterno
La tentación es tratar la generación de datos sintéticos como una gran plataforma. Para el control de calidad, recomiendo el camino opuesto: comenzar poco a poco y demostrar valor rápidamente.
Elija un sistema con problemas claros, preferiblemente uno que actualmente dependa de la copia de producción y genere la mayor parte de un flujo principal. Sentir los beneficios en un caso real es más convincente que cualquier planificación a largo plazo.
Modelar las reglas del dominio junto con quienes conocen el negocio. La calidad masiva proviene de capturar bien las limitaciones de los datos, por lo que esta conversación entre control de calidad, desarrollo y negocios es donde reside el valor.
Generadores de versiones como código. La receta que produce la masa es parte del proyecto, debe ser revisada, probada y evolucionada como cualquier otro componente. Esto conecta la estrategia de datos con la estrategia de prueba, un tema que cubro en pruebas automatizadas.
Incluya casos extremos a propósito. La verdadera ventaja de la masa sintética sobre la copia de producción es poder generar el escenario difícil. No desperdicies esto simplemente replicando el feliz caso.
Integrar en la tubería. El volumen generado bajo demanda en el flujo de integración continua es lo que hace que las pruebas sean reproducibles y económicas de ejecutar. Los datos de prueba que residen en una base de datos estática compartida se vuelven obsoletos y disruptivos.
La ganancia que ve el líder
Para quienes deciden, el argumento es sencillo. Cambiar la copia de producción por masa sintética elimina una de las mayores exposiciones a la privacidad de la empresa, reduce la superficie de seguridad de los entornos de prueba y, al mismo tiempo, acelera el control de calidad, porque el equipo comienza a generar el escenario que necesita en lugar de buscarlo en una base de datos que tal vez ni siquiera lo tenga.
Es uno de esos raros casos en los que seguridad y velocidad van de la mano. En general, un mayor control conlleva una mayor lentitud. Aquí, al dejar de llevar datos reales a todas partes, te vuelves más seguro y ágil al mismo tiempo.
Este es el uso de datos sintéticos con el retorno más rápido y el menor riesgo de adoptar. La fidelización requerida es manejable, la ganancia en privacidad es inmediata y el impacto en el día a día del equipo aparece en las primeras semanas.
Si su empresa todavía copia la producción para realizar pruebas, este es el lugar para comenzar. Elige un flujo, genera la masa, retira la copia. El ambiente de aprobación que desarmas hoy es un incidente que no tendrás mañana.
Lea también
- Datos sintéticos y privacidad: entrene y pruebe sin exponer datos personales
- ¿Qué son los datos sintéticos y por qué son importantes para los líderes?
- Datos sintéticos: los riesgos y límites que nadie pone en la diapositiva de ventas
- Big Data en Productos Digitales: Buenas Prácticas en la Práctica
- Datos sintéticos para entrenar la IA: ganancias reales y el riesgo de colapso del modelo
- Cifrado de datos
