Datos sintéticos y datos anonimizados se usan a menudo como sinónimos en las conversaciones de equipo, y esa confusión tiene consecuencias prácticas. Un conjunto sintético no parte de nadie; un conjunto anonimizado parte de personas reales y aspira a que ya no se pueda llegar hasta ellas. La diferencia no es de matiz, porque determina qué obligaciones siguen vigentes y qué se puede afirmar sobre el material.
Cuatro caminos que se confunden entre sí
Antes de elegir conviene separar las cuatro técnicas que suelen aparecer mezcladas en la misma frase.
| Técnica | De dónde parte | Qué se puede afirmar |
|---|---|---|
| Sintético | De un procedimiento, sin personas reales | No describe a nadie porque nunca lo hizo |
| Anonimizado | De datos reales | Se ha intentado romper el vínculo de forma irreversible |
| Pseudonimizado | De datos reales | El vínculo se sustituyó, pero se puede reconstruir |
| Enmascarado | De datos reales | El valor visible cambió y el original se conserva |
Las dos últimas son las más frecuentes en la práctica y las que más se presentan como si fueran la segunda. Un nombre cambiado por otro y una cifra oculta con asteriscos son transformaciones de datos reales; el dato original sigue existiendo en algún lugar, y con él la posibilidad de volver a él.
¿Por qué borrar el nombre no anonimiza?
Porque el nombre no es lo único que identifica. Un registro con fecha de nacimiento, código postal y profesión describe a un número muy pequeño de personas, y en muchos casos a una sola. Quitar el nombre elimina la etiqueta más visible y deja intacta la combinación que permitía llegar hasta ella.
La comprobación mental que ayuda es esta: ¿podría alguien con acceso a otra fuente de información averiguar de quién se trata? Si la respuesta es que sí, o que quizá, el dato no está anonimizado. Esto explica por qué los conjuntos que se publican como anónimos a veces se vuelven a identificar cruzando dos fuentes que por separado parecían inofensivas. Ocurre con listados de salud, con registros de movilidad y con cualquier tabla que conserve detalles finos de tiempo y lugar.
¿Puede un dato anónimo volver a identificar a alguien?
Sí, y la causa casi siempre es la misma: quedan campos demasiado precisos. Una franja de edad amplia no señala a nadie; una fecha de nacimiento exacta reduce el conjunto drásticamente. Un país no señala a nadie; un código postal de una zona pequeña sí. Cuantos más detalles finos se conservan, más fácil resulta reconstruir la identidad aunque no aparezca ningún nombre.
Hay además un efecto acumulativo. Un dato que en un conjunto parece inofensivo puede dejar de serlo al unirlo con otro del que nada sabíamos cuando se preparó el primero. Por eso la anonimización no es una operación que se hace una vez y queda resuelta: es una propiedad que hay que reevaluar cada vez que el conjunto crece o se cruza con algo nuevo.
Qué conviene usar en un entorno de pruebas
Para un entorno de pruebas, el conjunto sintético resuelve el problema por la vía más directa: si el material se construye y no se deriva de nadie, no hay que decidir qué transformación fue suficiente ni demostrar que el vínculo quedó roto.
Eso no significa que cualquier material sintético valga. Para que resulte útil tiene que parecerse a los datos que el sistema verá de verdad: longitudes correctas, caracteres inesperados, nombres que no caben, documentos con la forma de cada país. Un conjunto demasiado uniforme prueba menos que uno que incluye los casos incómodos. La relación con las obligaciones de protección de datos está desarrollada en la guía sobre GDPR y datos de identidad de prueba, y el caso concreto de las direcciones y los teléfonos, en la de privacidad de los datos de dirección.
Cómo generar datos sin partir de personas reales
En el generador de datos de identidad de este sitio se elige el país y la división administrativa y se obtiene un registro completo —nombre, dirección, documento, teléfono y perfil en línea— construido por un procedimiento que no consulta ninguna base de datos ni usa datos de personas. Cada registro lleva su clave de identidad, y esa clave es lo que hace que el mismo resultado vuelva a aparecer cuando se necesita reproducir una prueba.
Como el material no procede de registros existentes, el registro de origen no hay que justificarlo: no hay ninguno. Si el equipo prefiere fijar las muestras en lugar de generarlas, la guía sobre identidades en ficheros de prueba explica cómo organizarlas para que sigan siendo útiles con el tiempo.
Notas para quien programa
- Que el generador sea reproducible. Un material que cambia en cada ejecución impide reproducir un fallo y obliga a guardar los valores a mano. Una clave que determina todas las elecciones resuelve las dos cosas a la vez.
- La distribución debe parecerse a la real, pero no salir de ella. Un conjunto útil imita la variedad de longitudes, caracteres y formatos del mundo real. Eso se consigue describiendo la variedad, no copiando registros.
- No derives el material sintético de una muestra real. Si el punto de partida es un registro de producción aunque el resultado se transforme, el problema original vuelve a estar sobre la mesa.
- Poder demostrar que no hay datos reales forma parte del trabajo. En una revisión interna, la respuesta no puede ser que nadie lo comprobó. Saber de dónde salió cada conjunto y poder regenerarlo con la misma clave es la prueba más sencilla de aportar.
- No prometas anonimización si has enmascarado. Es la afirmación que más problemas causa en una revisión, porque el dato original sigue existiendo y la diferencia es fácil de descubrir.
Siguientes pasos
Revisa los conjuntos de datos que usa tu equipo y clasifícalos en las cuatro categorías de la tabla. Los que estén en las dos últimas son los que conviene sustituir por material generado, y suelen ser también los que nadie sabe explicar de dónde salieron.
Para esa sustitución, el generador de datos de identidad produce registros completos y reproducibles. Ese material es solo para pruebas de software, no corresponde a ninguna persona real y no puede utilizarse para hacerse pasar por otra ni para superar una verificación de identidad.