Un generador de datos de currículum produce perfiles profesionales completos para probar un sistema de seguimiento de candidatos, un analizador de currículos o un formulario de candidatura sin recurrir a candidaturas de personas reales. El material de este terreno tiene una dificultad particular: un currículum no es una lista de campos sueltos, sino una historia con una línea temporal, unos títulos que pertenecen a un sector y una formación que se corresponde con el puesto. En esta guía se recorren esas relaciones, se explica qué casos conviene provocar en las pruebas y se traza la frontera de privacidad que separa un perfil sintético de una candidatura auténtica. Al terminar sabrás qué exigir al material y cómo usarlo para que tus pruebas midan el sistema y no la calidad del dato.
Qué necesita un analizador de currículums para probarse
Un analizador de currículums convierte un documento de formato libre en campos estructurados: nombre, datos de contacto, puestos con sus fechas, empresas, titulaciones y competencias. Su calidad se mide por lo que acierta con documentos diversos, y esa diversidad es exactamente lo que falta cuando se prueba con dos o tres ejemplos escritos a mano por el propio equipo.
El primer requisito del material es, por tanto, la variedad de formato. Hay currículums con las fechas a la izquierda y otros a la derecha, con los puestos en orden cronológico inverso y con los meses escritos como número, como abreviatura o como nombre completo. Un conjunto que solo incluya una convención da una medida optimista y deja pasar los errores que aparecerán con el primer documento ajeno.
El segundo requisito es la coherencia del contenido. Si el analizador extrae un puesto y lo une con una empresa que no le corresponde, el error pasa desapercibido salvo que el material tenga una verdad conocida contra la que comparar. Por eso conviene trabajar con perfiles donde la relación entre empresa, puesto y fechas esté fijada de antemano. El enfoque general está descrito en la guía sobre perfiles de carrera de prueba.
Las reglas de la línea temporal de experiencia
La línea temporal es la parte del currículum que más reglas implícitas contiene. Cada puesto tiene un mes y un año de inicio y otro de fin, y el fin no puede ser anterior al inicio. Cuando un puesto está en curso, el fin se representa de una forma especial que el analizador debe reconocer, y esa forma cambia entre idiomas y entre formatos de documento.
Los huecos entre puestos son otro elemento que conviene modelar. Un período sin actividad puede ser una decisión deliberada, una etapa de formación o una interrupción que el candidato no detalla, y los sistemas que calculan la antigüedad total tienen que decidir cómo los tratan. Un conjunto de prueba que no incluya ningún hueco nunca ejercita esa decisión. El detalle de estas reglas está en la guía sobre reglas de la línea temporal de experiencia.
También existen los solapamientos, es decir, dos puestos activos al mismo tiempo. Ocurren con los trabajos a tiempo parcial, con las consultorías simultáneas y con los puestos de docencia que se compaginan con otra actividad. Un sistema que asume que nunca se solapan producirá totales de experiencia equivocados, y ese error solo se descubre si el material de prueba incluye el caso.
¿Por qué los títulos de puesto tienen que corresponder al sector?
Un currículum verosímil cuenta una trayectoria dentro de un sector. Un perfil que encadena un puesto de analista financiero, otro de enfermería y otro de diseño gráfico no existe en la práctica, y aunque el analizador lo procese sin errores, el material no sirve para probar las funciones que dependen del contexto: la búsqueda por familia profesional, la clasificación por área y la comparación entre candidatos.
Por eso conviene que el generador produzca trayectorias coherentes, con títulos que pertenecen al mismo campo y con una progresión que tenga sentido. Un perfil que empieza como técnico, sigue como especialista y termina como responsable de equipo describe una carrera normal y permite comprobar que el sistema ordena y clasifica como se espera. Los repertorios de títulos por área están recogidos en la guía sobre títulos de puesto por sector.
Hay además un problema de terminología que conviene provocar en las pruebas. El mismo puesto recibe nombres distintos según la empresa y según el país, y las abreviaturas son frecuentes. Un sistema que clasifica por coincidencia exacta con un catálogo cerrado fallará con la mitad de las candidaturas reales, y el material de prueba debe incluir esas variantes para que el fallo aparezca antes que en producción.
Formación, titulaciones y su estructura
El bloque de formación tiene la misma forma que la experiencia, con instituciones, titulaciones, fechas y a veces calificaciones. Las titulaciones son las que más varían entre países, porque un mismo nivel de estudios recibe nombres distintos y porque la duración nominal cambia. Un sistema que solo reconoce las titulaciones de su mercado local deja fuera a una parte de los candidatos internacionales.
Otro elemento que las pruebas deben cubrir es la relación entre la formación y el puesto. Un perfil puede tener una titulación muy distinta de su actividad profesional actual, y eso es completamente normal, pero también puede tener una titulación obtenida después de varios años de trabajo. Un analizador que ordena por fecha de forma ingenua colocará ese título al final y producirá una historia confusa. La estructura de este bloque está descrita en la guía sobre registros de formación y titulaciones.
Las certificaciones profesionales añaden una capa más, porque muchas tienen caducidad y otras exigen renovación. Si el sistema que se prueba contempla esos vencimientos, el material debe incluir una certificación vigente y otra caducada, con sus fechas correspondientes. Sin ese caso, la lógica de comprobación nunca se ejecuta.
¿Cómo se organizan las competencias y sus niveles?
Las competencias se capturan de dos maneras que conviven mal. En algunos sistemas son palabras clave libres que el candidato escribe, y en otros son entradas de un catálogo con un nivel asociado, expresado en una escala que va de básico a experto o de uno a cinco. Un formulario que mezcla las dos cosas produce datos que después no se pueden comparar.
Para las pruebas, el material debe incluir ambos tipos. Las palabras clave libres sirven para comprobar la extracción y la búsqueda por texto, mientras que las entradas con nivel sirven para comprobar el filtrado y la ordenación. También conviene incluir una competencia con nombre largo o con caracteres especiales, porque esos valores suelen romper las interfaces que dibujan etiquetas. La organización de estos datos está desarrollada en la guía sobre taxonomía de competencias y niveles.
Hay una decisión de diseño que conviene tener presente desde el principio: si el nivel se guarda como texto o como número. Guardarlo como texto permite reflejar escalas distintas de distintos catálogos, pero impide ordenar; guardarlo como número permite ordenar, pero obliga a normalizar antes de aceptar cualquier origen. Sea cual sea la elección, el material de prueba debe respetarla.
La retribución y su unidad de tiempo
La retribución es un campo engañoso porque parece sencillo. Un mismo importe puede expresarse por año, por mes o por hora, en distintas monedas, con o sin parte variable, y con o sin indicación de bruto o neto. Dos perfiles que parecen comparables pueden no serlo en absoluto, y un sistema que suma importes sin normalizar la unidad produce totales sin sentido.
El material de prueba debe incluir, por tanto, al menos un perfil con retribución anual, otro con retribución mensual y otro con retribución por hora, además de dos monedas distintas. Ese conjunto es suficiente para comprobar que el sistema convierte correctamente antes de comparar, y para detectar el caso más frecuente de error, que es tratar el importe mensual como anual en algún punto del código. El tratamiento de este campo está recogido en la guía sobre retribución, moneda y período.
La parte variable merece un caso propio. Un perfil con un porcentaje de bonificación no se puede sumar directamente a la retribución fija sin decidir antes si se toma el valor objetivo o el alcanzado, y esa decisión tiene que estar escrita en algún sitio. Si el sistema no la tiene, el material de prueba lo revelará antes de que lo haga un candidato.
Casos de prueba para el formulario de candidato
La primera familia de casos son los límites de los campos de contacto, donde un correo con más de un punto en el dominio, un teléfono con prefijo internacional escrito con signos y un nombre con partículas o con dos apellidos ponen a prueba el diseño. La segunda son las fechas, con un candidato cuya experiencia empieza el mismo mes en que terminó sus estudios y otro con un hueco de varios años.
La tercera familia es el tratamiento de documentos con estructura irregular. Un currículum con dos columnas, otro sin encabezados y otro que llega como imagen requieren caminos distintos del analizador, y todos ellos deben formar parte del conjunto de prueba. La lista de comprobaciones que cubre este terreno está en la guía sobre casos de prueba del formulario de selección.
La cuarta familia es el flujo completo. Un candidato que se inscribe a una oferta, otro que se postula de forma espontánea y otro que es importado por un reclutador recorren caminos que se comportan de forma distinta respecto a los campos obligatorios y al consentimiento. El material debe cubrir los tres.
Privacidad y conservación de los datos
Un currículum es un dato personal y arrastra obligaciones desde el momento en que existe. Por eso la práctica recomendada en cualquier entorno que no sea de producción es no usar candidaturas reales, ni siquiera con el nombre borrado, porque la combinación de trayectoria, empresa y fechas puede señalar a una sola persona con bastante precisión.
El material sintético resuelve esa tensión porque no parte de nadie. No hay consentimiento que invocar ni plazo de conservación que respetar, y el equipo puede borrar el conjunto entero cuando termina la prueba sin preguntarse si conserva algo que debía eliminar. Los criterios de conservación aplicables a los datos de selección están desarrollados en la guía sobre conservación de datos de recursos humanos, y sirven de contraste para entender por qué el material de prueba tiene que mantenerse separado de los datos reales.
Cómo obtener un conjunto coherente de perfiles
En el generador de datos de currículum de este sitio se elige el país y el área profesional, y la herramienta devuelve un perfil con nombre, datos de contacto, experiencia con fechas, formación, competencias y expectativa retributiva tomados del mismo contexto. Al venir del mismo origen, la trayectoria tiene sentido y los campos se sostienen entre sí, lo que permite probar la clasificación y la búsqueda sin que el ruido del dato contamine el resultado. La misma herramienta sirve para preparar un conjunto fijo que se guarde junto al código y se reutilice en cada ejecución.
Los límites de este material
Los perfiles que produce un generador son datos sintéticos. Describen trayectorias verosímiles porque siguen las convenciones de cada sector y de cada país, pero no pertenecen a ninguna persona ni proceden de ninguna candidatura. La guía sobre currículums y analizadores en ficheros de prueba desarrolla cómo integrarlos sin perder esa separación.
Su uso está en probar tus propios analizadores, tus paneles de selección y tus formularios en entornos que no sean de producción. No sirven para presentarse a una oferta, para acreditar experiencia ni para hacerse pasar por otra persona. Esa frontera es también lo que mantiene el material al margen de las obligaciones que sí se aplican a las candidaturas reales.
Siguientes pasos
Elige un analizador o un formulario de candidatura y anota qué campos extrae y qué decisiones toma sobre las fechas. Con esa lista, el generador de datos de currículum devuelve perfiles completos con la línea temporal bien construida, listos para ampliar tu conjunto de pruebas. Si tu sistema calcula antigüedad, añade al menos un perfil con un hueco y otro con dos puestos solapados: son los dos casos que casi nunca están cubiertos y que aparecen en cuanto se procesa un documento ajeno. Recuerda el límite: son datos de prueba generados para probar software y no corresponden a ninguna persona real.