Datos sintéticos: qué son, cómo se generan y qué no garantizan
01

Definición en una frase

Datos generados artificialmente para entrenar, probar o simular escenarios cuando se controla su procedencia y calidad.

02

Definición: datos creados artificialmente para un uso concreto

Los datos sintéticos son datos generados artificialmente para reproducir, con distintos grados de fidelidad, características o propiedades de datos reales que resultan relevantes para un caso de uso determinado. La palabra «sintético» describe cómo se originan los datos; no certifica su calidad, su utilidad para cualquier tarea ni su anonimato.

La distinción fundamental es entre el origen y las propiedades del conjunto. Un registro sintético no se recopila directamente como observación del fenómeno real: se produce mediante algún procedimiento de generación. Para que sirva a un propósito, puede interesar que mantenga ciertos patrones de los datos de referencia, como relaciones entre variables o la presencia de casos relevantes. Qué debe conservarse depende de la tarea; no existe una única propiedad que haga útil a todo conjunto sintético.

La Agencia Española de Protección de Datos describe los datos sintéticos como datos generados artificialmente y señala que, para un caso de uso específico, deben preservarse características y propiedades de los datos reales. Esa condición de utilidad contextual no equivale a afirmar que el resultado reproduzca fielmente todos los aspectos del conjunto original ni que carezca de riesgo de privacidad.

Por tanto, una afirmación como «este conjunto es sintético» responde, como mucho, a una pregunta sobre su origen. Para valorar qué permite hacer, hay que preguntar qué proceso lo generó, qué aspectos de los datos de referencia se pretendían conservar y qué comprobaciones se realizaron para el uso previsto.

03

Cómo se plantea su generación y validación

Un proyecto de datos sintéticos empieza por la finalidad, no por la elección de una herramienta. Un conjunto adecuado para ensayar el funcionamiento de un programa puede no ser adecuado para estimar una tendencia, estudiar casos poco frecuentes o entrenar un sistema de percepción. Antes de generar nada, conviene concretar qué decisión, prueba o investigación se pretende apoyar.

El siguiente paso es definir qué propiedades importan para esa finalidad. Puede tratarse de la estructura de los datos, de relaciones entre campos o de que existan ejemplos de determinadas situaciones. El criterio no debería ser «que se parezcan» en abstracto: hay que especificar qué parecido sería útil y cómo se comprobaría. La información disponible en las fuentes consultadas no identifica una lista universal de propiedades ni una métrica válida para todos los usos.

Después se elige y documenta el procedimiento de generación. Las fuentes aportadas confirman que existen datos generados artificialmente y aluden a generación algorítmica, pero no bastan para establecer una taxonomía técnica exhaustiva ni para comparar métodos concretos. Por eso, al revisar un conjunto, es más riguroso pedir la descripción del método realmente utilizado que deducirlo solo por la etiqueta «sintético».

Finalmente se evalúa el resultado frente al propósito y se examinan por separado las posibles consecuencias sobre privacidad. Una comprobación de semejanza estadística, si se ha hecho, no demuestra por sí misma que el conjunto sirva a una tarea concreta; tampoco demuestra que no reproduzca información del conjunto de origen. La evaluación debe describir qué se probó, con qué referencia y cuáles son las limitaciones.

Secuencia de evaluación

Este esquema sirve para ordenar las preguntas; no prescribe un método técnico único.

  1. 01Precisar el uso previsto y quién utilizará el conjunto.
  2. 02Especificar las propiedades que la tarea necesita conservar y las que no son relevantes.
  3. 03Documentar el origen de los datos de referencia y el procedimiento de generación.
  4. 04Comprobar la utilidad con criterios ligados a la tarea, no solo con una medida genérica de parecido.
  5. 05Evaluar por separado la posible reproducción o revelación de información del conjunto de origen.
  6. 06Comunicar las pruebas realizadas, sus resultados y las limitaciones conocidas.
04

Tres ejemplos aplicados

Los siguientes escenarios son ejemplos ilustrativos de preguntas que podría plantear un equipo; no son afirmaciones de que un conjunto concreto haya sido generado, validado o desplegado de esa manera. En cada caso, la utilidad depende de la tarea y de la evidencia disponible.

blocks valid? no

05

Qué comprobar: utilidad, cobertura y privacidad

La utilidad no es una propiedad universal del conjunto: se refiere a una tarea. Pregunte qué actividad se validó y si esa actividad coincide con la que se propone. Un conjunto que permita probar que una aplicación acepta ciertos formatos puede no sustentar una conclusión sobre la precisión de un modelo. Del mismo modo, un resultado de evaluación no debe generalizarse a poblaciones, entornos o decisiones que no fueron examinados.

También importa la cobertura. El proceso de generación puede no conservar todos los casos relevantes, y un conjunto puede representar con mayor o menor fidelidad distintos grupos, situaciones o combinaciones de variables. No basta con que el volumen de datos sea grande o con que algunos resúmenes coincidan con los del origen. El equipo debe explicar qué dimensiones comparó y qué casos quedaron fuera de su evaluación.

La privacidad requiere un examen independiente. Que los datos no se hayan recogido directamente como registros reales no prueba que el procedimiento no reproduzca o permita inferir información del material utilizado para generarlos. Las fuentes proporcionadas no ofrecen resultados de pruebas de privacidad para un conjunto específico, ni una garantía general aplicable a todos los métodos. Por eso, cualquier afirmación de protección debe vincularse a pruebas, supuestos y contexto de uso identificables.

Conviene además documentar el conjunto de referencia, el propósito de generación, el procedimiento, las evaluaciones y las limitaciones. Si falta esa información, no es posible distinguir una afirmación respaldada por evidencia de una descripción general. La evaluación de privacidad tampoco sustituye el análisis de obligaciones y riesgos que corresponda al contexto: esta ficha no es asesoramiento legal.

Preguntas según la afirmación que se quiere evaluar

La etiqueta por sí sola no responde a estas preguntas.

AfirmaciónQué pedirQué no permite concluir por sí sola
«Es útil»La tarea evaluada, los criterios, la referencia y los resultados.Que sirva para otras tareas o poblaciones.
«Es representativo»Qué grupos o propiedades se compararon y cómo se midieron.Que cubra todos los casos relevantes.
«Protege la privacidad»Qué riesgo se evaluó, con qué pruebas y bajo qué supuestos.Que la palabra «sintético» equivalga a anonimato.
«Se parece a los datos reales»Qué dimensiones de semejanza se midieron y por qué importan.Que conserve toda propiedad útil o que no revele información.
06

Conceptos próximos que no conviene confundir

Datos sintéticos y datos anonimizados describen cuestiones distintas. «Sintético» se refiere al origen artificial; «anonimizado» es una afirmación sobre el tratamiento de datos y el riesgo de identificar o volver a identificar personas en un contexto determinado. Un conjunto sintético podría haberse generado a partir de datos reales, por lo que su carácter artificial no basta para determinar qué información conserva ni qué riesgos presenta. Tampoco corresponde dar por garantizada la anonimización sin evidencia.

El aumento de datos, o data augmentation, suele referirse a crear variaciones de ejemplos existentes mediante transformaciones, con el objetivo de ampliar o modificar el material disponible para una tarea. No es automáticamente equivalente a generar un conjunto sintético desde otro procedimiento. Para clasificar un caso concreto importa saber si se transformaron ejemplos originales, se crearon observaciones mediante reglas o simulación, o se utilizó un modelo; el nombre comercial o informal del conjunto no resuelve esa cuestión.

La simulación genera observaciones conforme a reglas o a una representación de un proceso. Puede producir datos sintéticos, pero el término describe el mecanismo o el entorno de generación, mientras que «sintético» describe el origen artificial del resultado. La calidad de la simulación dependerá de sus supuestos y de la relación entre lo simulado y la tarea real.

Los datos generados por modelos son otra posible familia de procedimientos, pero no debe presuponerse que todos los datos sintéticos provienen de un modelo entrenado con registros reales. Las fuentes institucionales disponibles aquí no documentan con suficiente detalle todas las familias, sus requisitos ni una comparación de rendimiento. Ante una afirmación concreta, solicite una descripción del método y evite convertir una posibilidad técnica en una definición universal.

Por último, la contaminación de datos, la generalización y la evaluación de IA son conceptos relacionados, pero distintos. La contaminación se refiere a que información inadecuada o relacionada con la evaluación puede afectar los datos o el proceso evaluado; la generalización trata de cómo se comporta un sistema fuera de los ejemplos usados para desarrollarlo; y la evaluación es el proceso de medir ese comportamiento. El uso de datos sintéticos no resuelve por sí mismo ninguna de esas cuestiones.

Distinciones rápidas

Clasifique el concepto por la pregunta que responde, no por una supuesta garantía común.

ConceptoPregunta principalDiferencia respecto de los datos sintéticos
Datos sintéticos¿Cómo se originaron los datos?Se generaron artificialmente; eso no determina por sí solo utilidad ni privacidad.
Datos anonimizados¿Qué riesgo de identificación se ha evaluado?Es una cuestión de privacidad, no una descripción suficiente del origen.
Aumento de datos¿Se transformaron ejemplos para ampliar o variar el material?Describe una operación sobre ejemplos; no equivale necesariamente a generación independiente.
Simulación¿Qué reglas o representación producen las observaciones?Puede ser un mecanismo para producir datos sintéticos, pero no define todos los métodos.
07

Límites y errores frecuentes

Un error frecuente es tratar la semejanza estadística como una garantía total. Un conjunto puede aproximarse a algunas propiedades del material de referencia y diferir en otras. Sin conocer qué características se compararon, no se puede afirmar que preserve «los datos» en general. La fidelidad relevante depende de la pregunta que se quiere responder.

Otro error consiste en trasladar el resultado de una prueba a un uso más amplio. Que los datos sirvan para probar una función de software no demuestra que sean adecuados para inferencia, investigación o decisiones sobre personas. Antes de reutilizarlos hay que revisar si cambió la finalidad y si se justificaron de nuevo los criterios de validez.

También es arriesgado interpretar «no contiene datos reales» como «no puede revelar información». Esa conclusión requiere examinar cómo se generó el conjunto y qué pruebas respaldan la afirmación. Las notas de las fuentes disponibles no permiten declarar que un método concreto sea inmune a la reproducción de información ni cuantificar un riesgo general.

Por último, no debe suponerse que un conjunto sintético reemplaza siempre a los datos reales o evita toda limitación de acceso, sesgo o calidad. Puede ayudar en determinados flujos de trabajo, pero la pertinencia y los riesgos se valoran caso por caso. Cuando faltan documentación, métricas o pruebas, la conclusión razonable es que la evidencia es insuficiente, no que el conjunto sea necesariamente inútil o necesariamente seguro.

08

Criterios prácticos para valorar una afirmación

Al recibir un conjunto o una promesa sobre datos sintéticos, empiece por pedir una descripción verificable: quién los generó, de qué material o referencia partió, qué procedimiento usó y para qué tarea se diseñaron. Si esas respuestas no están disponibles, no es posible valorar con precisión ni el alcance de la utilidad ni el significado de una afirmación de privacidad.

A continuación, compruebe si la evaluación se ajusta al propósito. Pregunte qué propiedades se midieron, qué casos relevantes se consideraron, qué comparación se utilizó y qué limitaciones se reconocieron. Una métrica aislada no tiene un significado universal: hace falta saber qué pretende medir y por qué es adecuada para esa aplicación.

Para privacidad, pida que se expliquen las pruebas realizadas y el tipo de riesgo examinado, sin aceptar que «sintético» funcione como sinónimo de «anónimo». Para rendimiento, pregunte qué uso se validó y qué usos quedan fuera. Mantenga separadas ambas evaluaciones, porque una conclusión favorable en una no resuelve automáticamente la otra.

En resumen: defina el propósito, examine el método, exija validación ligada a la tarea y trate la privacidad como una cuestión independiente. Si no se conocen las referencias, pruebas o supuestos, registre esa incertidumbre. Esa cautela permite distinguir una propiedad documentada de una expectativa y evita atribuir al término más de lo que significa.

Lista breve de preguntas

Úsela para revisar documentación o conversar con quien presenta el conjunto.

  1. 01¿Cuál es el uso concreto y qué decisión o prueba pretende apoyar?
  2. 02¿Qué propiedades se esperaba conservar y cuáles se evaluaron?
  3. 03¿Cómo se generó el conjunto y qué relación tiene con los datos de referencia?
  4. 04¿Qué evidencia respalda la utilidad para esa tarea y qué límites se comunicaron?
  5. 05¿Qué pruebas separadas se realizaron para evaluar privacidad?
  6. 06¿La conclusión se limita a lo que realmente se comprobó?
09

Ejemplos rápidos

10

Conceptos relacionados

11

Fuentes consultadas