
Définition en une phrase
Datos generados artificialmente para entrenar, probar o simular escenarios cuando se controla su procedencia y calidad.
Définition : des données créées artificiellement pour un usage précis
Les données synthétiques sont générées artificiellement afin de reproduire, avec différents degrés de fidélité, des caractéristiques ou des propriétés de données réelles pertinentes pour un cas d’usage déterminé. Le terme « synthétique » décrit l’origine des données ; il ne certifie ni leur qualité, ni leur utilité pour n’importe quelle tâche, ni leur anonymat.
La distinction fondamentale porte sur l’origine, d’une part, et les propriétés de l’ensemble, d’autre part. Un enregistrement synthétique n’est pas recueilli directement comme une observation du phénomène réel : il est produit au moyen d’un procédé de génération. Pour qu’il réponde à un objectif, il peut être nécessaire qu’il conserve certains motifs des données de référence, par exemple des relations entre variables ou la présence de cas pertinents. Les éléments à préserver dépendent de la tâche ; aucune propriété unique ne suffit à rendre utile tout ensemble synthétique.
L’Agence espagnole de protection des données décrit les données synthétiques comme des données générées artificiellement et indique que, pour un cas d’usage précis, elles doivent préserver les caractéristiques et propriétés des données réelles. Cette exigence d’utilité contextuelle ne signifie pas que le résultat reproduise fidèlement tous les aspects de l’ensemble d’origine, ni qu’il soit dépourvu de risque pour la vie privée.
Ainsi, l’affirmation « cet ensemble est synthétique » répond tout au plus à une question sur son origine. Pour déterminer ce qu’il permet de faire, il faut demander quel procédé l’a généré, quels aspects des données de référence devaient être préservés et quelles vérifications ont été réalisées pour l’usage prévu.
Comment concevoir et valider leur génération
Un projet de données synthétiques commence par la définition de sa finalité, et non par le choix d’un outil. Un ensemble adapté au test du fonctionnement d’un programme peut ne pas convenir à l’estimation d’une tendance, à l’étude de cas rares ou à l’entraînement d’un système de perception. Avant toute génération, il convient de préciser quelle décision, quel test ou quelle recherche les données doivent étayer.
L’étape suivante consiste à définir les propriétés importantes pour cette finalité. Il peut s’agir de la structure des données, des relations entre les champs ou de la présence d’exemples de certaines situations. Le critère ne devrait pas être une vague « ressemblance » : il faut préciser quelle ressemblance serait utile et comment elle serait vérifiée. Les sources consultées ne donnent ni liste universelle de propriétés à préserver ni mesure valable pour tous les usages.
Il faut ensuite choisir et documenter le procédé de génération. Les sources fournies confirment l’existence de données générées artificiellement et évoquent la génération algorithmique, mais elles ne suffisent pas à établir une taxonomie technique exhaustive ni à comparer des méthodes précises. Lorsqu’on examine un ensemble, il est donc plus rigoureux de demander une description du procédé effectivement utilisé que de le déduire de la seule étiquette « synthétique ».
Enfin, le résultat est évalué au regard de l’objectif, tandis que les conséquences possibles sur la vie privée font l’objet d’un examen distinct. Une vérification de similarité statistique, si elle a été réalisée, ne prouve pas à elle seule que l’ensemble convient à une tâche précise ; elle ne prouve pas non plus qu’il ne reproduit aucune information de l’ensemble d’origine. L’évaluation doit indiquer ce qui a été testé, par rapport à quelle référence et avec quelles limites.
Étapes de l’évaluation
Ce schéma organise les questions à poser ; il ne prescrit pas une méthode technique unique.
- 01Préciser l’usage prévu et les personnes qui utiliseront l’ensemble.
- 02Définir les propriétés que la tâche doit préserver et celles qui ne sont pas pertinentes.
- 03Documenter l’origine des données de référence et le procédé de génération.
- 04Vérifier l’utilité à l’aide de critères liés à la tâche, et pas seulement d’une mesure générale de ressemblance.
- 05Évaluer séparément les risques éventuels de reproduction ou de divulgation d’informations provenant de l’ensemble d’origine.
- 06Présenter les tests effectués, leurs résultats et les limites connues.
Trois exemples d’application
Les scénarios ci-dessous illustrent des questions qu’une équipe pourrait se poser ; ils ne prétendent pas qu’un ensemble précis a été généré, validé ou déployé de cette manière. Dans chaque cas, l’utilité dépend de la tâche et des éléments disponibles pour l’étayer.
Que vérifier : utilité, couverture et vie privée
L’utilité n’est pas une propriété universelle de l’ensemble : elle se rapporte à une tâche. Demandez quelle activité a été validée et si elle correspond à celle envisagée. Un ensemble qui permet de vérifier qu’une application accepte certains formats peut ne pas étayer une conclusion sur la précision d’un modèle. De même, un résultat d’évaluation ne doit pas être généralisé à des populations, des environnements ou des décisions qui n’ont pas été examinés.
La couverture compte également. Le processus de génération peut ne pas préserver tous les cas pertinents, et un ensemble peut représenter avec une fidélité variable différents groupes, situations ou combinaisons de variables. Le volume des données ou la concordance de quelques statistiques récapitulatives avec celles de l’ensemble d’origine ne suffisent pas. L’équipe doit expliquer quelles dimensions elle a comparées et quels cas n’ont pas été inclus dans son évaluation.
La vie privée appelle un examen indépendant. Le fait que les données n’aient pas été recueillies directement sous la forme d’enregistrements réels ne prouve pas que le procédé de génération ne reproduise pas ou ne permette pas d’inférer des informations à partir du matériel utilisé. Les sources fournies ne présentent pas de résultats de tests de confidentialité pour un ensemble précis et n’établissent aucune garantie générale applicable à toutes les méthodes. Toute affirmation de protection doit donc être rattachée à des tests, des hypothèses et un contexte d’utilisation identifiables.
Il est également conseillé de documenter l’ensemble de référence, l’objectif de génération, le procédé, les évaluations et les limites. En l’absence de ces informations, il est impossible de distinguer une affirmation étayée par des éléments probants d’une description générale. L’évaluation de la vie privée ne remplace pas non plus l’analyse des obligations et des risques propres au contexte : cette fiche ne constitue pas un conseil juridique.
Questions à poser selon l’affirmation examinée
L’étiquette seule ne répond pas à ces questions.
| Affirmation | Éléments à demander | Ce qu’elle ne permet pas de conclure à elle seule |
|---|---|---|
| « C’est utile » | La tâche évaluée, les critères, la référence et les résultats. | Que l’ensemble convienne à d’autres tâches ou populations. |
| « C’est représentatif » | Les groupes ou propriétés comparés et la manière dont ils ont été mesurés. | Que tous les cas pertinents soient couverts. |
| « Cela protège la vie privée » | Le risque évalué, les tests réalisés et les hypothèses retenues. | Que le terme « synthétique » équivaille à « anonyme ». |
| « Cela ressemble aux données réelles » | Les dimensions de ressemblance mesurées et leur pertinence. | Que toutes les propriétés utiles soient préservées ou qu’aucune information ne soit révélée. |
Concepts proches à ne pas confondre
Les données synthétiques et les données anonymisées ne désignent pas la même chose. « Synthétique » se rapporte à l’origine artificielle ; « anonymisé » est une affirmation portant sur le traitement des données et le risque d’identifier ou de réidentifier des personnes dans un contexte donné. Un ensemble synthétique peut avoir été généré à partir de données réelles : son caractère artificiel ne suffit donc pas à déterminer quelles informations il conserve ni les risques qu’il présente. Il ne faut pas non plus tenir l’anonymisation pour acquise en l’absence de preuves.
L’augmentation de données, ou data augmentation, désigne généralement la création de variantes d’exemples existants au moyen de transformations, afin d’élargir ou de modifier le matériel disponible pour une tâche. Elle n’équivaut pas automatiquement à la génération d’un ensemble synthétique par une autre méthode. Pour classer un cas précis, il importe de savoir si des exemples d’origine ont été transformés, si des observations ont été créées par des règles ou une simulation, ou si un modèle a été utilisé. Le nom commercial ou informel de l’ensemble ne permet pas de trancher.
La simulation produit des observations selon des règles ou une représentation d’un processus. Elle peut générer des données synthétiques, mais le terme décrit le mécanisme ou l’environnement de génération, tandis que « synthétique » décrit l’origine artificielle du résultat. La qualité de la simulation dépend de ses hypothèses et du rapport entre ce qui est simulé et la tâche réelle.
Les données générées par des modèles constituent une autre famille de procédés envisageable, mais il ne faut pas supposer que toutes les données synthétiques proviennent d’un modèle entraîné sur des enregistrements réels. Les sources institutionnelles disponibles ici ne décrivent pas suffisamment toutes les familles de méthodes, leurs exigences ou leurs performances comparées. Face à une affirmation précise, demandez une description de la méthode et évitez de transformer une possibilité technique en définition universelle.
Enfin, la contamination des données, la généralisation et l’évaluation de l’IA sont des notions connexes, mais distinctes. La contamination désigne le fait que des informations inadéquates ou liées à l’évaluation puissent influer sur les données ou sur le processus évalué ; la généralisation concerne le comportement d’un système en dehors des exemples utilisés pour son développement ; l’évaluation est le processus qui consiste à mesurer ce comportement. Le recours à des données synthétiques ne résout à lui seul aucune de ces questions.
Repères pour distinguer les notions
Classez les notions selon la question à laquelle elles répondent, et non d’après une garantie supposée commune.
| Notion | Question principale | Différence par rapport aux données synthétiques |
|---|---|---|
| Données synthétiques | Comment les données ont-elles été produites ? | Elles ont été générées artificiellement ; cela ne détermine pas, à soi seul, leur utilité ou leur niveau de confidentialité. |
| Données anonymisées | Quel risque d’identification a été évalué ? | Il s’agit d’une question de vie privée, et non d’une description suffisante de l’origine. |
| Augmentation de données | Des exemples ont-ils été transformés pour élargir ou varier le matériel ? | Il s’agit d’une opération sur des exemples, qui n’équivaut pas nécessairement à une génération indépendante. |
| Simulation | Quelles règles ou quelle représentation produisent les observations ? | Elle peut servir à produire des données synthétiques, mais ne définit pas toutes les méthodes. |
Limites et erreurs fréquentes
Une erreur fréquente consiste à traiter la ressemblance statistique comme une garantie globale. Un ensemble peut approcher certaines propriétés du matériel de référence et s’en écarter sur d’autres. Sans savoir quelles caractéristiques ont été comparées, il est impossible d’affirmer qu’il préserve « les données » dans leur ensemble. La fidélité pertinente dépend de la question posée.
Une autre erreur consiste à étendre le résultat d’un test à un usage plus large. Le fait que les données conviennent au test d’une fonctionnalité logicielle ne prouve pas qu’elles soient adaptées à l’inférence, à la recherche ou à des décisions concernant des personnes. Avant de les réutiliser, il faut vérifier si la finalité a changé et si les critères de validité ont été justifiés à nouveau.
Il est également risqué d’interpréter « ne contient pas de données réelles » comme « ne peut révéler aucune information ». Cette conclusion suppose d’examiner la manière dont l’ensemble a été généré et les tests qui étayent l’affirmation. Les notes relatives aux sources disponibles ne permettent pas de déclarer qu’une méthode précise est à l’abri de toute reproduction d’information, ni de quantifier un risque général.
Enfin, il ne faut pas supposer qu’un ensemble synthétique remplace toujours les données réelles ou élimine toute limite d’accès, tout biais ou tout problème de qualité. Il peut faciliter certaines étapes d’un travail, mais sa pertinence et ses risques doivent être évalués au cas par cas. Lorsque la documentation, les mesures ou les tests font défaut, la conclusion raisonnable est que les éléments probants sont insuffisants, et non que l’ensemble est nécessairement inutile ou nécessairement sûr.
Critères pratiques pour évaluer une affirmation
Si l’on vous remet un ensemble ou si l’on vous fait une promesse au sujet de données synthétiques, commencez par demander une description vérifiable : qui les a générées, à partir de quel matériel ou de quelle référence, selon quel procédé et pour quelle tâche. Si ces réponses ne sont pas disponibles, il est impossible d’évaluer avec précision la portée de l’utilité ou le sens d’une affirmation relative à la vie privée.
Vérifiez ensuite si l’évaluation correspond à l’objectif. Demandez quelles propriétés ont été mesurées, quels cas pertinents ont été pris en compte, quelle comparaison a été utilisée et quelles limites ont été reconnues. Une mesure isolée n’a pas de signification universelle : il faut savoir ce qu’elle est censée mesurer et pourquoi elle convient à l’application concernée.
Pour la vie privée, demandez que les tests réalisés et le type de risque examiné soient expliqués, sans accepter que « synthétique » soit employé comme synonyme d’« anonyme ». Pour les performances, demandez quel usage a été validé et quels usages sont exclus. Gardez ces deux évaluations séparées : une conclusion favorable dans l’un des domaines ne règle pas automatiquement l’autre.
En résumé : définissez l’objectif, examinez la méthode, exigez une validation liée à la tâche et traitez la vie privée comme une question indépendante. Si les références, les tests ou les hypothèses ne sont pas connus, consignez cette incertitude. Cette prudence aide à distinguer une propriété documentée d’une attente et évite de prêter au terme une portée excessive.
Liste rapide de questions
Utilisez-la pour examiner une documentation ou échanger avec la personne qui présente l’ensemble.
- 01Quel est l’usage précis et quelle décision ou quel test doit-il étayer ?
- 02Quelles propriétés devait-on préserver et lesquelles ont été évaluées ?
- 03Comment l’ensemble a-t-il été généré et quel est son lien avec les données de référence ?
- 04Quels éléments prouvent son utilité pour cette tâche, et quelles limites ont été communiquées ?
- 05Quels tests distincts ont été réalisés pour évaluer la vie privée ?
- 06La conclusion se limite-t-elle à ce qui a effectivement été vérifié ?