Aller au contenu
RGPD et conformité6 min de lecture

Les trois tests de l'anonymisation (individualisation, corrélation, inférence) expliqués

Individualisation, corrélation, inférence : le sens des trois critères du G29, montrés sur des documents, et où en est le CEPD en septembre 2026.

Par Alexis de ONYRIMis à jour le 23 septembre 2026

Dans l'UE, les autorités testent l'anonymisation avec trois questions. Peut-on isoler un individu ? Relier deux enregistrements sur la même personne ? Déduire un fait nouveau sur elle ? Si la réponse est non aux trois, les données peuvent être considérées comme anonymes en toute sécurité. Ces tests viennent de l'avis 05/2014 du G29, prédécesseur du Comité européen de la protection des données (CEPD).

L'avis date du 10 avril 2014. La CNIL le cite toujours en référence, et un projet du CEPD de juillet 2026 le met à jour. Guide vérifié en septembre 2026.

Quels sont les trois tests de l'anonymisation ?

Pour l'avis, identifier quelqu'un ne se limite pas à retrouver son nom. C'est aussi pouvoir l'identifier par individualisation, corrélation ou inférence. Un fichier sans aucun nom peut donc rester une donnée personnelle.

TestQuestionExemple dans un document
IndividualisationPuis-je isoler les lignes d'une seule personne ?La seule infirmière de nuit embauchée en 2021.
CorrélationPuis-je relier deux enregistrements sur la même personne ?Deux courriers caviardés, même numéro de dossier.
InférencePuis-je déduire un fait sur une personne ?Toute une équipe de quatre est en arrêt maladie.
D'après l'avis 05/2014 du G29, section 3.

À quoi ressemblent les trois tests dans un document ?

L'individualisation, c'est isoler les enregistrements qui identifient une personne. Dans une synthèse RH fictive, le nom de Claire Exemple est masqué. Mais le texte dit encore : la seule responsable du dépôt de Roubaix, embauchée en mars 2019. Une seule personne correspond. Coupables habituels : poste rare, date exacte, petite commune.

La corrélation, c'est relier au moins deux enregistrements sur la même personne. Dans des documents, un détail stable survit d'un fichier à l'autre. Deux courriers caviardés gardent le même numéro de dossier. Un contrat et une facture affichent le même montant le même jour.

L'inférence, c'est déduire, avec une probabilité élevée, la valeur d'un attribut à partir des autres. Un tableau d'absences montre une équipe de quatre personnes, toutes en arrêt long. Si vous savez que Jean Exemple y travaille, vous apprenez quelque chose sur sa santé. L'avis y voit le principal défaut du k-anonymat.

Randomisation ou généralisation : quelles sont les deux familles ?

La randomisation altère la véracité des données pour casser le lien avec la personne. L'ajout de bruit rend les valeurs moins précises : une taille au centimètre devient exacte à plus ou moins 10 cm. La permutation mélange des valeurs entre enregistrements. La confidentialité différentielle ajoute un bruit calculé aux réponses.

La généralisation change l'échelle des détails : une région plutôt qu'une ville, un mois plutôt qu'une semaine. Le k-anonymat regroupe chaque personne avec au moins k autres aux mêmes valeurs. La l-diversité et la t-proximité gardent en plus des valeurs sensibles variées dans chaque groupe. Dans un document : une responsable dans le Nord, pas la responsable du dépôt de Roubaix.

TechniqueIndividualisation ?Corrélation ?Inférence ?
PseudonymisationOuiOuiOui
Ajout de bruitOuiPeut-être pasPeut-être pas
SubstitutionOuiOuiPeut-être pas
Agrégation ou k-anonymatNonOuiOui
L-diversitéNonOuiPeut-être pas
Confidentialité différentiellePeut-être pasPeut-être pasPeut-être pas
Hachage ou tokenisationOuiOuiPeut-être pas
Le risque subsiste-t-il ? Source : avis 05/2014 du G29, tableau 6.

L'avis le dit lui-même : aucune technique ne remplit avec certitude les trois critères. Il recommande donc de les combiner, au cas par cas. L'anonymisation n'est pas non plus un exercice ponctuel : les risques doivent être réévalués régulièrement.

Pourquoi la pseudonymisation échoue-t-elle aux trois tests ?

La pseudonymisation remplace un attribut, en général un identifiant unique comme un nom ou un numéro de client, par un autre : un code ou une étiquette comme [NAME1]. L'avis est direct : c'est une mesure de sécurité utile, mais pas une méthode d'anonymisation. La nouvelle étiquette individualise toujours la personne. Les enregistrements qui la portent se relient sans effort. L'identité réelle peut encore se déduire des détails restants.

Le RGPD le confirme. Selon le considérant 26, des données pseudonymisées attribuables à une personne grâce à des informations supplémentaires concernent une personne identifiable. Le considérant 28 ajoute que la pseudonymisation peut réduire les risques. Elle ne fait pas sortir les données du RGPD.

Où en sont les lignes directrices du CEPD en 2026 ?

Anonymisation : le CEPD a adopté le projet de lignes directrices 02/2026 le 7 juillet 2026, soumis à consultation jusqu'au 30 octobre 2026. Les trois tests restent, sous de nouveaux noms anglais : No Record Isolation, No Linkage, No Inference. Si l'un échoue, il faut pousser l'analyse avant de conclure. Le projet s'appuie sur l'arrêt de la Cour de justice du 4 septembre 2025 (affaire C-413/23 P) : l'anonymat peut varier d'une entité à l'autre.

Pseudonymisation : le CEPD a adopté le projet de lignes directrices 01/2025 le 16 janvier 2025, ouvert aux commentaires jusqu'au 14 mars 2025. Selon ce projet, des données pseudonymisées restent personnelles même quand quelqu'un d'autre détient les informations supplémentaires. L'arrêt de 2025 a nuancé ce point : pour la Cour, elles ne sont pas des données personnelles « en toute hypothèse et pour toute personne ». Le CEPD a ensuite consulté les parties prenantes en décembre 2025 pour poursuivre ses travaux. En septembre 2026, il n'affiche toujours que le projet.

Que retenir pour vos documents ?

L'avis vise des jeux de données. Ses trois questions marchent aussi sur un contrat, un courrier médical ou un CV.

  1. 1Masquez tous les identifiants directs : noms, e-mails, téléphones, adresses, numéros d'identité et de compte.
  2. 2Traquez les quasi-identifiants : poste, date exacte, petite commune, maladie rare. Testez l'individualisation pour chacun.
  3. 3Généralisez le reste : une année au lieu d'une date, une région au lieu d'une ville.
  4. 4Cherchez les liens : numéros de dossier, montants, dates repris ailleurs.
  5. 5Testez l'inférence : le lecteur peut-il déduire un fait sur la santé ou l'argent de quelqu'un ?
  6. 6Si un test échoue, parlez de fichier caviardé ou pseudonymisé, et appliquez toujours le RGPD.

Un logiciel aide pour la première étape : il repère vite e-mails, IBAN ou téléphones, mais ne juge pas le contexte. ONYRI Sanitize, par exemple, masque un PDF, un fichier Word ou un scan dans le navigateur, et vous vérifiez chaque élément avant l'export. Son mode Token, avec des étiquettes comme [NAME1], est une pseudonymisation. Ses barres noires sont irréversibles. Aucun des deux ne rend seul un document anonyme.

Questions fréquentes

L'avis 05/2014 du G29 est-il encore valable sous le RGPD ?
Il a été écrit sous l'ancienne directive 95/46/CE, mais ses trois critères servent toujours. La CNIL les reprend sur son site. Selon une note du projet 02/2026 du CEPD, une évaluation d'anonymat faite selon l'avis de 2014 n'est pas à refaire.
Faut-il réussir les trois tests pour qu'une donnée soit anonyme ?
Réussir les trois est la voie sûre. Si un test échoue, l'avis demande une évaluation approfondie des risques d'identification. La CNIL précise que le responsable doit alors démontrer que le risque d'identification est négligeable.
Hacher un nom ou un numéro d'identité, est-ce anonymiser ?
Non. L'avis range le hachage parmi les techniques de pseudonymisation. Si les valeurs possibles sont connues, comme pour un numéro d'identification national, un attaquant peut toutes les hacher et comparer. Un sel complique l'attaque, mais retrouver la valeur d'origine peut rester faisable avec des moyens raisonnables.
Anonymiser, est-ce atteindre le risque zéro ?
Non. Le considérant 26 du RGPD vise les moyens raisonnablement susceptibles d'être utilisés, en comptant le coût, le temps et la technologie disponible. L'avis admet qu'un risque résiduel demeure. La CNIL parle de rendre l'identification impossible en pratique, et demande une veille régulière.

Sources et références

Masquez un document sans l'envoyer nulle part

ONYRI Sanitize repère les noms, identifiants, coordonnées bancaires et secrets dans un PDF, un Word ou un scan, et les masque dans votre navigateur. Vous relisez l'aperçu, puis vous téléchargez une copie aplatie.

À lire ensuite