Aller au contenu
Fondamentaux6 min de lecture

Réidentification : pourquoi retirer les noms ne suffit pas

Une date de naissance, un code postal et un poste peuvent désigner une seule personne. Ce que montre la recherche, et quoi masquer selon le lecteur.

Par Alexis de ONYRIMis à jour le 23 septembre 2026

Retirer les noms ne suffit pas : on reconnaît une personne à une combinaison de détails ordinaires. Une date de naissance, un code postal et un poste peuvent désigner une seule personne, sans aucun nom sur la page. Pour protéger quelqu'un, il faut aussi masquer ou généraliser ces détails. Jusqu'où aller dépend du lecteur.

Qu'est-ce qu'un quasi-identifiant ?

Un quasi-identifiant ne nomme personne à lui seul, mais resserre le champ. En 2000, la chercheuse Latanya Sweeney l'a défini comme un ensemble de données qui, combinées, correspondent à une seule personne ou presque. Le RGPD (UE) vise aussi l'identification indirecte (article 4, point 1). Exemple donné par la CNIL : une femme vivant à telle adresse, née tel jour et membre de telle association. Dans un document, cherchez :

  • La date de naissance, l'âge, ou la date exacte d'un événement : embauche, admission, licenciement.
  • Le code postal, la commune, le site, l'école, l'hôpital.
  • Le poste, le grade ou l'équipe, surtout si une seule personne l'occupe.
  • Les événements rares : un long arrêt maladie, un accident, un procès, un prix.

Prenez une réclamation visant Claire Exemple. Vous noircissez son nom. Le texte dit encore : la responsable paie du site de Tours, 52 ans, de retour d'arrêt maladie le 3 mars. Ce site n'a qu'une responsable paie, et chacun sait qui était absent. Le nom n'a jamais été nécessaire.

Que montre la recherche sur la réidentification ?

L'étude de référence est celle de Latanya Sweeney, Simple Demographics Often Identify People Uniquely (2000). D'après le recensement américain de 1990, 87 % de la population des États-Unis, soit 216 millions de personnes sur 248, était probablement unique sur trois champs : code postal à cinq chiffres, sexe et date de naissance. Avec la ville au lieu du code postal : encore 53 %.

En 2019, Rocher, Hendrickx et de Montjoye ont estimé dans Nature Communications que 99,98 % des Américains seraient correctement réidentifiés dans n'importe quel jeu de données comportant 15 attributs démographiques. En 2013, de Montjoye et ses collègues ont montré que quatre points de lieu et d'heure suffisent à identifier de façon unique 95 % de 1,5 million d'utilisateurs de téléphone. Or un courrier en dit bien plus qu'une ligne de tableau.

Quels sont les trois risques : individualisation, corrélation, inférence ?

Dans son avis 05/2014, le groupe de travail « Article 29 », ancêtre du CEPD, insiste : identifier, ce n'est pas seulement retrouver un nom ou une adresse. Il nomme trois risques, repris par la CNIL.

  • Individualisation : peut-on isoler une personne ? La seule femme de l'équipe de nuit est isolée, avec ou sans nom.
  • Corrélation : peut-on relier le texte à une autre source sur la même personne ? Une date de licenciement recoupe un profil public. L'autorité britannique, l'ICO, parle d'effet mosaïque.
  • Inférence : peut-on déduire une information nouvelle, avec un degré de probabilité élevé ? Un des trois comptables est gravement malade, dit la note. Deux viennent de courir un marathon.

Le CEPD met ce texte à jour. Le 7 juillet 2026, il a adopté ses lignes directrices 02/2026 sur l'anonymisation, en consultation publique jusqu'au 30 octobre 2026. Selon la CNIL, les trois tests deviennent : pas d'individualisation des enregistrements, pas de corrélation, pas d'inférence. En septembre 2026, le texte n'est pas encore définitif.

Quels détails d'un document trahissent une personne ?

DétailPourquoi il identifieQue faire
Petite population : une équipe de six, un villageUn détail de plus, et il reste un candidatÉlargir le groupe : l'entreprise, la région
Rôle ou événement rare : le DAF, la seule sage-femme, un procèsIl vaut un nom, et les gens s'en souviennentUn terme large : un cadre, un litige
Dates exactes : naissance, embauche, accidentElles se recoupent avec agendas et registresGarder l'année, ou donner une durée
Lieux : code postal, site, petite communeUn lieu plus un détail : le champ se resserreGarder la région ou le pays

La France applique cette logique aux décisions de justice en open data. Selon le ministère de la Justice, les noms et prénoms des personnes physiques, parties ou tiers, sont systématiquement occultés. Des éléments d'identification complémentaires peuvent l'être aussi, en cas de risque pour la vie privée ou la sécurité. Le nom n'est que la première couche.

Que masquer selon le lecteur ?

Pour l'ICO, une diffusion publique vous fait perdre le contrôle des données : l'approche doit être très robuste. Avec un groupe défini, vous regardez ce que ce groupe sait déjà. Son exemple : un salarié peut comprendre qu'une statistique d'absence concerne un collègue.

LecteurCe qu'il peut utiliserÀ masquer en plus des noms
Le public : site web, presse, open dataTout le web, les archives, les registres, du tempsDates exactes, lieux sous le niveau de la région, rôles et événements rares, numéros de référence
Un collègue ou une commissionLe savoir interne : qui fait quoi, qui était absentPoste, équipe, site, dates de l'absence ou de l'incident
Un outil d'IALe fournisseur peut conserver vos envois : lisez ses conditionsCoordonnées, numéros de compte et d'identité, tout détail précis inutile à la tâche

Le lecteur interne est le cas difficile. Face à un collègue, retirer le nom ne change presque rien : le contexte est l'identifiant. L'équipe a-t-elle besoin du cas, ou seulement de sa leçon ? Pour un outil d'IA, des étiquettes cohérentes comme [NAME1] gardent le texte lisible. C'est de la pseudonymisation : qui détient l'original peut refaire le lien.

Comment tester un document avant de l'envoyer ?

  1. 1Nommez votre lecteur, et listez ce qu'il sait déjà ou peut trouver en dix minutes.
  2. 2Relisez la copie masquée en intrus motivé, le test de l'ICO : une personne compétente, avec Internet et les documents publics. Essayez de nommer la personne.
  3. 3Cherchez sur le web l'expression, le titre ou l'événement le plus rare du texte.
  4. 4Généralisez ce qui désigne encore une seule personne. Supprimez ce dont le lecteur n'a pas besoin.
  5. 5Vérifiez le fichier : pas de texte sous les barres, pas de métadonnées. Gardez l'original en lieu sûr.

Un logiciel traite la première couche : les outils à base de motifs repèrent noms, courriels, téléphones, adresses, numéros d'identité et dates. ONYRI Sanitize, par exemple, le fait dans le navigateur, sans envoyer le fichier, et vous laisse ajouter vos propres termes. Mais un poste ou un événement rare sont des mots ordinaires. Aucun détecteur ne sait que le site de Tours n'a qu'une responsable paie : à vous de le voir dans l'aperçu. Masquer réduit l'exposition, sans rendre à soi seul un document anonyme.

Questions fréquentes

Quelle différence entre un identifiant direct et un quasi-identifiant ?
Un identifiant direct désigne une personne à lui seul : un nom, une adresse courriel, un numéro de sécurité sociale. Un quasi-identifiant ne fait que resserrer le champ : date de naissance, code postal, poste. Combinés, ils peuvent être aussi précis qu'un nom.
Un document sans noms est-il anonyme au sens du RGPD ?
Pas automatiquement. Le considérant 26 vise tous les moyens raisonnablement susceptibles d'être utilisés, par vous ou par toute autre personne, et cite le ciblage. Si un lecteur peut retrouver de qui parle le texte, c'est encore une donnée personnelle.
Faut-il noircir toutes les dates et tous les lieux ?
Non. Généralisez d'abord : une année au lieu d'une date, une région au lieu d'une commune, un rôle large au lieu du titre exact. La taille du groupe décide. Dans une entreprise de 5 000 personnes, un responsable commercial passe. Dans une équipe de six, non.
Un logiciel peut-il trouver les quasi-identifiants à ma place ?
En partie. Les outils détectent ce qui suit un motif : noms, dates, adresses, téléphones, numéros d'identité. Ils ne savent pas qu'un poste ou une histoire désigne une seule personne. Détectez pour aller vite, puis relisez comme votre lecteur le mieux informé.

Sources et références

Masquez un document sans l'envoyer nulle part

ONYRI Sanitize repère les noms, identifiants, coordonnées bancaires et secrets dans un PDF, un Word ou un scan, et les masque dans votre navigateur. Vous relisez l'aperçu, puis vous téléchargez une copie aplatie.

À lire ensuite