Aller au contenu
Fondamentaux7 min de lecture

Pourquoi un document est plus dur à anonymiser qu'une base

Une base a des colonnes qu'on peut supprimer. Un document n'en a pas : noms et numéros se cachent dans des phrases, tableaux, pieds de page et scans.

Par Alexis de ONYRI

Une base de données est facile à anonymiser car chaque nom vit dans une colonne dédiée. Un document n'a pas de colonnes. Un nom, un numéro de téléphone ou une signature peuvent se trouver dans une phrase, un tableau, un pied de page ou une image scannée. Il faut repérer chacun séparément.

Prenez un tableur de clients et une lettre envoyée à l'un d'eux. Dans le tableur, supprimer la colonne « nom » efface le nom de chaque client d'un coup. Dans la lettre, le nom de Claire Exemple apparaît dans la formule de politesse, dans l'adresse postale, puis dans la signature : trois endroits différents.

Quelle est la différence entre données structurées et non structurées ?

Une donnée structurée a une forme fixe : lignes et colonnes, comme un tableur. Chaque valeur porte une étiquette : un programme peut supprimer la colonne « téléphone » sans lire une ligne. Une donnée non structurée n'a pas cette forme. Une lettre ou un scan, c'est du texte libre et des images, sans rien qui dise « ceci est un numéro de téléphone ». Il faut lire le contenu.

QuestionDans une base de donnéesDans un document
Où vit un nom ?Dans une colonne, pour chaque ligneDispersé dans des phrases, tableaux, une signature
Comment le retirer partout ?Supprimer la colonne, une foisRetrouver chaque occurrence, page par page
Quelle technique s'applique ?Généraliser un champ, pour toutes les lignesDétecter la valeur, puis la masquer
Si on en oublie une ?La colonne reste protégéeUne mention oubliée identifie le fichier
Données structurées et documents non structurés, côte à côte.

Où se cachent les identifiants dans un document ?

Un délégué à la protection des données travaillant sur une base peut lister toutes les colonnes en quelques minutes. Un document n'offre pas cette liste. La CNIL distingue les identifiants directs, comme le nom ou l'adresse, des identifiants indirects, qui n'identifient une personne qu'une fois croisés avec d'autres informations. Dans un document, les deux surgissent n'importe où.

  • Le corps du texte : un nom, un numéro ou une adresse, dans une phrase ordinaire.
  • Les tableaux du fichier : paie, liste de clients, planning de rendez-vous.
  • Les en-têtes et pieds de page : une référence ou un nom, répété sur chaque page.
  • Les signatures et notes manuscrites : sur une page scannée ou photographiée.
  • Les métadonnées : le nom de l'auteur, enregistré par Word ou un outil PDF.
  • Les images et captures d'écran collées : une photo, un graphique avec des étiquettes.

Pourquoi supprimer une colonne ne fonctionne pas sur une lettre ?

Supprimer la colonne « nom » dans une base de données est une seule opération qui couvre tous les enregistrements d'un coup. Une lettre n'a pas de champ « nom » à supprimer. Le mot « Claire » peut apparaître dans la formule de politesse. Il revient quand on la remercie pour sa commande, puis une troisième fois dans la signature. Chaque mention doit être reconnue à chaque fois qu'elle apparaît.

Comment la généralisation et la suppression s'appliquent-elles à un paragraphe de texte ?

La généralisation remplace un chiffre exact par une fourchette. La suppression retire la valeur. La CNIL distingue deux grandes familles de techniques, la randomisation et la généralisation, avec l'exemple de remplacer une date de naissance exacte par l'année seule. Appliquée à un document, la même logique fonctionne sur des phrases plutôt que sur des cellules de tableur.

  • « Née le 3 mars 1990, à Lyon » devient « Née dans les années 1990, en France ».
  • « Titulaire du compte : Claire Exemple, 47 ans » devient « Titulaire : [nom masqué], 40 à 49 ans ».
  • Un salaire exact devient une fourchette, par exemple « entre 40 000 et 50 000 euros par an ».
  • Une adresse postale devient un nom de ville, sans numéro de rue ni code postal.

À quoi ressemble un processus solide pour anonymiser des documents ?

Un processus solide suit cinq étapes : détecter, relire, retirer, aplatir, vérifier. Sauter la relecture, c'est là que la fausse confiance s'installe. Sauter l'aplatissement, c'est comment un fichier « masqué » garde son texte d'origine en dessous. Une distinction compte : remplacer un nom par une étiquette, comme NOM1, relève de la pseudonymisation, pas de l'anonymisation, car le motif reste traçable.

  1. 1Détecter : passer chaque page au crible pour repérer noms, numéros, dates et valeurs sensibles.
  2. 2Relire : parcourir la liste des détections, car un détecteur peut manquer ou se tromper.
  3. 3Retirer ou masquer : noircir chaque valeur confirmée, dans le texte, les tableaux et les pieds de page.
  4. 4Aplatir : transformer les pages masquées en images, sans couche de texte cachée.
  5. 5Vérifier : ouvrir le résultat et s'assurer que rien n'est plus sélectionnable ou copiable.

ONYRI Sanitize est construit pour ce problème de document, pas celui de la base de données. Il lit le texte d'un PDF, d'un fichier Word ou d'un scan dans le navigateur. Il place les masques sur la mise en page réelle et exporte des pages aplaties, sans texte en dessous. Sa limite : il lit du texte, pas des images, donc un logo ou un visage n'est pas analysé et reste à vérifier soi-même.

Rien de tout cela ne rend l'anonymisation des documents impossible. Cela en fait un processus, pas un simple clic. Traitez un document comme un éditeur attentif traite un manuscrit. Lisez chaque page, repérez chaque occurrence, et vérifiez la copie avant qu'elle ne quitte vos mains.

Questions fréquentes

Puis-je retirer tous les noms d'un document comme je supprimerais une colonne dans un tableur ?
Non. Un tableur garde chaque nom dans sa propre colonne, donc supprimer cette colonne efface toutes les valeurs d'un coup. Un document n'a pas de colonnes. Un nom peut se trouver dans une phrase, un tableau, un pied de page ou une signature, et chaque occurrence doit être trouvée séparément.
Recouvrir un texte d'un rectangle noir dans un PDF le retire-t-il vraiment ?
Seulement si la page est ensuite transformée en image fixe. Beaucoup d'outils dessinent une forme par-dessus le texte, et les mots d'origine restent en dessous, prêts à être copiés. Les Archives nationales du Royaume-Uni signalent que le caviardage électronique peut laisser des traces de ce qui a été retiré.
Pourquoi une base de données est-elle plus facile à anonymiser qu'un fichier Word ou un scan ?
Une base de données regroupe des valeurs similaires, si bien qu'une seule règle, comme supprimer une colonne, protège tous les enregistrements d'un coup. Un document mélange texte libre, tableaux, images et métadonnées dans un seul fichier, et une règle écrite pour un endroit ne couvrira pas les autres.
La généralisation et la suppression fonctionnent-elles de la même façon sur un paragraphe que sur une colonne de tableur ?
L'idée est la même, mais la cible change. Sur une colonne, la généralisation arrondit toutes les valeurs en une fois, par exemple des âges exacts en tranches d'âge. Sur un paragraphe, le même arrondi se fait phrase par phrase.
Les pages scannées et les documents photographiés s'anonymisent-ils de la même façon que du texte tapé ?
Non. Un PDF déjà tapé a une couche de texte qu'un programme peut chercher directement. Un scan n'est qu'une image, donc le texte doit d'abord être lu par reconnaissance optique de caractères, sur l'appareil. Le résultat dépend de la qualité du scan, et l'écriture manuscrite n'est souvent pas lue.

Sources et références

Sur ce siteAnonymiser un PDF dans votre navigateur

Masquez un document sans l'envoyer nulle part

ONYRI Sanitize repère les noms, identifiants, coordonnées bancaires et secrets dans un PDF, un Word ou un scan, et les masque dans votre navigateur. Vous relisez l'aperçu, puis vous téléchargez une copie aplatie.

À lire ensuite