Aller au contenu
Produit8 min de lecture

Quelle est la fiabilité d'ONYRI Sanitize ? Notre test de détection sur 48 documents fictifs

Nous avons testé notre détection sur 48 documents fictifs : 85,5 % des éléments sensibles couverts, 93,8 % des masques utiles. Méthode et corpus publiés.

Par Alexis de ONYRI

Sur 48 documents fictifs, ONYRI Sanitize a entièrement couvert 85,5 % des 869 éléments qu'une personne attentive aurait masqués. Et 93,8 % de ses 872 masques sont tombés sur une donnée à masquer. Ces chiffres portent sur le texte de documents écrits par nos soins, avec les seules règles de détection.

Le premier chiffre est le rappel : la part de ce qui devait être caché et qui l'a été. Le second est la précision : la part des masques nécessaires. Le NIST (SP 800-188, septembre 2023) indique que les administrations peuvent adopter une norme à niveaux de performance mesurables pour désidentifier leurs jeux de données. « Fiable » demande ici aussi un chiffre et une méthode.

Que contient le corpus de test ?

Le corpus compte 48 documents fictifs, environ 59 000 caractères, de 26 à 62 lignes chacun. Ils sont écrits en six langues : anglais, français, allemand, espagnol, italien et néerlandais. Ils viennent de 11 pays. Le Luxembourg a un document en français et un en allemand.

On y trouve des bulletins de paie, contrats, factures, relevés bancaires, courriers médicaux, déclarations de sinistre, baux, CV, fils d'e-⁠mails, procès-verbaux et décisions de justice. Quelques-uns imitent un scan lu par OCR (espaces parasites, lettre O pour un zéro).

Nous les avons écrits pour l'occasion, avec l'aide d'un assistant d'écriture par IA. Les 36 premiers l'ont été sans regarder le code des détecteurs. Les 12 documents espagnols, italiens, néerlandais et luxembourgeois sont arrivés avec les détecteurs de ces pays. Puis nous avons annoté les données sensibles selon des règles écrites. Personnes et entreprises sont inventées. Les adresses e-⁠mail et les liens utilisent des domaines réservés aux exemples. Les numéros suivent le format réel de chaque pays. Quand ce format prévoit une clé de contrôle, elle est valide : elle repère les fautes de frappe.

Le corpus contient aussi des pièges : des éléments qui semblent sensibles mais doivent rester visibles. Un masque posé sur un piège joue contre nous. Au total, 869 éléments sont annotés, en 17 catégories. Parmi les pièges :

  • Rues portant un nom de personne
  • Villes qui sont aussi des prénoms
  • Personnages publics
  • Mots courants en majuscule
  • Codes produit
  • Numéros d'article de loi
  • Pourcentages
  • Années seules

Comment mesure-t-on le résultat ?

  • Entièrement masqué (rappel) : la part des éléments annotés qui ont été cachés. Un élément ne compte que si chaque lettre et chaque chiffre est sous un masque. Un IBAN à moitié masqué est manqué.
  • Bonne étiquette : la part des éléments touchés par un masque de la bonne catégorie, comme un masque de téléphone sur un numéro de téléphone. Pour le premier chiffre, l'étiquette ne compte pas.
  • Précision : la part des masques qui touchent au moins un élément annoté. Un masque qui n'en touche aucun est un faux positif et joue contre nous.

Le rappel et la précision suivent les définitions du cours de Google sur le machine learning. Nous ne mesurons que le texte : les règles de détection.

Que détecte l'outil, par type de donnée ?

Six catégories atteignent 100 %, mais quatre reposent sur 4 à 7 éléments seulement.

CatégorieÉlémentsEntièrement masqués (%)Bonne étiquette (%)
Noms de personnes15085,394,7
Adresses e-⁠mail56100100
Téléphones5396,296,2
Adresses postales7680,397,4
Dates17188,387,1
Numéros d'identité2387,091,3
Coordonnées bancaires3889,576,3
Numéros de carte6100100
Montants avec devise137100100
Identifiants d'entreprise2090,075,0
Numéros de référence4156,153,7
Noms d'organisations6464,164,1
Codes médicaux (CIM-10)7100100
Termes médicaux en clair1500
Secrets (mots de passe)450,050,0
URL privées4100100
Adresses IP4100100
Détection par catégorie (6 octobre 2026, tous détecteurs, pays connu)

Deux points faibles ressortent : les numéros de référence (56,1 %) et les noms d'organisations (64,1 %). La bonne étiquette reste sous la part entièrement masquée pour les coordonnées bancaires (76,3 % contre 89,5 %) et les identifiants d'entreprise (75,0 % contre 90,0 %). La valeur était cachée, mais sous une autre étiquette. En mode Token, une mauvaise étiquette se voit.

Que donnent les résultats par pays et par langue ?

PaysDocumentsÉlémentsEntièrement masqués (%)Précision (%)
France815388,298,6
Belgique44582,293,5
États-Unis713577,881,6
Royaume-Uni59171,495,2
Allemagne612688,994,5
Autriche34877,197,6
Suisse35096,098,0
Espagne47483,896,1
Italie35896,693,8
Pays-Bas35394,396,6
Luxembourg23610095,5
Détection par pays

Par langue, le français (88,0 %) et l'allemand (88,8 %) mènent en rappel. L'espagnol, l'italien et le néerlandais vont de 83,8 % à 96,6 %, sur 3 ou 4 documents chacun. L'anglais est le plus faible : 75,2 % de rappel et 86,8 % de précision.

Aux États-Unis, la précision est la plus basse (81,6 %), en partie à cause de prénoms qui sont aussi des mots ou des lieux. Au Royaume-Uni, le rappel est le plus bas (71,4 %), en partie faute de détecteur pour les adresses de rue et les sort codes (codes d'agence bancaire). Sept pays n'ont que 2 à 4 documents : un seul élément déplace leurs chiffres d'un à trois points.

Que lui échappe-t-il, et pourquoi ?

126 éléments lui ont échappé : organisations 23, personnes 22, dates 20, références 18, termes médicaux 15, adresses 15 et 13 autres. Les causes principales :

  • Termes médicaux en clair (15 éléments, 0 %). Aucun détecteur pour un diagnostic ou un traitement écrit en toutes lettres.
  • Noms d'organisations sans forme juridique (64,1 %). Les règles repèrent un nom suivi de GmbH, Ltd ou SA. Une boulangerie ou une clinique au nom ordinaire passe à travers.
  • Numéros de référence dont le libellé est hors liste (56,1 %). Un numéro est trouvé si un mot-clé de la liste, comme « Notre réf. » ou « n° de police », le précède. « Ticket » n'y figure pas.
  • Noms rares. Un prénom ou un nom de famille absent de nos listes de noms peut laisser un nom à moitié visible.
  • Adresses britanniques. Pas de détecteur pour les adresses de rue ni les sort codes.
  • Dates incomplètes. Des années seules dans un CV (annotées dans ce seul CV), un jour et un mois sans année dans un relevé.
  • Bruit de scan. Dans les scans simulés, un O pour un zéro ou des espaces parasites ont cassé des dates, noms et adresses.
  • Un mot de passe dans une phrase, sans « mot de passe : » juste avant lui.

Chaque trou se comble à la main. Utilisez « Sélectionner du texte », « Tracer une zone » ou « Rechercher dans le document », puis masquez tous les résultats. Vous pouvez aussi saisir un terme oublié sous « Masquer aussi ».

Quels sont les faux positifs ?

Sur ses 872 masques, 54 ne touchent rien de ce que nous avions annoté, dont 38 sur des noms de personnes. Les causes principales :

  • Prénoms qui sont aussi des mots ou des lieux (Bill, Dallas, Charlotte, Florence).
  • Noms et dates annotés ailleurs dans le document, mais pas ici, comme « Ms. Moreno's » (14 des 54). Ces masques sont justes : notre annotation les a oubliés.
  • Personnages publics (une rue portant le nom de Victor Hugo).
  • Boîtes e-⁠mail génériques comme payroll@, non annotées dans trois documents mais annotées dans d'autres.
  • Mots en majuscules qui ressemblent à un code bancaire.
  • Mots abîmés par le bruit de scan, pris pour des secrets.

Un outil de masquage doit-il accepter un peu de sur-masquage ? Nous le pensons. Un faux positif cache un mot sans danger. Un oubli laisse fuir une valeur. Le cours de Google conseille le rappel quand les faux négatifs coûtent plus cher que les faux positifs. Trop de masques inutiles fatiguent la personne qui relit. Décochez toute valeur inutile dans la liste « Données détectées » : un test surveille la précision.

Quel score pour le profil Par défaut ?

Avec la formule Free, le profil Par défaut s'applique. Il laisse de côté les détecteurs de secrets techniques, réservés à Pro, et devine le pays d'après le texte. Il obtient 85,2 % de rappel et 94,2 % de précision, avec 50 faux positifs sur 865 masques. Les numéros de référence tombent à 53,7 %, les secrets à 0 %.

Que ne disent pas ces chiffres ?

La première version du corpus (27 septembre 2026, 36 documents en anglais, français et allemand) trouvait 73,6 % des éléments, avec 91,7 % de précision. Ce jour-là, nous avons ajouté 12 documents d'Espagne, d'Italie, des Pays-Bas et du Luxembourg.

Comment utilisons-nous ce test ?

Ce test fait partie des tests lancés avant chaque version. Il échoue si une catégorie perd du rappel par rapport à une référence enregistrée, ou si la précision baisse de plus d'un point.

Pouvez-vous vérifier nos chiffres ?

Oui. Nous publions les 48 documents avec leurs annotations dans le texte, les règles d'annotation et de calcul, et les résultats. La licence est Creative Commons Attribution 4.0 International (CC BY 4.0). Servez-vous-en pour tester n'importe quel outil, le nôtre compris.

Questions fréquentes

Un rappel de 85,5 % dispense-t-il de relire ?

Non. Environ un élément sur sept n'a pas été entièrement masqué sur ce corpus. Lisez toujours l'aperçu, utilisez la liste « Données détectées » et masquez le reste à la main.

Mon document est-il envoyé quelque part ?

Non. La détection et le masquage s'exécutent dans votre navigateur, et le fichier n'est jamais envoyé. Le serveur reçoit seulement des compteurs : type de document, nombre de pages et nombre de masques.

Le modèle de reconnaissance de noms est-il dans ces chiffres ?

Non. Le test ne mesure que les règles de détection. Sur un ordinateur avec souris ou pavé tactile, un modèle de reconnaissance de noms cherche en général aussi les personnes et les entreprises. Il tourne sur votre appareil, complète les règles et n'est pas exhaustif.

Un document masqué à ce niveau est-il anonyme ?

Non. Masquer ce que l'outil détecte réduit l'exposition. La CNIL définit l'anonymisation comme le fait de rendre impossible, en pratique, toute identification de la personne, et rappelle que des données pseudonymisées restent personnelles. Le mode Token est une pseudonymisation.

Sources et références

Masquez un document sans l'envoyer nulle part

ONYRI Sanitize repère les noms, identifiants, coordonnées bancaires et secrets dans un PDF, un Word ou un scan, et les masque dans votre navigateur. Vous relisez l'aperçu, puis vous téléchargez une copie aplatie.