Anonymiser un document en langue étrangère : noms, dates et numéros qui changent
Une méthode rodée sur des documents français rate des noms, dates et numéros d’autres langues. Voici les formes qui changent et comment les chercher.
Dans une autre langue, la méthode reste la même : lister ce qui identifie les personnes, le chercher, le masquer, puis vérifier le résultat. Les formes changent : un nom peut changer de terminaison, d’ordre ou d’écriture, une date peut suivre un autre calendrier ou d’autres chiffres. Une recherche sur une seule forme exacte rate les autres : cherchez chaque forme.
Pourquoi une recherche rate-t-elle des noms dans une autre langue ?
Un nom est une donnée personnelle dans toutes les langues et toutes les écritures. L’article 4, point 1, du RGPD, le règlement européen, cite un nom et un numéro d’identification comme exemples d’identifiants. Les modèles ci-dessous suivent le W3C, qui avertit que les noms réels sont souvent plus complexes.

| Langue | Fonctionnement des noms | Exemple inventé | Ce qu’une recherche peut rater |
|---|---|---|---|
| Chinois, japonais, coréen, hongrois | Nom de famille en premier | 温晓兰 (Wen Xiaolan) | Copies en lettres latines dans l’autre ordre |
| Espagnol, portugais | Deux noms de famille ou plus | Lucía Marín Duarte | Marín seul |
| Russe | Prénom, patronyme (du prénom du père), nom de famille ; terminaisons selon le genre | Ирина Алексеевна Соколова | Nom de famille écrit en premier |
| Polonais, tchèque | Terminaisons selon le genre et selon la phrase | Kowalski, Kowalskiego, Kowalska ; Novák, Nováka, Nováková | Toute forme non saisie |
| Arabe | Une chaîne : prénom, père, grand-père, famille | Yusuf ibn Karim al-Nasser | Chaîne raccourcie, autre graphie |
Comment les terminaisons et le genre modifient-ils un nom de famille ?
Imaginez Claire Exemple, qui masque des noms dans un contrat polonais. Elle cherche « Kowalski » et trouve la ligne de signature. Elle rate les clauses qui disent « Kowalskiego » ou « Kowalskiemu ». En polonais et en tchèque, les noms changent selon leur rôle dans la phrase : c’est la déclinaison. Selon une étude de Polonica, revue de l’Institut de la langue polonaise, les noms en -ski, -cki ou -dzki se déclinent comme des adjectifs.
Le genre ajoute un second changement. En russe, explique le W3C, les terminaisons du patronyme et du nom de famille indiquent s’il s’agit d’un homme ou d’une femme. En tchèque, le nom d’une femme prend normalement une forme féminine, comme Nováková pour Novák. Depuis le 1er janvier 2022, indique le ministère de l’Intérieur tchèque, une femme peut demander à l’état civil la forme masculine inchangée, sans motif particulier. Cherchez donc les deux formes.
Cherchez le radical, la partie qui ne change pas. « Kowalsk » trouve Kowalski, Kowalskiego et Kowalska. « Novák » trouve Nováka et Nováková. Lisez chaque résultat, car un radical court trouve aussi d’autres mots. Cherchez aussi la forme de base : l’auteur de l’étude note que les textes juridiques et les lettres officielles l’emploient le plus souvent. Une recherche par radical est un filet, pas une garantie.
Que faire quand une même personne s’écrit de deux façons ?
Un passeport ajoute une seconde graphie. L’OACI, l’Organisation de l’aviation civile internationale, fixe la norme des passeports dans son Doc 9303. Dans la zone lisible par machine (les lignes que lisent les scanners), les noms n’emploient que les lettres A à Z. Pour une même lettre, l’OACI recommande plusieurs choix. Jörg Müllerhoff peut donc s’y lire MUELLERHOFF et JOERG, ou MULLERHOFF et JORG. Pour le russe, l’OACI transforme Ж en ZH et Щ en SHCH.
La graphie dépend aussi de celui qui écrit. L’annexe de l’OACI compte 32 façons d’écrire en lettres latines le seul prénom Muhammad. Elle note aussi que l’anglais écrit Omar Khayyam là où l’allemand écrit Omar Chajjam. En japonais, ajoute le W3C, quatre noms de famille différents peuvent tous s’écrire Shōji en lettres latines : la forme latine cache lequel est visé.
Comment les dates, les numéros et les adresses changent-ils ?
L’Office européen des brevets (OEB) écrit que les années impériales apparaissent partout au Japon, surtout sur les documents officiels. Les brevets thaïlandais, ajoute-t-il, donnent leurs dates en années bouddhiques seulement. Voici le 8 octobre 2026 sous cinq formes courantes.
| Lieu | Calendrier | Le 8 octobre 2026 peut s’écrire | Piège |
|---|---|---|---|
| Japon | Années d’ère, Reiwa depuis le 1er mai 2019 | 令和8年10月8日 ou R8.10.8 | Reiwa 8, c’est 2026, pas 2008 |
| Thaïlande | Ère bouddhique, 543 ans d’avance | 8 ตุลาคม 2569 | 2569 vaut 2026 |
| Taïwan | Années Minguo, 1912 est l’année 1 | 民國115年10月8日 | Minguo 98, c’est 2009, pas 1998 |
| Iran | Calendrier persan | ۱۶ مهر ۱۴۰۵ ou ۱۴۰۵/۰۷/۱۶ | 1405 commence en mars 2026 |
| Chiffres arabes orientaux et persans | Même date, autres caractères | ٢٠٢٦/١٠/٠٨ ou ۲۰۲۶/۱۰/۰۸ | Une recherche de 2026 ne trouve aucun des deux |
Faites le calcul avant de chercher : l’OEB donne Reiwa plus 2018, ou année bouddhique moins 543, pour l’année occidentale. Les données régionales d’Unicode listent les chiffres arabes orientaux et persans comme des caractères distincts, d’où l’échec d’une recherche simple de 2026.
Les documents arabes peuvent aussi suivre le calendrier de l’hégire, qui est lunaire. L’OEB précise qu’une année de l’hégire ne se convertit pas directement.
Les adresses peuvent se lire à l’envers. Selon l’Union postale universelle (UPU), une adresse japonaise va en général de la zone la plus grande à la plus petite, sans nom de rue. Une adresse chinoise écrite en chinois commence par la province, mais la version en lettres latines suit le sens inverse. Masquez le bloc d’adresse en entier, code postal compris.
Comment vérifier un document numérisé dans une autre langue ?
Un scan brut ne contient aucun texte tant que l’OCR (reconnaissance optique de caractères) ne l’a pas lu. L’OCR a besoin de la bonne langue. La documentation de Tesseract explique que l’on choisit une langue ou plusieurs, reliées par un signe plus. Sans choix, l’anglais est supposé.
Le texte de droite à gauche ajoute un piège. Le W3C explique que le texte est stocké dans l’ordre logique mais affiché dans l’ordre visuel. Dans un texte arabe, les nombres se lisent quand même de gauche à droite. Testez donc d’abord : cherchez un nom ou un nombre que vous voyez. Si rien n’apparaît, ne vous fiez pas à la recherche sur cette page. Une page qui mêle plusieurs écritures demande un test par écriture.
ONYRI Sanitize fonctionne dans votre navigateur. Il trouve numéros d’identité et de téléphone et dates de 47 pays, ainsi que codes postaux et adresses de rue dans presque tous (pas de détecteur d’adresses de rue au Royaume-Uni ni en Belgique). Il lit les chiffres arabes orientaux, persans et autres. Son OCR sur l’appareil lit l’anglais, le français et l’allemand, plus la langue du navigateur si elle fait partie d’une trentaine d’autres. Limite : en polonais, tchèque, russe, japonais ou coréen, un nom isolé n’est masqué qu’après un titre ou un libellé, ou dans une signature.
Quelles étapes suivre pour un document que vous ne lisez pas ?
- Trouvez un lecteur qui connaît la langue.
- Listez chaque personne et chaque société, avec toutes les formes : écriture d’origine, lettres latines, graphie du passeport, formes courtes, terminaisons de genre.
- Cherchez chaque forme, puis le radical. Lisez chaque résultat dans sa phrase.
- Cherchez les nombres dans chaque système de chiffres. Lisez les dates dans le calendrier du document.
- Masquez chaque adresse en un seul bloc. Pour un scan, cherchez un mot que vous voyez, dans chaque écriture.
- Masquez à la main ce qu’aucune recherche ne trouve : signatures, tampons, écriture manuscrite, noms isolés.
- Contrôlez le fichier exporté, pas l’écran. Regardez chaque page pour chaque forme, et cherchez aussi si le texte reste sélectionnable.
Questions fréquentes
Puis-je anonymiser un document dans une langue que je ne lis pas ?
Pas en toute sécurité, seul, car une recherche ne trouve que ce que vous saisissez. Utilisez un outil pour une première passe, puis demandez à un lecteur natif de contrôler chaque page. Pour un dossier sensible, consultez votre délégué à la protection des données (DPO).
Faut-il masquer un nom écrit dans deux écritures ?
Oui, les deux. Chaque graphie peut identifier la personne. L’article 4, point 1, du RGPD cite le nom comme identifiant, sans limite d’écriture ni de langue. Vérifiez aussi la graphie du passeport.
Une date du calendrier thaïlandais ou japonais reste-t-elle une date de naissance ?
Oui. Seul le numéro de l’année change : 2569 du calendrier bouddhique thaïlandais et Reiwa 8 valent tous deux 2026. Masquez-la dans tous les calendriers.
La loi change-t-elle quand le document est dans une autre langue ?
La définition des données personnelles du RGPD ne dépend pas de la langue. Les règles applicables à votre cas dépendent de votre pays et de votre secteur : interrogez votre DPO ou un avocat. Ceci est une information générale, non un avis juridique.
Sources et références
- Personal names around the world (en anglais)W3C
- Unicode Bidirectional Algorithm basics (en anglais)W3C
- Doc 9303, Documents de voyage lisibles à la machine, partie 3 (huitième édition, 2021, en anglais)OACI
- Calendar systems and their role in patent documentation, Part I : années impériales japonaises (en anglais)Office européen des brevets
- Calendar systems and their role in patent documentation, Part II : années républicaines de Taïwan (en anglais)Office européen des brevets
- Calendar systems and their role in patent documentation, Part III : calendrier bouddhique et années de l’hégire (en anglais)Office européen des brevets
- Données CLDR sur les systèmes de numération (en anglais)Consortium Unicode
- Données complémentaires CLDR, calendriers préférés par territoire (en anglais)Consortium Unicode
- Systèmes d’adressage postal : JaponUnion postale universelle
- Systèmes d’adressage postal : ChineUnion postale universelle
- Command line usage (en anglais)Documentation de Tesseract OCR
- Změna! Od ledna mohou ženy používat příjmení v nepřechýleném tvaru bez jakýchkoli dalších podmínek (en tchèque)Ministère de l’Intérieur tchèque
- Osobní jména mužská zakončená ve výslovnosti na souhlásku (en tchèque)Institut de la langue tchèque (ÚJČ AV ČR), Internetová jazyková příručka
- Odmiana polskich nazwisk. Część I (en polonais)Polonica, Institut de la langue polonaise (PAN)
- Règlement général sur la protection des données, chapitre I, article 4 : définitionsCNIL