Comment ONYRI Sanitize anonymise un document dans votre navigateur
Du dépôt au téléchargement : ce qui tourne dans votre navigateur, les trois compteurs que reçoit notre serveur, comment le vérifier, et les limites.
ONYRI Sanitize lit, analyse et masque votre document dans l'onglet de votre navigateur. Le fichier n'est jamais envoyé. Au téléchargement, notre serveur reçoit trois compteurs : type de fichier, nombre de pages, nombre d'éléments masqués. Rien d'autre. Voici les étapes, un test de deux minutes pour le vérifier, et les limites.
Que se passe-t-il entre le dépôt et le téléchargement ?
Cinq étapes, toutes sur votre appareil. Prenons un contrat qui cite Claire Exemple, son e-mail et son IBAN.
- 1Ouvrir. Vous déposez un PDF, un fichier Word (.docx) ou une image. Le navigateur l'ouvre dans la mémoire de l'onglet, sans rien envoyer.
- 2Lire. La couche texte d'un PDF est lue directement, avec la position des mots. Un scan passe par une OCR locale. Un fichier Word est remis en pages A4.
- 3Détecter. Environ 40 détecteurs parcourent le texte, avec vos règles personnalisées et les termes saisis sous « Masquer aussi ».
- 4Relire. Chaque élément détecté apparaît encadré sur l'aperçu. Vous décochez ce qui doit rester visible et ajoutez ce qui manque.
- 5Exporter. Chaque page devient une image, masques incrustés. Les images forment un nouveau PDF, ou un PNG pour une image seule.
Tout cela se fait sans serveur. Les pages PDF sont lues avec PDF.js, une bibliothèque open source de Mozilla et de ses contributeurs. L'OCR utilise Tesseract.js, qui repose sur un portage WebAssembly du moteur Tesseract. Selon MDN, WebAssembly s'exécute dans le navigateur à des performances proches du natif.
Que garde votre appareil, et que reçoit notre serveur ?
| Élément | Où il se trouve | Envoyé au serveur ? |
|---|---|---|
| Le fichier et son nom | Votre navigateur | Non |
| Texte des pages, valeurs détectées, étiquettes Token, termes « Masquer aussi » | Votre navigateur | Non |
| Type de fichier, nombre de pages, nombre d'éléments masqués | Notre base, rattachés à votre espace | Oui, au téléchargement |
| E-mail du compte, formule, règles et profils enregistrés | Notre base | Oui, à l'enregistrement |
Les compteurs servent à appliquer votre formule. La formule Free permet 3 documents par jour : le serveur doit donc les compter. Il n'a pas besoin du contenu, donc il ne le reçoit pas. Attention : une règle personnalisée enregistrée est stockée avec votre compte. Pour un terme à ne stocker nulle part, utilisez « Masquer aussi ».
C'est la minimisation des données en pratique. L'article 25 du RGPD (UE) demande au responsable du traitement de protéger les données dès la conception, par exemple par la pseudonymisation. Le considérant 78 invite aussi les producteurs d'applications à en tenir compte. Un outil qui ne reçoit jamais votre fichier n'en détient aucune copie.
Comment le vérifier vous-même ?
Ne nous croyez pas sur parole. Le panneau Réseau de Chrome et le Moniteur réseau de Firefox listent les requêtes d'une page. Selon la documentation de Chrome, cette activité n'est enregistrée que si les outils de développement sont ouverts : ouvrez-les d'abord. Ce test vaut pour tout outil en ligne.
- 1Ouvrez la page Documents. Dans Chrome, appuyez sur Ctrl+Maj+J (Commande+Option+J sur Mac), puis ouvrez le panneau Réseau. Dans Firefox : Ctrl+Maj+E (Cmd+Opt+E sur Mac).
- 2Déposez un fichier de test. Des fichiers du moteur, comme l'OCR, peuvent venir de notre site. Ce sont des téléchargements.
- 3Dans Chrome, cliquez sur le filtre Fetch/XHR (ou Récupérer/XHR). Affichez la colonne Méthode, masquée par défaut, par un clic droit sur l'en-tête du tableau. Selon MDN, POST est la méthode qui envoie des données au serveur.
- 4Cliquez sur Télécharger. Une requête POST apparaît. Son onglet Charge utile (Payload) montre l'identifiant de votre espace de travail et les trois compteurs.
- 5Ouvrez les autres requêtes. Aucune ne transporte votre fichier, son nom ou son texte.
Quels formats et quelles langues d'OCR sont lus ?
| Entrée | Lecture | À quoi vous attendre |
|---|---|---|
| PDF avec une couche texte | Directe, avec la position des mots | Rapide, sans OCR. |
| PDF scanné, photo ou image | OCR locale en français, anglais, allemand | Plus lent. Précision selon la qualité du scan. Pas d'écriture manuscrite. |
| Fichier Word (.docx) | Remis en page au format A4 | Les sauts de page peuvent différer de Word. |
L'export est toujours aplati : un PDF ou un PNG fait d'images. Sans couche texte, rien ne reste caché sous un masque. En contrepartie, le texte ne peut plus être sélectionné ni recherché, et un fichier Word revient en PDF.
Le Marqueur noir trace des barres opaques, sans retour possible. Le mode Token, réservé à Pro, remplace chaque valeur par une étiquette cohérente : Claire Exemple devient [NAME1] dans tout le document. C'est une pseudonymisation (article 4, point 5, du RGPD), pas une anonymisation. Aucun mode ne restaure l'original. Gardez votre fichier.
Que détecte l'outil, et que manque-t-il ?
Environ 40 détecteurs couvrent 6 familles : données personnelles (noms, e-mails, téléphones, adresses postales, numéros d'identité, dates), financières (IBAN, BIC, cartes bancaires vérifiées par l'algorithme de Luhn, identifiants fiscaux, montants avec devise), identifiants de connexion (mots de passe écrits dans un texte, codes à usage unique), secrets techniques (clés d'API, jetons cloud, JWT), numéros d'entreprise (SIREN, SIRET, TVA) et URL internes. Secrets techniques et clés SSH privées : Pro uniquement. La détection connaît sept pays : FR, US, GB, BE, DE, AT, CH.
- Seul le texte est détecté. Une signature, une photo ou une note manuscrite reste visible.
- Aucun détecteur ne vise les termes médicaux, les salaires en tant que tels ou les noms de société. Ajoutez-les par une règle ou sous « Masquer aussi ».
- L'OCR se trompe sur un scan flou ou de travers. Un mot mal lu n'est pas reconnu.
- Même sur un texte propre, la détection n'est pas exhaustive. Un nom rare peut passer.
La relecture fait donc partie du traitement : ce n'est pas une option. Contrôlez l'aperçu élément par élément avant de télécharger. Puis relisez l'export avant de le partager.
Combien cela coûte-t-il ?
En septembre 2026, la formule Free couvre 3 documents par jour et 10 pages par document, avec le Marqueur noir, les détecteurs de base et 3 règles personnalisées. Pro coûte 9,90 € par mois ou 99 € par an, HT (11,90 $ ou 119 $) : documents et pages illimités, mode Token, détecteurs de secrets techniques, règles et profils illimités. Essai de 7 jours avec carte enregistrée, rien n'est débité aujourd'hui.
Team coûte 24,90 € par utilisateur et par mois ou 249 € par utilisateur et par an, HT (28,90 $ ou 289 $), dès 3 sièges. Chaque siège a Pro et un support prioritaire par e-mail. L'espace partagé, les invitations, les rôles et les journaux d'audit arrivent bientôt ; ils ne sont pas encore disponibles. Enterprise est sur devis, avec SSO et SCIM sur la feuille de route.
Questions fréquentes
- ONYRI Sanitize envoie-t-il mon document sur un serveur ?
- Non. Le fichier est ouvert, lu et masqué dans votre navigateur. Au téléchargement, le serveur reçoit l'identifiant de votre espace et les trois compteurs. Jamais le fichier, son nom, son texte ni une valeur détectée.
- L'OCR envoie-t-elle mon scan à un service cloud ?
- Non. Le moteur d'OCR, Tesseract.js, tourne dans le navigateur grâce à WebAssembly. Ses fichiers viennent de notre site ; le scan reste dans l'onglet. Il lit le texte imprimé en français, anglais et allemand, pas l'écriture manuscrite.
- Un document masqué avec ONYRI est-il anonyme au sens du RGPD ?
- Pas automatiquement. Masquer réduit l'exposition. Selon le considérant 26, tout dépend des moyens raisonnablement susceptibles d'être utilisés pour identifier une personne. Le mode Token est une pseudonymisation : les données restent personnelles.
- Puis-je retrouver l'original à partir d'un fichier masqué ?
- Non. L'export est aplati en images et aucune restauration n'existe, quel que soit le mode. Gardez votre fichier d'origine en lieu sûr et ne partagez que l'export.
Sources et références
- Règlement (UE) 2016/679 (RGPD), article 4, point 5, article 25, considérants 26 et 78 — EUR-Lex
- L'anonymisation de données personnelles — CNIL
- PDF.js, plateforme d'analyse et de rendu des PDF (en anglais) — Mozilla
- Tesseract.js, OCR en JavaScript (README du projet, en anglais) — Project Naptha sur GitHub
- WebAssembly — MDN Web Docs
- Méthode HTTP POST — MDN Web Docs
- Inspecter l'activité réseau — Chrome for Developers
- Documentation de référence sur les fonctionnalités réseau (onglet Charge utile, filtres, colonne Méthode) — Chrome for Developers
- Network Monitor (en anglais) — Firefox Source Docs
Masquez un document sans l'envoyer nulle part
ONYRI Sanitize repère les noms, identifiants, coordonnées bancaires et secrets dans un PDF, un Word ou un scan, et les masque dans votre navigateur. Vous relisez l'aperçu, puis vous téléchargez une copie aplatie.