Aller au contenu
Produit6 min de lecture

Documents scannés et OCR dans ONYRI Sanitize : comment ça marche, et les limites

ONYRI Sanitize lit les PDF scannés et les photos avec une OCR embarquée, en français, anglais et allemand, puis bloque toute page illisible.

Par Alexis de ONYRI
Essayez sur votre propre document

Un PDF scanné ou une photo n'est qu'une image, sans texte caché dessous à sélectionner. ONYRI Sanitize lit cette image grâce à une OCR embarquée, la reconnaissance optique de caractères, puis masque ce qu'elle trouve. Toute la lecture se fait dans votre navigateur. Si une page reste trop floue pour être fiable, ONYRI bloque le téléchargement plutôt que de vous remettre un fichier qui affiche encore le nom.

Comment fonctionne l'OCR embarquée ?

L'OCR observe les formes d'une page et les transforme en vraies lettres et en chiffres. ONYRI exécute cette étape dans votre navigateur, avec Tesseract, un moteur open source que beaucoup d'outils soucieux de la vie privée utilisent aussi. Rien de ce que vous scannez n'est envoyé où que ce soit. L'image, le texte reconnu et le résultat masqué restent sur votre appareil, et la correspondance disparaît dès que vous rechargez la page.

  • Vous ajoutez un PDF, un fichier Word, ou une photo.
  • ONYRI vérifie chaque page. Une page avec une vraie couche de texte est lue directement, sans OCR.
  • Une page sans couche de texte, comme un scan ou une photo, passe par l'OCR.
  • L'OCR lit le français, l'anglais et l'allemand en même temps, automatiquement.
  • Le texte reconnu alimente exactement les mêmes détecteurs qu'un document tapé.

Quelles pages passent réellement par l'OCR ?

Toutes les pages n'ont pas besoin d'OCR. Un PDF texte, celui où vous pouvez déjà sélectionner et copier une phrase, possède une couche de texte qu'ONYRI lit directement. C'est plus rapide et plus fiable que l'OCR. L'OCR n'intervient que pour une page PDF sans couche de texte utilisable. Elle s'applique aussi à toute image que vous ajoutez, comme la photo d'un bail ou d'une carte d'identité scannée.

Que ne lit pas cette OCR ?

L'OCR a de vraies limites, et ONYRI ne les cache pas. L'écriture manuscrite n'est pas lue du tout, donc une note écrite à la main ou une signature reste exactement telle qu'elle a été scannée. La qualité du scan compte tout autant. Une photo de travers, une pièce sombre ou un bail flou ralentissent l'OCR et lui font manquer davantage de données. Pour l'instant, le moteur prend en charge le français, l'anglais et l'allemand, et rien d'autre.

SourceCe qu'elle recommande pour une page de texte
Documentation du projet TesseractAu moins 300 points par pouce, avec une page la plus droite possible
Bibliothèque nationale de France (BnF)300 à 400 points par pouce pour un imprimé
Une photo prise avec un téléphoneSouvent déjà bien au-dessus de 300 dpi, mais le flou et l'inclinaison gênent plus l'OCR que la résolution

Comment scanner pour que l'OCR détecte davantage ?

  1. 1Posez la page à plat. Une page courbée dans un carnet relié brouille les lignes dont l'OCR a besoin.
  2. 2Gardez la page droite. Tesseract précise qu'une page inclinée nuit fortement à la qualité de la reconnaissance.
  3. 3Utilisez une bonne lumière et un vrai contraste. Une encre foncée sur du papier blanc se lit bien mieux qu'une photocopie de photocopie fanée.
  4. 4Numérisez à 300 points par pouce ou plus pour du texte. Un réglage plus bas économise de l'espace mais fait perdre le détail dont l'OCR a besoin.
  5. 5Cadrez toute la page dans l'image. Un bord coupé peut effacer justement la donnée à masquer.

Que vérifier avant de télécharger ?

L'OCR n'a pas le dernier mot. ONYRI affiche un aperçu page par page. Une liste montre chaque valeur détectée, regroupée par famille, comme les noms, les e-mails ou les numéros d'identité. Chaque valeur a sa propre case à cocher. Claire Exemple peut donc laisser son propre nom visible sur une page de garde si elle le souhaite.

  1. 1Lisez chaque page de l'aperçu, pas seulement la première.
  2. 2Ouvrez la liste des données détectées et cherchez une fausse alerte ou une valeur manquée.
  3. 3Repérez l'avertissement signalant qu'une valeur n'a pas pu être placée. Vérifiez cet endroit à l'œil.
  4. 4Changez entre le marqueur noir et le mode jeton si le premier choix ne convient pas.
  5. 5Téléchargez une fois l'aperçu satisfaisant. L'export est aplati, impossible de le modifier ensuite.

L'OCR rapproche un scan d'un document normal, mais le masquage reste imparfait. La détection n'est pas exhaustive, un scan grossier peut encore cacher un nom au moteur, et relire l'aperçu reste votre travail. Traitez l'OCR comme une longueur d'avance, jamais comme la dernière vérification.

Questions fréquentes

ONYRI Sanitize envoie-t-il mon document scanné vers un serveur ?
Non. L'OCR, comme le reste du traitement, fonctionne dans votre navigateur. Le serveur ne reçoit que des compteurs d'usage, comme le nombre de documents ou de pages traités. Il ne reçoit jamais le fichier, son texte ou une valeur détectée.
L'OCR peut-elle lire l'écriture manuscrite ?
Non, elle ne lit que le texte imprimé ou tapé. Une note manuscrite, une signature ou un champ de formulaire rempli à la main reste exactement tel qu'il a été scanné. Vérifiez ces endroits vous-même avant de partager le fichier.
Pourquoi mon document a-t-il été bloqué au lieu d'être anonymisé ?
Une page bloque l'export quand elle n'a pas de couche de texte utilisable et que l'OCR ne parvient pas non plus à la déchiffrer. C'est une règle de sécurité. ONYRI préfère s'arrêter plutôt que de vous remettre un fichier qui semble masqué mais montre encore le texte d'origine en dessous.
Quelles langues l'OCR prend-elle en charge ?
Le français, l'anglais et l'allemand, en même temps. ONYRI vérifie les trois à chaque scan, donc il n'y a rien à choisir avant de commencer.
Un scan à plus haute résolution détecte-t-il toujours davantage ?
Surtout jusqu'à un certain point. Des organismes comme Tesseract ou la BnF situent le minimum utile autour de 300 points par pouce pour du texte. Au-delà, un scan droit, bien éclairé et net compte plus qu'une résolution supplémentaire.

Sources et références

Sur ce siteCaviarder un document scanné ou une image

Masquez un document sans l'envoyer nulle part

ONYRI Sanitize repère les noms, identifiants, coordonnées bancaires et secrets dans un PDF, un Word ou un scan, et les masque dans votre navigateur. Vous relisez l'aperçu, puis vous téléchargez une copie aplatie.

À lire ensuite