Aller au contenu
Guides5 min de lecture

Comment caviarder un document scanné ou la photo d'une page

Un scan est une image : le caviardage passe par l'OCR et un contrôle manuel. Bien numériser, retirer le texte caché, vérifier le fichier final.

Par Alexis de ONYRIMis à jour le 23 septembre 2026

Un document scanné est une photo de page. Pour le caviarder, couvrez chaque zone sensible d'un bloc opaque, puis exportez la page en nouvelle image aplatie : rien ne subsiste dessous. Si le fichier est un PDF interrogeable, sa couche de texte invisible doit aussi disparaître.

Cela vaut pour un scan de bureau comme pour une photo au smartphone. Exemple : Claire Exemple, locataire fictive, doit envoyer un relevé bancaire scanné à un bailleur sans montrer son numéro de compte.

Quelle différence entre un PDF scanné et un PDF classique ?

Un PDF classique contient de vrais caractères, à sélectionner, copier ou rechercher. Un PDF scanné contient une image de chaque page. L'ordinateur voit des points, pas des lettres : chercher Claire ne donne rien. Il faut d'abord une reconnaissance optique de caractères (OCR), qui devine les lettres d'après leur forme. Trois tests rapides vous renseignent.

  • Sélectionnez un mot. Si toute la page se sélectionne d'un bloc, c'est une image.
  • Cherchez un mot visible. Aucun résultat : il n'y a pas de couche de texte.
  • Si des mots se sélectionnent sur une page clairement scannée, c'est un PDF interrogeable : lisez la suite.

Pourquoi un PDF scanné peut-il encore contenir du texte caché ?

Beaucoup de scanners et de logiciels PDF lancent l'OCR à votre place. Ils gardent l'image et ajoutent les mots reconnus en texte invisible, que la recherche et la copie utilisent. Selon la documentation du logiciel libre OCRmyPDF, c'est ainsi que la plupart des outils d'OCR rendent une page scannée interrogeable.

Imaginons que Claire trace un rectangle noir sur son numéro de compte, sur l'image. La page semble sûre, mais le texte invisible garde le numéro : tout sélectionner, copier, coller, et il réapparaît. L'ICO, l'autorité britannique de protection des données, juge inefficace de couvrir un texte de rectangles noirs en le laissant dessous.

Qu'est-ce que l'OCR ne voit pas sur une page scannée ?

L'OCR est une estimation. Sur un mauvais scan, il lit mal, et une valeur mal lue échappe à la détection. Une seule lettre fausse dans l'IBAN de Claire, et le détecteur peut manquer l'IBAN.

ProblèmeCe qui se passeQue faire
Résolution faibleSelon sa documentation, Tesseract fonctionne le mieux à 300 dpi ou plus.Refaites le scan à 300 dpi ou plus.
Page de traversUne page inclinée dégrade fortement la détection des lignes, ajoute-t-elle.Posez la page droite, ou redressez-la.
Bords sombresIls peuvent être lus comme des caractères en trop.Fermez le capot, ou rognez.
Écriture manuscriteSelon sa documentation, OCRmyPDF ne sait pas la reconnaître.Masquez à la main.
Tampons, signatures, logosSelon Adobe, l'OCR peine quand texte et graphismes se mêlent.Masquez à la main.
Problèmes d'OCR fréquents sur les scans

Comment numériser une page avant de la caviarder ?

  1. 1Numérisez à 300 dpi, davantage pour les très petits caractères.
  2. 2Posez la page à plat et bien droite.
  3. 3Choisissez les niveaux de gris ou la couleur pour une impression pâle. Le noir et blanc pur peut effacer un texte clair.
  4. 4Avec un smartphone, tenez-le bien au-dessus de la page ; Adobe conseille un bon éclairage et un document droit.
  5. 5Regardez le scan en taille réelle : si vous peinez à lire une ligne, l'OCR aussi.

Comment caviarder l'écriture manuscrite, les signatures et les tampons ?

À la main. Aucun détecteur ne trouve une note dans la marge, une signature ou un nom dans un tampon rond. Posez sur chacun un bloc opaque un peu plus large que le texte : le jambage d'une lettre peut trahir un nom.

Pensez aussi aux images : une photo d'identité, un code-barres ou un QR code identifient une personne. Prudence avec le feutre sur papier : selon l'ICO, le texte peut se lire en tenant la feuille à la lumière. Communiquez plutôt une photocopie ou un scan, jamais l'original marqué.

Comment vérifier que le caviardage a fonctionné ?

Ne vous fiez pas à vos seuls yeux. Testez le fichier final, pas la copie de travail.

  1. 1Sélectionnez tout, copiez, puis collez dans un éditeur de texte brut. L'ICO signale ce risque. Si une valeur masquée s'affiche, la couche de texte est toujours là.
  2. 2Cherchez dans le fichier les valeurs masquées, comme le nom de famille.
  3. 3Essayez de déplacer un rectangle noir. S'il bouge, ce n'est qu'une annotation.
  4. 4Zoomez et poussez le contraste, comme le recommande l'autorité de protection des données du canton de Fribourg (Suisse) pour un feutre scanné.
  5. 5Lisez les métadonnées : auteur, titre et, pour une photo, date et lieu.
  6. 6Faites relire le fichier. L'ICO suggère une relecture par un pair ou un responsable.

Gardez le scan original en lieu sûr, clairement étiqueté, comme le conseille l'ICO : un bon caviardage ne s'annule pas. Une erreur compte aussi. Divulguer par erreur des données personnelles peut constituer une violation de données. L'article 33 du RGPD impose alors de la notifier à l'autorité de contrôle, en France la CNIL, si possible sous 72 heures, sauf si elle n'est pas susceptible d'engendrer un risque.

Quels outils caviardent correctement un scan ?

Plusieurs voies fonctionnent, pourvu que le résultat soit aplati. Pour un PDF, l'ICO cite l'outil de caviardage d'Adobe Acrobat ; à défaut, des rectangles noirs sur la page scannée, puis un aller-retour par le BMP. Pour une image, l'ICO recommande un format sans calques ni historique, comme le PNG ou le JPEG.

En septembre 2026, la documentation d'OCRmyPDF explique comment retirer une couche de texte invisible ou reconstruire chaque page en image. Sans logiciel, cela marche aussi : imprimer, masquer, photocopier, scanner, vérifier.

Autre voie : les outils qui tournent dans le navigateur. ONYRI Sanitize, par exemple, lit les scans par OCR sur votre appareil, en français, en anglais ou en allemand : le fichier n'est pas envoyé. Vous vérifiez chaque valeur trouvée, et l'export est toujours un PDF ou un PNG aplati, sans couche de texte. Il ne masque que le texte lu par l'OCR : l'écriture manuscrite et les signatures ne sont pas lues, et un tampon peut passer inaperçu. Aucun outil ne remplace le contrôle final.

Un scan caviardé est-il anonyme ?

Pas automatiquement. Un métier rare, une date ou une petite commune peuvent encore désigner une personne. Remplacer les noms par des étiquettes comme NOM1 relève de la pseudonymisation, définie à l'article 4, point 5, du RGPD. Selon la CNIL, des données pseudonymisées conservent un caractère personnel, alors que l'anonymisation rend toute identification impossible en pratique, de manière irréversible.

Voyez donc le caviardage comme un moyen de partager moins, selon le principe de minimisation des données (article 5, paragraphe 1, point c) du RGPD). Il réduit le risque, sans remplacer vos autres obligations.

Questions fréquentes

Puis-je simplement dessiner un rectangle noir sur un PDF scanné ?
Seulement si le fichier est ensuite aplati. Une annotation se déplace, et dans un PDF interrogeable le texte OCR reste dessous. Masquez, exportez un nouveau fichier aplati, puis faites le test du copier-coller.
Quelle résolution choisir pour numériser un document à caviarder ?
Partez sur 300 dpi : selon sa documentation, Tesseract fonctionne le mieux à partir de cette résolution. Une page droite et des bords blancs comptent autant.
La photo d'un document est-elle plus sûre qu'un PDF ?
Elle n'a pas de couche de texte : un risque de moins. Mais elle peut porter des métadonnées, comme la date et le lieu de la prise de vue, et chacun peut lancer un OCR dessus plus tard. Masquez, exportez une nouvelle image aplatie et contrôlez les métadonnées.

Sources et références

Sur ce siteCaviarder un document scanné ou une image

Masquez un document sans l'envoyer nulle part

ONYRI Sanitize repère les noms, identifiants, coordonnées bancaires et secrets dans un PDF, un Word ou un scan, et les masque dans votre navigateur. Vous relisez l'aperçu, puis vous téléchargez une copie aplatie.

À lire ensuite