Publier un PDF sur son site : ce que les moteurs de recherche peuvent y lire
Un PDF n'est pas qu'une image de page. Découvrez ce que Google peut y indexer, comment tester un fichier avant publication, et comment corriger une erreur.
Oui, et plus que ce qu'on imagine. Google lit le texte à l'intérieur d'un PDF, pas seulement son nom de fichier. Un paragraphe caché sous un bandeau noir, un ancien titre de document, une page scannée avec une couche de texte OCR invisible : tout peut ressortir dans les résultats de recherche. Ce guide explique ce que Google lit vraiment dans un PDF, comment tester un fichier avant de le publier, et que faire si un document a déjà fuité.
Que peuvent vraiment lire les moteurs de recherche dans un PDF ?
Google traite un PDF presque comme une page web. Sa documentation cite le format PDF d'Adobe parmi les types de fichiers qu'il peut indexer, et ses systèmes en extraient le texte lisible grâce à un analyseur dédié. Chaque mot du fichier, pas seulement ce qu'un lecteur remarque, peut devenir indexable. Le guide de Google sur les informations masquées précise que les images intégrées à un document sont elles aussi indexées, comme celles d'une page web ordinaire.
- Le texte intégral du fichier, extrait par un analyseur propre au PDF.
- Les liens contenus dans le fichier. La règle de Google pour bloquer le suivi des liens, nofollow, s'applique aussi aux PDF : par défaut, Google peut donc les suivre.
- Les images intégrées au PDF, indexées comme celles d'une page web classique.
- Le nom du fichier et le chemin de l'URL, qui peuvent apparaître dans les résultats même pour une page que Google avait pour consigne de ne pas explorer.
Comment un texte caché devient-il indexable ?
Un document peut contenir des informations qu'un lecteur ne remarque jamais. Imaginez un rapport de recrutement qui recouvre d'un rectangle noir un paragraphe citant Claire Exemple. La documentation de Google est directe sur cette méthode : le rectangle ne supprime pas son nom en dessous. Les mots restent dans le fichier, donc l'analyseur d'un moteur de recherche peut toujours les lire, même si une personne qui regarde la page ne voit qu'une barre pleine.
- Un rectangle noir posé au-dessus de la couche de texte, sans supprimer le texte lui-même.
- Une couche de texte OCR derrière une page scannée : l'image paraît vide, mais la couche invisible en dessous est ce qui est indexé.
- Des métadonnées dans les propriétés du fichier, comme un ancien titre, un nom d'auteur, ou le nom de la dernière personne à avoir modifié le fichier.
- Un historique des modifications, conservé par certains formats, qui peut exposer un texte qu'un relecteur croyait disparu.
Comment tester un PDF avant de le publier ?
Avant qu'un PDF ne soit publié, faites-lui subir les mêmes vérifications qu'un robot d'indexation. Chacune prend une minute, et ensemble elles détectent la plupart des erreurs.
| Étape | Comment faire | Ce que ça révèle |
|---|---|---|
| Sélectionner tout le texte | Ouvrez le PDF, Ctrl+A (Cmd+A sur Mac), puis collez dans un éditeur de texte. | Un texte caché sous un bandeau noir ou une image : tout ce qui se sélectionne est indexable. |
| Rechercher dans le fichier | Utilisez la barre de recherche de votre lecteur PDF pour un nom à retirer. | Une mention oubliée qu'une relecture visuelle manque, surtout dans un long rapport. |
| Vérifier les propriétés | Ouvrez Propriétés ou Informations sur le document : titre, auteur, organisation. | Un ancien titre ou le nom d'un collaborateur resté d'un brouillon interne. |
| Vérifier le nom du fichier et l'URL | Regardez le nom exact du fichier et son dossier avant la mise en ligne. | Le nom d'un client ou un numéro de dossier tapé dans le nom du fichier. |
ONYRI Sanitize prend une autre voie pour un document destiné à être publié. Il exporte chaque document anonymisé en PDF aplati, construit à partir d'images de page. Ainsi, aucune couche de texte ne reste sous un masque pour un robot d'indexation, et les propriétés d'origine, titre et auteur compris, ne sont pas conservées. Le compromis est réel : un PDF aplati n'est plus un texte indexable, ce qui ne convient pas à tous les documents publics.
Comment garder un PDF hors de la recherche Google ?
Deux outils se ressemblent mais font des choses très différentes, et les confondre est l'erreur la plus fréquente : le fichier robots.txt et la règle noindex.
| Méthode | Ce qu'elle fait réellement | Pourquoi ça ne suffit pas seul |
|---|---|---|
| robots.txt | Indique au robot de Google quelles URL ne pas explorer. | Selon Google, ce n'est pas un moyen de garder une page hors de Google. Une URL bloquée mais citée ailleurs peut encore apparaître, sans description. |
| X-Robots-Tag : noindex | Un en-tête HTTP envoyé par votre serveur avec le fichier, qui demande à Google de ne pas l'afficher dans les résultats. | Google doit explorer le fichier pour lire cet en-tête. Si robots.txt bloque l'exploration, la règle noindex n'est jamais trouvée : ne combinez jamais les deux. |
En pratique : laissez le PDF explorable, et ajoutez un en-tête X-Robots-Tag : noindex pour ce fichier, ou pour tout un dossier, sur votre serveur. Retirez ensuite toute règle robots.txt qui bloque le même chemin. Pour un fichier réservé à certaines personnes, placez-le plutôt derrière une authentification, et donnez à cette page de connexion sa propre balise noindex.
Que faire une fois qu'une erreur de PDF est déjà publique ?
Si un PDF au contenu erroné est déjà indexé, agissez vite, dans cet ordre.
- 1Retirez le fichier, ou remplacez-le par la version corrigée, immédiatement.
- 2Dans l'outil de suppression de Search Console, demandez à masquer l'URL exacte : pour un site vérifié, cela dure environ six mois et prend souvent moins d'un jour.
- 3Publiez le fichier corrigé sous une nouvelle URL, afin que la nouvelle version ne soit pas confondue avec l'ancienne déjà indexée.
- 4Si un autre site a copié le fichier, demandez son retrait, ou orientez-le vers l'outil de Google pour le contenu obsolète si vous ne possédez pas ce site.
- 5Vérifiez une archive du web comme la Wayback Machine ; certaines permettent à un propriétaire de demander l'exclusion d'une page précise.
Questions fréquentes
- Supprimer une page d'un PDF retire-t-il le texte déjà indexé par Google ?
- Non, pas à lui seul. Supprimer une page modifie le fichier que vous hébergez maintenant, mais Google peut continuer d'afficher une version en cache plus ancienne un moment. Publiez le fichier corrigé, puis utilisez l'outil de suppression de Search Console pour demander le retrait de l'ancien résultat.
- Google peut-il indexer un PDF scanné sans aucune couche de texte ?
- Un scan brut n'est qu'une image, donc Google n'y trouve aucun texte à extraire seul. Mais si vous, ou un outil PDF, y appliquez l'OCR, la couche de texte invisible ajoutée est exactement ce qui devient indexable.
- La balise noindex fonctionne-t-elle sur un PDF comme sur une page web classique ?
- La règle est la même, mais le moyen diffère. Une page HTML porte une balise meta dans son en-tête. Un PDF ne peut pas la contenir : vous envoyez donc un en-tête X-Robots-Tag : noindex depuis votre serveur, et Google doit quand même explorer le fichier pour le voir.
- Un nom de fichier générique suffit-il à protéger un nom présent dans un PDF ?
- Non. Un nom générique ne masque que le risque dans l'URL, pas celui à l'intérieur du fichier. La documentation de Google note qu'un nom de fichier ou une URL peut déjà révéler une information : choisissez un nom neutre et vérifiez quand même le texte.
- Un mot de passe sur un PDF suffit-il à le garder hors de la recherche Google ?
- Une page de connexion devant le fichier fait partie des options recommandées par Google, à condition que cette page porte elle-même une balise noindex. Sans authentification, le robot de Google peut atteindre le fichier directement, quel que soit son nom.
Sources et références
- Types de fichiers indexables par Google — Google Search Central
- Empêcher l'affichage des informations masquées dans la recherche Google — Google Search Central
- Balise meta robots, data-nosnippet et spécifications X-Robots-Tag — Google Search Central
- Présentation du fichier robots.txt — Google Search Central
- Suppressions et outil de création de rapports SafeSearch — Centre d'aide Search Console
Masquez un document sans l'envoyer nulle part
ONYRI Sanitize repère les noms, identifiants, coordonnées bancaires et secrets dans un PDF, un Word ou un scan, et les masque dans votre navigateur. Vous relisez l'aperçu, puis vous téléchargez une copie aplatie.