Zum Inhalt springen
Anleitungen6 Min. Lesezeit

PDF auf der eigenen Website veröffentlichen: Was Suchmaschinen darin lesen können

Ein PDF ist mehr als ein Bild einer Seite. Was Google darin indexieren kann, wie Sie eine Datei vorher testen und einen Fehler danach beheben.

Von Alexis de ONYRI

Ja, und mehr, als die meisten erwarten. Google liest den Text in einem PDF, nicht nur den Dateinamen. Ein Absatz unter einem schwarzen Balken, ein alter Dokumenttitel oder eine gescannte Seite mit einer unsichtbaren OCR-Textebene können in den Suchergebnissen auftauchen. Dieser Leitfaden zeigt, was Google in einem PDF wirklich liest, wie Sie eine Datei vor der Veröffentlichung prüfen und was Sie tun, wenn bereits etwas durchgesickert ist.

Was können Suchmaschinen in einem PDF wirklich lesen?

Google behandelt ein PDF fast wie eine Webseite. Die Dokumentation nennt das Adobe-PDF-Format unter den Dateitypen, die Google indexieren kann, und die Systeme extrahieren den lesbaren Text mit einem eigenen Parser. Jedes Wort der Datei, nicht nur das, was ein Leser bemerkt, kann so durchsuchbar werden. Googles Anleitung zu geschwärzten Informationen ergänzt, dass auch in ein Dokument eingebettete Bilder indexiert werden, genau wie Bilder auf einer gewöhnlichen Webseite.

  • Der vollständige Text der Datei, extrahiert von einem eigenen PDF-Parser.
  • Links in der Datei. Googles Regel zum Blockieren der Linkverfolgung, nofollow, gilt auch für PDFs, Google kann ihnen also standardmäßig folgen.
  • In das PDF eingebettete Bilder, indexiert wie Bilder auf einer normalen Webseite.
  • Der Dateiname und der URL-Pfad, die auch für eine Seite in den Ergebnissen erscheinen können, die Google eigentlich nicht crawlen sollte.

Wie wird verborgener Text durchsuchbar?

Ein Dokument kann Informationen enthalten, die ein Leser nie bemerkt. Stellen Sie sich einen Einstellungsbericht vor, der einen Absatz mit dem Namen Erika Mustermann mit einem schwarzen Rechteck überdeckt. Googles eigene Anleitung ist bei dieser Methode eindeutig: Das Rechteck entfernt ihren Namen darunter nicht. Die Wörter bleiben in der Datei, sodass der Parser einer Suchmaschine sie weiterhin lesen kann, auch wenn eine Person auf der Seite nur einen durchgehenden Balken sieht.

  • Ein schwarzes Rechteck über der Textebene, ohne dass der Text selbst gelöscht wird.
  • Eine OCR-Textebene hinter einer gescannten Seite: Das Bild wirkt frei von sensiblen Inhalten, doch die unsichtbare Textebene darunter ist genau das, was indexiert wird.
  • Metadaten in den Dateieigenschaften, etwa ein alter Titel, ein Autorenname oder der Name der Person, die die Datei zuletzt bearbeitet hat.
  • Eine gespeicherte Änderungshistorie, die manche Formate mitführen und die eine Textversion offenlegen kann, die ein Bearbeiter für verschwunden hielt.

Wie testen Sie ein PDF vor der Veröffentlichung?

Bevor ein PDF online geht, prüfen Sie es wie ein Crawler es tun würde. Jeder Schritt dauert eine Minute, und zusammen fangen sie die meisten Fehler ab.

SchrittSo geht esWas es aufdeckt
Den gesamten Text markierenÖffnen Sie das PDF, drücken Sie Strg+A (Cmd+A auf dem Mac), und fügen Sie den Text in einen Texteditor ein.Text, der unter einem schwarzen Balken oder Bild verborgen ist: Alles Markierbare ist auch indexierbar.
Die Datei durchsuchenNutzen Sie die Suchleiste Ihres PDF-Readers nach einem Namen oder Begriff, den Sie entfernen wollten.Eine übersehene Stelle, die eine visuelle Prüfung leicht überspringt, vor allem in langen Berichten.
Die Eigenschaften prüfenÖffnen Sie das Feld Eigenschaften oder Dokumentinformationen und lesen Sie Titel, Autor und Firmenfeld.Einen alten Arbeitstitel oder den Namen eines Mitarbeiters aus einem internen Entwurf.
Dateiname und URL prüfenSehen Sie sich den genauen Dateinamen und den Ordnerpfad vor dem Hochladen an.Einen Kundennamen oder eine Aktennummer, die direkt im Dateinamen steht.

ONYRI Sanitize geht für ein Dokument, das veröffentlicht werden soll, einen anderen Weg. Jede geschwärzte Datei wird als flaches PDF exportiert, zusammengesetzt aus Seitenbildern. So bleibt unter einer Schwärzung keine Textebene für einen Crawler übrig, und Titel und Autor aus den ursprünglichen Eigenschaften werden nicht übernommen. Der Kompromiss ist echt: Ein flaches PDF ist kein durchsuchbarer Text mehr, was nicht zu jedem öffentlichen Dokument passt.

Zwei Werkzeuge klingen ähnlich, tun aber sehr Unterschiedliches, und sie zu verwechseln ist der häufigste Fehler: die robots.txt-Datei und die noindex-Regel.

MethodeWas sie wirklich tutWarum sie allein nicht reicht
robots.txtSagt dem Google-Crawler, welche URLs er nicht abrufen soll.Google selbst nennt das kein Mittel, um eine Webseite aus Google herauszuhalten. Eine blockierte URL, auf die andere Seiten verlinken, kann trotzdem in den Ergebnissen erscheinen, nur ohne Beschreibung.
X-Robots-Tag: noindexEin HTTP-Header, den Ihr Server mit der Datei sendet und der Google anweist, sie nicht in den Ergebnissen zu zeigen.Google muss die Datei zuerst crawlen, um den Header zu lesen. Blockiert robots.txt dieses Crawlen, wird die noindex-Regel nie gefunden. Kombinieren Sie die beiden daher nie auf derselben Datei.

In der Praxis: Lassen Sie das PDF crawlbar, und fügen Sie für diese Datei, oder einen ganzen Ordner, auf Ihrem Server einen X-Robots-Tag: noindex-Header hinzu. Entfernen Sie danach jede robots.txt-Regel, die denselben Pfad blockiert. Für eine Datei, die nur bestimmte Personen erreichen sollen, stellen Sie stattdessen einen Login davor und geben Sie dieser Login-Seite ihre eigene noindex-Angabe.

Was tun Sie, wenn ein PDF-Fehler schon öffentlich ist?

Ist ein PDF mit falschem Inhalt bereits indexiert, handeln Sie schnell und in dieser Reihenfolge.

  1. 1Nehmen Sie die Datei sofort offline, oder ersetzen Sie sie durch die korrigierte Version.
  2. 2Bitten Sie im Tool zum Entfernen der Search Console darum, die genaue URL auszublenden. Bei einer verifizierten Website dauert das meist unter einem Tag und wirkt etwa sechs Monate.
  3. 3Veröffentlichen Sie die korrigierte Datei unter einer neuen URL, damit die Version, die Google als Nächstes findet, nicht mit der bereits indexierten verwechselt wird.
  4. 4Hat eine andere Website die Datei kopiert, bitten Sie sie, diese ebenfalls zu entfernen, oder verweisen Sie auf Googles Tool für veraltete Inhalte, wenn Ihnen die Website nicht gehört.
  5. 5Prüfen Sie ein Webarchiv wie die Wayback Machine; manche erlauben es Website-Betreibern, den Ausschluss einer bestimmten Seite zu beantragen.

Häufige Fragen

Entfernt das Löschen einer Seite aus einem PDF den Text, den Google bereits indexiert hat?
Nein, nicht von allein. Das Löschen einer Seite ändert die Datei, die Sie jetzt hosten, aber Google kann eine Weile noch eine ältere zwischengespeicherte Version zeigen. Veröffentlichen Sie die korrigierte Datei, und bitten Sie dann im Tool zum Entfernen der Search Console um die Entfernung des alten Ergebnisses.
Kann Google ein gescanntes PDF ohne jede Textebene indexieren?
Ein reiner Scan ist nur ein Bild, Google findet darin also keinen Text zum Extrahieren. Führen aber Sie, oder ein PDF-Werkzeug, eine OCR darauf aus, ist genau die dabei hinzugefügte unsichtbare Textebene das, was durchsuchbar wird.
Funktioniert noindex bei einem PDF genauso wie bei einer normalen Webseite?
Die Regel ist gleich, nur der Weg dorthin unterscheidet sich. Eine HTML-Seite trägt ein Meta-Tag in ihrem Kopfbereich. Ein PDF kann dieses Tag nicht enthalten, deshalb senden Sie stattdessen einen X-Robots-Tag: noindex-Header von Ihrem Server, und Google muss die Datei trotzdem einmal crawlen, um ihn zu sehen.
Reicht ein allgemeiner Dateiname, um einen Namen in einem PDF zu schützen?
Nein. Ein allgemeiner Name verbirgt nur das Risiko in der URL, nicht das in der Datei selbst. Googles Anleitung merkt an, dass ein Dateiname oder eine URL allein schon Informationen preisgeben kann. Wählen Sie also einen neutralen Namen und prüfen Sie trotzdem den Text in der Datei.
Hält ein Passwort ein PDF aus der Google-Suche heraus?
Eine Login-Seite vor der Datei gehört zu Googles eigenen empfohlenen Optionen, sofern diese Seite selbst eine noindex-Angabe trägt. Ohne Login kann Googles Crawler die Datei direkt erreichen, egal wie unauffällig ihr Name ist.

Quellen und Verweise

Auf dieser WebsitePDF im Browser anonymisieren

Maskieren Sie ein Dokument, ohne es hochzuladen

ONYRI Sanitize findet Namen, Kennungen, Bankdaten und Geheimnisse in einer PDF, einer Word-Datei oder einem Scan und maskiert sie in Ihrem Browser. Sie prüfen die Vorschau und laden dann eine reduzierte Bildkopie herunter.

Als Nächstes lesen