Zum Inhalt springen
Produkt6 Min. Lesezeit

Word-Dokumente in ONYRI Sanitize: Was der PDF-Export behält

Erfahren Sie genau, was ONYRI Sanitize bei einer Word-Datei behält und fallen lässt, wenn daraus ein geschwärztes PDF wird, und wann Sie selbst exportieren.

Von Alexis de ONYRI
Testen Sie es mit Ihrem eigenen Dokument

Sie fügen eine Word-Datei in ONYRI Sanitize ein und erhalten ein PDF zurück, keine geschwärzte Word-Datei. Das ist so gewollt. Der Browser liest Ihre .docx-Datei, layoutet sie Seite für Seite, schwärzt die sensiblen Stellen und setzt am Ende alles zu einer einzigen Datei zusammen. Dieser Beitrag zeigt genau, was diese Verarbeitung übersteht, was dabei verloren geht, und wann Sie zuerst selbst in Word als PDF exportieren sollten.

Wie liest ONYRI Sanitize eine Word-Datei?

Es wird nichts hochgeladen. Nehmen wir an, Erika Mustermann fügt einen unterschriebenen Kundenbrief, erika-brief.docx, in die Anwendung ein. Das Lesen der Datei, das Erkennen der sensiblen Stellen und das Zeichnen der Schwärzungen laufen auf ihrem eigenen Rechner ab. Das Erstellen des finalen PDFs auch. Der Server erfährt nur einen Zähler: ein Dokument, einige Seiten, eine Handvoll Schwärzungen.

  1. 1Der Browser wandelt Ihre .docx-Datei direkt im Tab mit einer Bibliothek namens mammoth in HTML um.
  2. 2Dieses HTML wird als A4-Seiten layoutet, 794 mal 1123 Pixel, ohne je eine Textzeile mittendurch zu trennen.
  3. 3Jede Seite wird von denselben Erkennungsmodulen geprüft, die ONYRI Sanitize auch für PDFs und Bilder verwendet: Namen, IBANs, E-Mail-Adressen und mehr.
  4. 4Jede geschwärzte Seite wird als Bild gerendert und zu einer brandneuen PDF-Datei zusammengesetzt.

So viel zu dem, was Sie auf der Seite sehen. Die interessantere Frage ist, was mit allem passiert, was Word im Hintergrund über Ihren Text speichert, ohne es anzuzeigen.

Was behält der PDF-Export, und was geht dabei verloren?

Eine .docx-Datei enthält mehr als nur Absätze. Sie kann Kommentare, nachverfolgte Änderungen, eine wiederkehrende Kopfzeile und einen Autorennamen in den Dokumenteigenschaften tragen. Hier sehen Sie genau, was der Konverter von ONYRI Sanitize, eine Bibliothek namens mammoth, behält und fallen lässt, direkt im Code geprüft.

Element Ihrer Word-DateiWas beim Export passiert
Absätze, Überschriften und ListenBleiben erhalten, mit Fett, Kursiv und Links. Unterstreichungen werden standardmäßig nicht übernommen
TabellenBleiben als Tabelle mit Zeilen und Spalten erhalten. Zellrahmen und Schattierungen werden nicht übernommen
BilderBleiben erhalten, an der Stelle im Text, an der sie stehen
Fuß- und EndnotenBleiben erhalten, dort eingefügt, wo mammoth sie platziert
KommentareGehen verloren. Der Konverter ignoriert sie standardmäßig
Nachverfolgte ÄnderungenGehen verloren. Einfügungen erscheinen als normaler Text, Löschungen verschwinden, ohne jede Markierung
Kopf- und FußzeilenGehen verloren. Wiederkehrende Kopf- und Fußzeilen werden nie gelesen
Autor, Titel und weitere DokumenteigenschaftenGehen verloren. Das neue PDF übernimmt keine der ursprünglichen Eigenschaften

Das Ergebnis ist immer ein flach gerendertes PDF: ein Bild pro Seite, erstellt mit einer Bibliothek namens pdf-lib. Unter den schwarzen Balken oder den Token-Beschriftungen verbirgt sich keine Textebene. Deshalb kommt die Datei auch immer als PDF zurück, nie als bearbeitbare Word-Datei.

Warum kann das Layout anders aussehen als in Word?

Eine .docx-Datei speichert kein festes Seitenlayout wie ein PDF. Word berechnet Zeilenumbrüche und Seitenumbrüche selbst, abhängig von Ihren Schriftarten und dem eingestellten Drucker. ONYRI Sanitize rendert dieselbe Datei mit eigenen Schriftarten und Rändern, sodass ein Seitenumbruch an einer leicht anderen Stelle landen kann.

Nehmen wir an, Erika Mustermann reicht einen formatierten Vertrag ein, bei dem jeder Seitenumbruch zählt. Sie sollte ihn in Word öffnen, Datei, dann Speichern unter wählen, PDF auswählen und dieses PDF statt der .docx-Datei zu ONYRI Sanitize hinzufügen. Die PDF-Pipeline von ONYRI liest vorhandene Seiten genau so, wie Word sie gezeichnet hat, statt den Text neu zu layouten.

Was sollten Sie vor dem Teilen der Datei prüfen?

Der Download behält den ursprünglichen Dateinamen bei und fügt vor der Dateiendung -anonymized hinzu. Eine Datei namens kundenbericht.docx kommt als kundenbericht-anonymized.pdf zurück. Ist der Dateiname selbst sensibel, etwa weil er den echten Nachnamen einer Kundin enthält, benennen Sie ihn vor dem Versand um.

  • Scrollen Sie vor dem Herunterladen durch die Seite-für-Seite-Vorschau.
  • Öffnen Sie die Liste der erkannten Daten, und deaktivieren Sie jeden Wert, der sichtbar bleiben soll.
  • Achten Sie auf einen Hinweis, dass ein erkannter Wert nicht auf der Seite platziert werden konnte.
  • Denken Sie daran: Das heruntergeladene PDF lässt sich nicht wieder in eine bearbeitbare Word-Datei zurückverwandeln.

All das macht das Dokument nicht automatisch konform. Die Erkennung ist nicht lückenlos, und das flach gerenderte PDF lässt sich nicht in Ihr Original zurückverwandeln. Bewahren Sie die ursprüngliche .docx-Datei auf. Sie ist die einzige bearbeitbare Kopie, die Ihnen bleibt.

Häufige Fragen

Erhalte ich eine bearbeitbare Word-Datei zurück?
Nein. Sie erhalten ein flach gerendertes PDF, das aus Seitenbildern aufgebaut ist. So lassen sich die Schwärzungen nicht einfach per Kopieren und Einfügen entfernen. Wenn Sie weiter bearbeiten müssen, arbeiten Sie mit Ihrer ursprünglichen .docx-Datei und exportieren Sie jedes Mal eine frische anonymisierte Kopie.
Warnt mich ONYRI Sanitize vor offenen Kommentaren oder nicht angenommenen Änderungen?
Es wird keine Warnung angezeigt. Kommentare werden entfernt, und nachverfolgte Änderungen gelten vor der Schwärzung als angenommen. Prüfen Sie selbst vorher die Registerkarte Überprüfen in Word, wenn Sie sich nicht sicher sind.
Warum kommt ein einseitiger Word-Brief als PDF zurück und nicht als Bild?
Die .docx-Pipeline erstellt immer ein PDF. Nur eine einzelne Bilddatei, etwa ein Foto, kommt als PNG zurück. Eine Word-Seite entspricht nicht einem einzigen Rasterbild wie ein Foto, deshalb setzt ONYRI Seite für Seite ein echtes PDF zusammen.
Kann ich eine alte .doc-Datei statt .docx hinzufügen?
Nein, ONYRI Sanitize liest nur das Format .docx. Öffnen Sie die alte .doc-Datei in Word, und wandeln Sie sie zuerst über Speichern unter in .docx um.
Was passiert mit dem Dateinamen nach dem Export?
Der Download behält Ihren ursprünglichen Namen bei und fügt vor der Dateiendung -anonymized hinzu. Benennen Sie die Datei selbst vorher um, wenn schon der ursprüngliche Name sensibel ist.

Quellen und Verweise

Auf dieser WebsiteWord-Dokument anonymisieren

Maskieren Sie ein Dokument, ohne es hochzuladen

ONYRI Sanitize findet Namen, Kennungen, Bankdaten und Geheimnisse in einer PDF, einer Word-Datei oder einem Scan und maskiert sie in Ihrem Browser. Sie prüfen die Vorschau und laden dann eine reduzierte Bildkopie herunter.

Als Nächstes lesen