Zum Inhalt springen
Grundlagen7 Min. Lesezeit

Warum Dokumente schwerer zu anonymisieren sind als Datenbanken

Eine Datenbank hat Spalten, die man löschen kann. Ein Dokument nicht: Namen und Nummern verstecken sich in Sätzen, Tabellen, Fußzeilen und Scans.

Von Alexis de ONYRI

Eine Datenbank lässt sich leicht anonymisieren, weil jeder Name in einer eigenen Spalte steht. Ein Dokument hat keine Spalten. Ein Name, eine Telefonnummer oder eine Unterschrift können in einem Satz, einer Tabelle, einer Fußzeile oder einem gescannten Bild stehen. Jede Stelle muss einzeln gefunden werden.

Nehmen Sie eine Kundentabelle und einen Brief an eine dieser Kundinnen. In der Tabelle entfernt das Löschen der Spalte Name jeden Namen auf einmal. Im Brief steht der Name von Erika Mustermann in der Anrede, in der Postanschrift und noch einmal in der Unterschrift: drei verschiedene Stellen.

Was ist der Unterschied zwischen strukturierten und unstrukturierten Daten?

Strukturierte Daten haben eine feste Form: Zeilen und Spalten, wie in einer Tabelle. Jeder Wert trägt eine Bezeichnung, sodass ein Programm die Spalte Telefonnummer löschen kann, ohne eine einzige Zeile zu lesen. Unstrukturierte Daten haben diese Form nicht. Ein Brief oder ein gescanntes Formular bestehen aus freiem Text und Bildern, ohne einen Hinweis wie dies ist eine Telefonnummer. Jemand muss den Inhalt lesen, um zu wissen, was darin steht.

FrageIn einer DatenbankIn einem Dokument
Wo steht ein Name?In einer einzigen Spalte, für jede ZeileVerteilt auf Sätze, Tabellen, Kopfzeilen, eine Unterschrift
Wie entfernt man ihn überall?Die ganze Spalte einmalig löschenJedes Vorkommen finden, auf jeder Seite
Welche Technik greift?Ein Feld generalisieren, für alle Zeilen zugleichDen Wert im Fließtext erkennen und maskieren
Was passiert bei einer übersehenen Stelle?Eine übersehene Zeile bleibt trotzdem geschütztEine übersehene Erwähnung kann die Datei identifizieren
Strukturierte Daten und unstrukturierte Dokumente im Vergleich.

Wo verstecken sich Identifikatoren in einem Dokument?

Ein Datenschutzbeauftragter, der an einer Datenbank arbeitet, kann alle Spalten in wenigen Minuten auflisten. Ein Dokument bietet keine solche Liste: Derselbe Name oder dieselbe Nummer kann an mehreren Stellen zugleich auftauchen, ohne sich anzukündigen.

  • Fließtext: ein Name, eine Telefonnummer oder eine Adresse, in einem gewöhnlichen Satz.
  • Tabellen in der Datei: Gehaltsliste, Kundenliste, Terminplan.
  • Kopf- und Fußzeilen: ein Aktenzeichen oder ein Name, wiederholt auf jeder Seite.
  • Unterschriften und handschriftliche Notizen: auf einer gescannten Seite oder einem fotografierten Formular.
  • Metadaten der Datei: der Name des Autors, automatisch gespeichert von Word oder einem PDF-Werkzeug.
  • Eingefügte Bilder und Screenshots: ein Foto oder eine Grafik mit sichtbaren Beschriftungen.

Warum funktioniert das Löschen einer Spalte bei einem Brief nicht?

Das Löschen der Spalte Name in einer Datenbankansicht ist ein einziger Vorgang, der alle Datensätze auf einmal erfasst. Ein Brief hat kein Namensfeld zum Löschen. Das Wort Erika kann in der Anrede stehen, noch einmal beim Dank für ihre Bestellung, und ein drittes Mal im Unterschriftenblock. Jede Erwähnung muss jedes Mal erneut erkannt werden.

Wie wirken Generalisierung und Unterdrückung auf einen Textabsatz?

Die Generalisierung ersetzt einen genauen Wert durch eine Spanne. Die Unterdrückung entfernt ihn ganz. Die Artikel-29-Datenschutzgruppe beschrieb in ihrer Stellungnahme 5/2014 Randomisierung und Generalisierung als die beiden Hauptfamilien von Techniken für strukturierte Daten. Auf ein Dokument angewendet, funktioniert dieselbe Idee auf Sätzen statt auf Tabellenzellen.

  • Geboren am 3. März 1990 in Lyon wird zu Geboren in den 1990er-Jahren, in Frankreich.
  • Kontoinhaberin: Erika Mustermann, 47 Jahre wird zu Kontoinhaberin: Name maskiert, 40 bis 49 Jahre.
  • Ein genaues Gehalt wird zu einer Spanne, etwa zwischen 40.000 und 50.000 Euro im Jahr.
  • Eine Straßenadresse wird zu einem Stadtnamen, ohne Hausnummer und Postleitzahl.

Wie sieht ein solider Prozess für die Anonymisierung von Dokumenten aus?

Ein funktionierender Prozess folgt fünf Schritten: erkennen, prüfen, entfernen, plätten, verifizieren. Wird der Prüfschritt übersprungen, entsteht falsche Sicherheit. Wird der Plättschritt übersprungen, behält eine maskierte Datei ihren Text darunter. Ein Unterschied zählt: Einen Namen durch NAME1 zu ersetzen, ist Pseudonymisierung, nicht Anonymisierung, weil das Muster nachverfolgbar bleibt. Der BfDI unterscheidet Pseudonymisierung, Art. 4 Nr. 5 DSGVO, ausdrücklich von anonymen Daten.

  1. 1Erkennen: jede Seite nach Namen, Nummern, Daten und sensiblen Werten durchsuchen.
  2. 2Prüfen: die Liste der Funde Seite für Seite durchgehen, denn ein Detektor kann etwas übersehen oder falsch melden.
  3. 3Entfernen oder maskieren: jeden bestätigten Wert schwärzen, im Fließtext wie in Tabellen, Kopf- und Fußzeilen.
  4. 4Plätten: die maskierten Seiten in Bilder umwandeln, ohne verborgene Textebene darunter.
  5. 5Verifizieren: das Ergebnis öffnen und prüfen, dass nichts Sensibles mehr markiert oder kopiert werden kann.

ONYRI Sanitize ist genau für dieses Dokumentproblem gebaut, nicht für das Datenbankproblem. Es liest den Text in einer PDF-, Word- oder Scandatei im Browser. Es setzt die Masken auf das tatsächliche Seitenlayout und exportiert geplättete Seiten ohne Text darunter. Seine Grenze: Es liest Text, keine Bilder, daher wird ein Logo oder ein Gesicht nicht analysiert und muss von Hand geprüft werden.

All das macht die Anonymisierung von Dokumenten nicht unmöglich. Es macht sie zu einem Prozess, nicht zu einem einzigen Klick. Behandeln Sie ein Dokument so, wie eine sorgfältige Lektorin ein Manuskript behandelt. Lesen Sie jede Seite, markieren Sie jede Fundstelle, und prüfen Sie die Kopie, bevor sie Ihre Hände verlässt.

Häufige Fragen

Kann ich alle Namen aus einem Dokument entfernen, so wie ich eine Spalte in einer Tabelle lösche?
Nein. Eine Tabelle hält jeden Namen in einer eigenen Spalte, sodass das Löschen dieser Spalte alle Werte auf einmal entfernt. Ein Dokument hat keine Spalten. Ein Name kann in einem Satz, einer Tabelle, einer Fußzeile oder einer Unterschrift stehen, und jedes Vorkommen muss einzeln gefunden werden.
Entfernt ein schwarzer Balken über Text in einer PDF-Datei den Text wirklich?
Nur, wenn die Seite anschließend in ein flaches Bild umgewandelt wird. Viele Werkzeuge zeichnen nur eine Form über den Text, und die ursprünglichen Wörter bleiben darunter erhalten. Das britische National Archives warnt, dass elektronische Schwärzung Spuren dessen hinterlassen kann, was entfernt wurde.
Warum ist eine Datenbank leichter zu anonymisieren als eine Word-Datei oder ein Scan?
Eine Datenbank fasst ähnliche Werte zusammen, sodass eine einzige Regel, etwa das Löschen einer Spalte, alle Datensätze auf einmal schützt. Ein Dokument mischt Fließtext, Tabellen, Bilder und Metadaten in einer Datei, und eine für eine Stelle geschriebene Regel erfasst die anderen nicht.
Wirken Generalisierung und Unterdrückung auf einen Absatz genauso wie auf eine Tabellenspalte?
Die Idee ist dieselbe, aber das Ziel ändert sich. Bei einer Spalte rundet die Generalisierung alle Werte auf einmal, etwa durch Altersspannen statt genauer Angaben. Bei einem Absatz muss dasselbe Runden Satz für Satz geschehen, dort, wo Alter oder Adresse tatsächlich stehen.
Werden gescannte Seiten und fotografierte Dokumente genauso anonymisiert wie getippter Text?
Nein. Eine bereits getippte PDF-Datei hat eine Textebene, die ein Programm direkt durchsuchen kann. Ein Scan ist nur ein Bild, daher muss der Text zuerst durch optische Zeichenerkennung auf dem Gerät gelesen werden. Das Ergebnis hängt von der Scanqualität ab, und Handschrift wird oft gar nicht gelesen.

Quellen und Verweise

Auf dieser WebsitePDF im Browser anonymisieren

Maskieren Sie ein Dokument, ohne es hochzuladen

ONYRI Sanitize findet Namen, Kennungen, Bankdaten und Geheimnisse in einer PDF, einer Word-Datei oder einem Scan und maskiert sie in Ihrem Browser. Sie prüfen die Vorschau und laden dann eine reduzierte Bildkopie herunter.

Als Nächstes lesen