Zum Inhalt springen
Produkt8 Min. Lesezeit

Wie genau ist ONYRI Sanitize? Unser Erkennungstest an 48 fiktiven Dokumenten

Unsere Erkennung im Test an 48 fiktiven Dokumenten: 85,5 % der sensiblen Elemente abgedeckt, 93,8 % der Schwärzungen nötig. Methode und Korpus offen.

Von Alexis de ONYRI

An 48 fiktiven Dokumenten hat ONYRI Sanitize 85,5 % der 869 Elemente vollständig abgedeckt, die eine aufmerksame Person schwärzen würde. Außerdem lagen 93,8 % der 872 Schwärzungen auf etwas, das verborgen werden musste. Beide Zahlen messen den Text von Dokumenten, die wir selbst geschrieben haben, nur mit den Erkennungsregeln.

Die erste Zahl ist die Trefferquote: der Anteil dessen, was verborgen werden musste und verborgen wurde. Die zweite ist die Präzision: der Anteil der Schwärzungen, die nötig waren. Das NIST (SP 800-188, September 2023) schreibt, Behörden könnten bei der De-Identifizierung staatlicher Datensätze einen Standard mit messbaren Leistungsstufen einführen. Der Gedanke gilt auch hier: „Genau“ braucht eine Zahl und eine Methode.

Was enthält der Testkorpus?

Der Korpus besteht aus 48 fiktiven Dokumenten mit zusammen etwa 59.000 Zeichen und je 26 bis 62 Zeilen. Sie sind in sechs Sprachen geschrieben: Englisch, Französisch, Deutsch, Spanisch, Italienisch und Niederländisch. Sie stammen aus 11 Ländern. Luxemburg hat ein Dokument auf Französisch und eines auf Deutsch.

Dazu zählen Gehaltsabrechnungen, Verträge, Rechnungen, Kontoauszüge, Arztbriefe, Schadenmeldungen, Mietverträge, Lebensläufe, E-Mail-Verläufe, Protokolle und Gerichtsentscheidungen. Einige imitieren einen per OCR gelesenen Scan, mit überzähligen Leerzeichen und dem Buchstaben O statt einer Null.

Wir haben sie eigens für diesen Zweck geschrieben, mit Hilfe eines KI-Schreibassistenten. Die ersten 36 entstanden, ohne den Code der Detektoren anzusehen. Die 12 spanischen, italienischen, niederländischen und luxemburgischen Dokumente kamen mit den Detektoren dieser Länder. Danach haben wir die sensiblen Elemente nach schriftlichen Regeln markiert. Personen und Firmen sind erfunden. E-Mail-Adressen und Links nutzen für Beispiele reservierte Domains. Nummern folgen dem echten Format des jeweiligen Landes. Hat ein Format Prüfziffern, sind sie gültig: Sie erkennen Tippfehler.

Der Korpus enthält auch Fallen: Dinge, die sensibel wirken, aber sichtbar bleiben müssen. Eine Schwärzung auf einer Falle zählt gegen uns. Insgesamt sind 869 Elemente markiert, in 17 Kategorien. Zu den Fallen gehören:

  • Straßen, die nach Personen benannt sind
  • Städte, die auch Vornamen sind
  • Personen des öffentlichen Lebens
  • Großgeschriebene Alltagswörter
  • Produktcodes
  • Artikelnummern von Gesetzen
  • Prozentzahlen
  • Einzelne Jahreszahlen

Wie bewerten wir das Ergebnis?

  • Vollständig geschwärzt (Trefferquote): der Anteil der markierten Elemente, die verborgen wurden. Ein Element zählt nur, wenn jeder Buchstabe und jede Ziffer unter einer Schwärzung liegt. Eine halb geschwärzte IBAN ist verfehlt.
  • Richtiges Etikett: der Anteil der Elemente, die eine Schwärzung der passenden Kategorie berührt, etwa eine Telefon-Schwärzung auf einer Telefonnummer. Für die erste Zahl spielt das Etikett keine Rolle. Schwärzung ist Schwärzung.
  • Präzision: der Anteil der Schwärzungen, die mindestens ein markiertes Element berühren. Eine Schwärzung, die keines berührt, ist ein Fehlalarm, und sie zählt gegen uns.

Trefferquote (Recall) und Präzision folgen den Definitionen in Googles Kurs zum maschinellen Lernen. Wir messen nur den Text, also die Erkennungsregeln der Engine.

Was findet die Erkennung, nach Datenart geordnet?

Sechs Kategorien erreichen 100 %, doch vier davon beruhen nur auf 4 bis 7 Elementen.

KategorieElementeVollständig geschwärzt (%)Richtiges Etikett (%)
Personennamen15085,394,7
E-Mail-Adressen56100100
Telefonnummern5396,296,2
Postanschriften7680,397,4
Datumsangaben17188,387,1
Nationale Kennnummern2387,091,3
Bankdaten3889,576,3
Kartennummern6100100
Beträge mit Währung137100100
Firmenkennungen2090,075,0
Referenznummern4156,153,7
Namen von Organisationen6464,164,1
Medizinische Codes (ICD-10)7100100
Medizinische Begriffe im Klartext1500
Geheimnisse (Passwörter)450,050,0
Private URLs4100100
IP-Adressen4100100
Erkennung nach Kategorie (Lauf vom 6. Oktober 2026, alle Detektoren, Land bekannt)

Zwei Schwachstellen fallen auf: Referenznummern (56,1 %) und Namen von Organisationen (64,1 %). Das richtige Etikett liegt bei Bankdaten (76,3 % gegen 89,5 %) und Firmenkennungen (75,0 % gegen 90,0 %) unter dem Anteil der vollständig geschwärzten Elemente. Der Wert war verborgen, aber unter einem anderen Etikett. Im Modus Token gehört das Etikett zum Ersatztext, dort fällt ein falsches auf.

Wie unterscheiden sich die Ergebnisse nach Land und Sprache?

LandDokumenteElementeVollständig geschwärzt (%)Präzision (%)
Frankreich815388,298,6
Belgien44582,293,5
USA713577,881,6
Vereinigtes Königreich59171,495,2
Deutschland612688,994,5
Österreich34877,197,6
Schweiz35096,098,0
Spanien47483,896,1
Italien35896,693,8
Niederlande35394,396,6
Luxemburg23610095,5
Erkennung nach Land, alle Detektoren

Nach Sprache liegen bei der Trefferquote Französisch (88,0 %) und Deutsch (88,8 %) unter den größeren Gruppen vorn. Spanisch, Italienisch und Niederländisch kommen auf 83,8 % bis 96,6 %, mit nur 3 oder 4 Dokumenten je Sprache. Englisch ist am schwächsten: 75,2 % Trefferquote und 86,8 % Präzision bei 12 Dokumenten.

Die USA haben die niedrigste Präzision (81,6 %), zum Teil weil dort viele Vornamen auch Wörter oder Orte sind. Das Vereinigte Königreich hat die niedrigste Trefferquote (71,4 %), zum Teil weil kein Detektor britische Straßenadressen oder Sort Codes (Bankleitzahlen) abdeckt. Sieben Länder haben nur 2 bis 4 Dokumente. Ein einzelnes Element verschiebt ihre Zahlen um ein bis drei Punkte.

Was entgeht der Erkennung, und warum?

Es wurden 126 Elemente verfehlt: Namen von Organisationen 23, Personennamen 22, Datumsangaben 20, Referenznummern 18, medizinische Begriffe 15, Adressen 15 und 13 weitere. Die wichtigsten Ursachen:

  • Medizinische Begriffe im Klartext (15 Elemente, 0 %). Für eine Diagnose oder Behandlung in Worten gibt es keinen Detektor.
  • Namen von Organisationen ohne Rechtsform (64,1 %). Die Regeln erkennen einen Namen, dem GmbH, Ltd oder SA folgt. Eine Bäckerei oder Klinik mit gewöhnlichem Namen und ohne Rechtsform rutscht durch.
  • Referenznummern mit einer Bezeichnung außerhalb unserer Liste (56,1 %). Eine Nummer wird gefunden, wenn ein Stichwort aus der Liste, etwa „Az.“ oder „Policen-Nr.“, direkt davor steht. „Ticket“ steht nicht darin.
  • Seltene Namen. Ein Vor- oder Nachname, der in unseren Namenslisten fehlt, kann die Hälfte eines Namens sichtbar lassen.
  • Britische Adressen. Für Straßenadressen und Sort Codes im Vereinigten Königreich gibt es keinen Detektor.
  • Unvollständige Datumsangaben. Einzelne Jahreszahlen in einem Lebenslauf (nur in diesem Lebenslauf markiert) sowie Tag und Monat ohne Jahr in einem Kontoauszug.
  • Scan-Rauschen. In den simulierten Scans zerstörten ein O statt einer Null oder überzählige Leerzeichen einige Datumsangaben, Namen und Adressen.
  • Ein Passwort im Satz, ohne „Passwort:“ direkt davor.

Jede Lücke lässt sich von Hand schließen. Nutzen Sie „Text auswählen“, „Bereich ziehen“ oder „Im Dokument suchen“ und schwärzen Sie alle Treffer. Oder tragen Sie einen vergessenen Begriff unter „Außerdem schwärzen“ ein.

Was sind die Fehlalarme?

Von ihren 872 Schwärzungen trafen 54 nichts, was wir markiert hatten. Davon liegen 38 auf Personennamen. Die wichtigsten Ursachen:

  • Vornamen, die auch Wörter oder Orte sind (Bill, Dallas, Charlotte, Florence).
  • Namen und Daten, die wir an anderer Stelle im Dokument markiert haben, hier aber nicht, etwa „Ms. Moreno's“ (14 der 54). Diese Schwärzungen sind richtig: Unsere Markierung hat sie vergessen.
  • Personen des öffentlichen Lebens (eine nach Victor Hugo benannte Straße).
  • Allgemeine Postfächer wie payroll@, in drei Dokumenten nicht markiert, in anderen markiert.
  • Großgeschriebene Wörter, die wie ein Bankcode aussehen.
  • Wörter, die Scan-Rauschen beschädigt hat und die für Geheimnisse gehalten wurden.

Darf ein Werkzeug zum Schwärzen etwas zu viel schwärzen? Wir meinen: ja. Ein Fehlalarm verbirgt ein harmloses Wort. Eine Lücke lässt einen Wert durchsickern. Googles Kurs empfiehlt die Trefferquote, wenn falsch negative Ergebnisse teurer sind als falsch positive. Zu viele unnötige Schwärzungen haben dennoch ihren Preis: Sie ermüden die prüfende Person. Deshalb können Sie jeden Wert in der Liste „Erkannte Daten“ abwählen, und ein Test überwacht die Präzision.

Wie schneidet das Profil Standard ab?

Mit dem Free-Tarif gilt das Profil Standard. Es lässt die Detektoren für technische Geheimnisse weg, die zu Pro gehören, und es errät das Land aus dem Text. Es erreicht 85,2 % Trefferquote und 94,2 % Präzision, mit 50 Fehlalarmen bei 865 Schwärzungen. Referenznummern fallen auf 53,7 %, Geheimnisse auf 0 %.

Was sagen diese Zahlen nicht?

Die erste Fassung des Korpus vom 27. September 2026 hatte 36 Dokumente auf Englisch, Französisch und Deutsch. Ihr erster Lauf fand 73,6 % bei 91,7 % Präzision. An jenem Tag kamen 12 Dokumente aus Spanien, Italien, den Niederlanden und Luxemburg hinzu.

Wie nutzen wir den Test?

Der Test gehört zur Testsuite, die wir vor jeder Version ausführen. Er schlägt fehl, wenn eine Kategorie gegenüber einem gespeicherten Referenzwert an Trefferquote verliert oder wenn die Präzision um mehr als einen Punkt sinkt.

Können Sie unsere Zahlen prüfen?

Ja. Wir veröffentlichen die 48 Dokumente mit ihren Markierungen im Text, die Regeln für Markierung und Auswertung sowie die Ergebnisse. Die Lizenz ist Creative Commons Namensnennung 4.0 International (CC BY 4.0). Testen Sie damit jedes Werkzeug, auch unseres.

Häufige Fragen

Erlaubt eine Trefferquote von 85,5 %, auf die Prüfung zu verzichten?

Nein. Auf diesem Korpus wurde etwa jedes siebte Element nicht vollständig geschwärzt. Lesen Sie immer die Vorschau, nutzen Sie die Liste „Erkannte Daten“ und schwärzen Sie den Rest von Hand.

Wird mein Dokument irgendwohin gesendet, wenn ich die App nutze?

Nein. Erkennung und Schwärzung laufen in Ihrem Browser, und die Datei wird nie hochgeladen. Der Server erhält nur Zähler: die Dokumentart, die Seitenzahl und die Zahl der Schwärzungen.

Ist das Namenserkennungsmodell in diesen Zahlen enthalten?

Nein. Der Test misst nur die Erkennungsregeln. Auf einem Computer mit Maus oder Trackpad sucht in der Regel zusätzlich ein Namenserkennungsmodell, das auf Ihrem Gerät läuft, nach Personen- und Firmennamen. Es ergänzt die Regeln und ist nicht vollständig.

Macht Schwärzen auf diesem Niveau ein Dokument anonym?

Nein. Das Verbergen erkannter Werte senkt die Gefährdung. Der BfDI hält in seinem Positionspapier von 2020 fest, dass man nicht vorschnell von einer hinreichenden Anonymisierung ausgehen darf. Der Modus Token ist eine Pseudonymisierung, und pseudonymisierte Daten bleiben laut BfDI personenbezogen.

Quellen und Verweise

Maskieren Sie ein Dokument, ohne es hochzuladen

ONYRI Sanitize findet Namen, Kennungen, Bankdaten und Geheimnisse in einer PDF, einer Word-Datei oder einem Scan und maskiert sie in Ihrem Browser. Sie prüfen die Vorschau und laden dann eine reduzierte Bildkopie herunter.