Wie ONYRI Sanitize ein Dokument in Ihrem Browser anonymisiert
Vom Ablegen bis zum Download: was in Ihrem Browser läuft, welche drei Zähler unser Server erhält, wie Sie das selbst prüfen, und wo die Grenzen liegen.
ONYRI Sanitize liest, prüft und schwärzt Ihr Dokument im Tab Ihres Browsers. Die Datei wird nie hochgeladen. Beim Download erhält unser Server drei Zähler: die Art der Datei, die Zahl der Seiten und die Zahl der geschwärzten Stellen. Sonst nichts über das Dokument. Hier sind der Ablauf, ein Zwei-Minuten-Test zum Nachprüfen und die Grenzen.
Was passiert zwischen dem Ablegen und dem Download?
Fünf Schritte, alle auf Ihrem Gerät. Nehmen wir einen Vertrag, der Erika Mustermann, ihre E-Mail-Adresse und ihre IBAN nennt.
- 1Öffnen. Sie legen ein PDF, eine Word-Datei (.docx) oder ein Bild ab. Der Browser öffnet die Datei im Speicher des Tabs. Es startet kein Upload.
- 2Lesen. Die Textebene eines PDFs wird direkt gelesen, mit den Wortpositionen. Ein Scan läuft durch eine OCR auf Ihrem Gerät. Eine Word-Datei wird auf A4-Seiten umbrochen.
- 3Erkennen. Rund 40 Detektoren durchsuchen den Text, dazu Ihre eigenen Regeln und die Begriffe unter „Außerdem schwärzen“.
- 4Prüfen. Jede erkannte Stelle erscheint als Kasten in der Vorschau. Sie entfernen das Häkchen bei allem, was sichtbar bleiben soll, und ergänzen, was fehlt.
- 5Exportieren. Jede Seite wird als Bild gezeichnet, die Masken sind eingebrannt. Die Bilder ergeben ein neues PDF, bei einem einzelnen Bild ein PNG.
Ein Server ist dafür nicht nötig. PDF-Seiten liest PDF.js, eine Open-Source-Bibliothek von Mozilla und weiteren Beitragenden. Die OCR nutzt Tesseract.js, das auf einer WebAssembly-Portierung der Tesseract-Engine aufbaut. Laut MDN führt WebAssembly Hochleistungscode direkt im Browser aus.
Was bleibt auf Ihrem Gerät, und was erhält unser Server?
| Element | Wo es liegt | An unseren Server gesendet? |
|---|---|---|
| Die Datei und ihr Name | Ihr Browser-Tab | Nein |
| Seitentext, erkannte Werte, Token-Platzhalter, Begriffe aus „Außerdem schwärzen“ | Ihr Browser-Tab | Nein |
| Art der Datei, Seitenzahl, Zahl der geschwärzten Stellen | Unsere Datenbank, Ihrem Arbeitsbereich zugeordnet | Ja, beim Download |
| E-Mail-Adresse des Kontos, Tarif, gespeicherte eigene Regeln und Profile | Unsere Datenbank | Ja, wenn Sie sie speichern |
Die Zähler haben nur einen Zweck: Ihren Tarif anzuwenden. Der Free-Tarif erlaubt 3 Dokumente pro Tag, also muss der Server sie zählen. Den Inhalt braucht er nicht, also bekommt er ihn nicht. Ein Hinweis: Eine gespeicherte eigene Regel liegt bei Ihrem Konto. Für einen Begriff, der nirgends gespeichert werden soll, nutzen Sie „Außerdem schwärzen“.
Das ist Datenminimierung in der Praxis. Artikel 25 DSGVO (EU) verlangt vom Verantwortlichen Datenschutz durch Technikgestaltung, mit Maßnahmen wie Pseudonymisierung. Nach Erwägungsgrund 78 sollen auch die Hersteller von Anwendungen ermutigt werden, den Datenschutz schon bei der Entwicklung zu berücksichtigen. Ein Werkzeug, das Ihre Datei nie erhält, besitzt keine Kopie, die es sichern oder löschen müsste.
Wie können Sie das selbst überprüfen?
Verlassen Sie sich nicht auf unser Wort. Der Bereich Netzwerk in Chrome und die Netzwerkanalyse in Firefox listen die Anfragen einer Seite auf. Laut der Chrome-Dokumentation protokollieren die Entwicklertools die Netzwerkaktivität nur, wenn sie geöffnet sind. Öffnen Sie sie also zuerst. Derselbe Test funktioniert bei jedem Online-Werkzeug.
- 1Öffnen Sie die Seite Dokumente. Drücken Sie in Chrome Strg+Umschalt+J (Mac: Befehlstaste+Wahltaste+J) und wechseln Sie in den Bereich Netzwerk. In Firefox drücken Sie Strg+Umschalt+E (Mac: Cmd+Opt+E).
- 2Legen Sie eine Testdatei ab. Dateien der Engine, etwa die OCR, können von unserer Website kommen. Das sind Downloads.
- 3Klicken Sie in Chrome auf den Filter Fetch/XHR (oder Abrufen/XHR). Die Spalte Methode ist standardmäßig ausgeblendet: Blenden Sie sie per Rechtsklick auf die Kopfzeile der Tabelle ein. Laut MDN ist POST die Methode, die Daten an den Server sendet.
- 4Klicken Sie auf Herunterladen. Eine POST-Anfrage erscheint. Ihr Tab Nutzlast (Payload) zeigt die Kennung Ihres Arbeitsbereichs und die drei Zähler.
- 5Öffnen Sie die anderen Anfragen. Keine enthält Ihre Datei, ihren Namen oder ihren Text.
Welche Formate und OCR-Sprachen werden gelesen?
| Eingabe | Wie sie gelesen wird | Was Sie erwarten können |
|---|---|---|
| PDF mit Textebene | Direkt, mit den Wortpositionen | Schnell, ohne OCR. |
| Gescanntes PDF, Foto oder Bild | OCR auf dem Gerät in Deutsch, Englisch, Französisch | Langsamer. Die Genauigkeit hängt von der Scanqualität ab. Keine Handschrift. |
| Word-Datei (.docx) | Neu auf A4-Seiten gesetzt | Seitenumbrüche können von Word abweichen. |
Der Export ist immer abgeflacht: ein PDF oder ein PNG aus Bildern. Ohne Textebene liegt unter einer Maske nichts verborgen. Der Preis dafür: Der Text lässt sich nicht mehr markieren oder durchsuchen, und eine Word-Datei kommt als PDF zurück.
Der Schwarze Marker zeichnet deckende Balken und lässt sich nicht rückgängig machen. Der Token-Modus (Pro) ersetzt jeden Wert durch einen einheitlichen Platzhalter: Aus Erika Mustermann wird überall im Dokument [NAME1]. Das ist Pseudonymisierung im Sinne von Artikel 4 Nr. 5 DSGVO, keine Anonymisierung. Kein Modus stellt das Original wieder her. Bewahren Sie Ihre Originaldatei auf.
Was erkennt das Werkzeug, und was übersieht es?
Rund 40 Detektoren arbeiten in 6 Familien: personenbezogene Daten (Namen, E-Mail-Adressen, Telefonnummern, Postanschriften, amtliche Kennnummern, Datumsangaben), Finanzdaten (IBAN, BIC, mit dem Luhn-Algorithmus geprüfte Kartennummern, Steuernummern, Beträge mit Währung), Zugangsdaten (Passwörter im Text, Einmalcodes), technische Geheimnisse (API-Schlüssel, Cloud-Token, JWT), Unternehmenskennungen (SIREN, SIRET, USt-IdNr.) und interne URLs. Technische Geheimnisse und private SSH-Schlüssel erkennt nur Pro. Die Erkennung berücksichtigt sieben Länder: FR, US, GB, BE, DE, AT, CH.
- Nur Text wird erkannt. Eine Unterschrift, ein Foto oder eine handschriftliche Notiz bleiben sichtbar.
- Es gibt keinen Detektor für medizinische Begriffe, Gehälter als solche oder Firmennamen. Ergänzen Sie diese per eigener Regel oder unter „Außerdem schwärzen“.
- Die OCR irrt sich bei unscharfen oder schiefen Scans. Ein falsch gelesenes Wort wird nicht erkannt.
- Die Erkennung ist nicht lückenlos, auch nicht bei sauberem Text. Ein ungewöhnlicher Name kann durchrutschen.
Darum gehört die Prüfung fest zum Ablauf. Sie ist keine Option. Kontrollieren Sie die Vorschau Stelle für Stelle vor dem Download. Lesen Sie den Export danach noch einmal, bevor Sie ihn weitergeben.
Was kostet das?
Stand September 2026 deckt der Free-Tarif 3 Dokumente pro Tag und 10 Seiten pro Dokument ab, mit Schwarzem Marker, Basis-Detektoren und 3 eigenen Regeln. Pro kostet 9,90 € pro Monat oder 99 € pro Jahr, zzgl. MwSt. (11,90 $ oder 119 $): unbegrenzt viele Dokumente und Seiten, Token-Modus, Detektoren für technische Geheimnisse, unbegrenzt viele eigene Regeln und Profile. Pro beginnt mit einer 7-tägigen Testphase mit hinterlegter Karte; heute wird nichts abgebucht.
Team kostet 24,90 € pro Nutzer und Monat oder 249 € pro Nutzer und Jahr, zzgl. MwSt. (28,90 $ oder 289 $), ab 3 Plätzen. Jeder Platz erhält Pro und bevorzugten E-Mail-Support. Gemeinsamer Arbeitsbereich, Einladungen, Rollen und Audit-Logs folgen bald; noch sind sie nicht verfügbar. Enterprise gibt es auf Anfrage, SSO und SCIM stehen auf der Roadmap.
Häufige Fragen
- Lädt ONYRI Sanitize mein Dokument auf einen Server hoch?
- Nein. Die Datei wird im Tab Ihres Browsers geöffnet, gelesen und geschwärzt. Beim Download erhält der Server die Kennung Ihres Arbeitsbereichs und die drei Zähler, nie die Datei, ihren Namen, ihren Text oder einen erkannten Wert.
- Schickt die OCR meinen Scan an einen Cloud-Dienst?
- Nein. Die OCR-Engine Tesseract.js läuft dank WebAssembly im Browser. Ihre Dateien kommen von unserer eigenen Website; der Scan bleibt im Tab. Sie liest gedruckten Text auf Deutsch, Englisch und Französisch, keine Handschrift.
- Ist ein mit ONYRI geschwärztes Dokument anonym im Sinne der DSGVO?
- Nicht automatisch. Schwärzen senkt das Risiko. Nach Erwägungsgrund 26 kommt es darauf an, ob eine Person mit Mitteln identifizierbar bleibt, die nach allgemeinem Ermessen wahrscheinlich genutzt werden. Der Token-Modus ist Pseudonymisierung, und pseudonymisierte Daten bleiben personenbezogene Daten.
- Kann ich aus einer geschwärzten Datei das Original zurückholen?
- Nein. Der Export ist zu Bildern abgeflacht, und eine Wiederherstellung gibt es in keinem Modus. Bewahren Sie Ihre Originaldatei sicher auf und geben Sie nur den Export weiter.
Quellen und Verweise
- Verordnung (EU) 2016/679 (DSGVO), Artikel 4 Nr. 5, Artikel 25, Erwägungsgründe 26 und 78 — EUR-Lex
- Positionspapier zur Anonymisierung unter der DSGVO unter besonderer Berücksichtigung der TK-Branche (Stand 29. Juni 2020, PDF) — Bundesbeauftragte für den Datenschutz und die Informationsfreiheit (BfDI)
- PDF.js, Plattform zum Parsen und Darstellen von PDFs (auf Englisch) — Mozilla
- Tesseract.js, OCR in JavaScript (README des Projekts, auf Englisch) — Project Naptha auf GitHub
- WebAssembly — MDN Web Docs
- POST-Anfragemethode — MDN Web Docs
- Netzwerkaktivität überprüfen — Chrome for Developers
- Referenz zu Netzwerkfunktionen (Tab Nutzlast, Filter, Spalte Methode) — Chrome for Developers
- Network Monitor (auf Englisch) — Firefox Source Docs
Maskieren Sie ein Dokument, ohne es hochzuladen
ONYRI Sanitize findet Namen, Kennungen, Bankdaten und Geheimnisse in einer PDF, einer Word-Datei oder einem Scan und maskiert sie in Ihrem Browser. Sie prüfen die Vorschau und laden dann eine reduzierte Bildkopie herunter.