Gescannte Dokumente und OCR in ONYRI Sanitize: So funktioniert es, und das sind die Grenzen
ONYRI Sanitize liest gescannte PDFs und Fotos mit geräteinterner OCR auf Deutsch, Englisch und Französisch und blockiert unlesbare Seiten.
Ein gescanntes PDF oder ein Foto ist nur ein Bild, ohne echten Text darunter, den man markieren könnte. ONYRI Sanitize liest dieses Bild mit geräteinterner OCR, der optischen Zeichenerkennung, und schwärzt dann, was sie findet. Die gesamte Erkennung läuft in Ihrem Browser. Ist eine Seite zu unscharf für ein verlässliches Ergebnis, blockiert ONYRI den Download, statt Ihnen eine Datei zu geben, die den Namen noch zeigt.
Wie funktioniert die geräteinterne OCR?
OCR betrachtet die Formen auf einer Seite und macht daraus echte Buchstaben und Zahlen. ONYRI führt diesen Schritt in Ihrem Browser aus, mit Tesseract, einer Open-Source-Engine, die auch viele andere datenschutzbewusste Werkzeuge nutzen. Nichts, was Sie scannen, wird irgendwohin hochgeladen. Das Bild, der erkannte Text und das geschwärzte Ergebnis bleiben auf Ihrem Gerät, und die Zuordnung verschwindet, sobald Sie die Seite neu laden.
- Sie fügen ein PDF, eine Word-Datei oder ein Foto hinzu.
- ONYRI prüft jede Seite. Eine Seite mit echter Textebene wird direkt gelesen, ohne OCR.
- Eine Seite ohne Textebene, wie ein Scan oder ein Foto, durchläuft stattdessen die OCR.
- Die OCR liest Deutsch, Englisch und Französisch gleichzeitig, automatisch.
- Der erkannte Text durchläuft danach genau dieselben Erkennungsregeln wie ein getipptes Dokument.
Welche Seiten durchlaufen wirklich die OCR?
Nicht jede Seite braucht OCR. Ein Text-PDF, bei dem Sie schon einen Satz markieren und kopieren können, hat eine Textebene, die ONYRI direkt liest. Das ist schneller und genauer als OCR. Die OCR greift nur bei einer PDF-Seite ohne nutzbare Textebene. Ebenso greift sie bei jedem Bild, das Sie hinzufügen, etwa dem Foto eines Mietvertrags oder eines gescannten Ausweises.
Was liest diese OCR nicht?
Die OCR hat echte Grenzen, und ONYRI verschweigt sie nicht. Handschrift wird gar nicht gelesen, eine handschriftliche Notiz oder eine Unterschrift bleibt also genau so, wie sie gescannt wurde. Die Qualität des Scans zählt genauso. Ein schiefes Foto, ein dunkler Raum oder ein unscharfer Mietvertrag verlangsamen die OCR und lassen sie mehr übersehen. Derzeit unterstützt die Engine Deutsch, Englisch und Französisch, sonst nichts.
| Quelle | Empfehlung für eine Textseite |
|---|---|
| Dokumentation des Tesseract-Projekts | Mindestens 300 dpi, die Seite so gerade wie möglich |
| BSI, Technische Richtlinie TR-03138 | 300 dpi genügen laut BSI für typische Dokumente |
| Ein Foto vom Smartphone | Oft schon weit über 300 dpi, aber Unschärfe und Schräglage stören die OCR mehr als die Auflösung |
Wie scannen Sie, damit mehr erkannt wird?
- 1Legen Sie die Seite flach hin. Eine gewölbte Seite in einem gebundenen Heft verwischt die Linien, die die OCR braucht.
- 2Halten Sie die Seite gerade. Laut Tesseracts eigener Dokumentation schadet eine schiefe Seite dem Ergebnis erheblich.
- 3Nutzen Sie gutes Licht und echten Kontrast. Dunkle Tinte auf weißem Papier liest sich weit besser als eine verblasste Kopie einer Kopie.
- 4Scannen Sie Text mit mindestens 300 dpi. Eine niedrigere Einstellung spart Speicherplatz, kostet aber die Details, auf die die OCR angewiesen ist.
- 5Halten Sie die ganze Seite im Bild. Ein abgeschnittener Rand kann genau die Stelle kappen, die geschwärzt werden soll, etwa eine IBAN am unteren Rand eines Kontoauszugs.
Was sollten Sie vor dem Download prüfen?
Die OCR hat nicht das letzte Wort. ONYRI zeigt eine Vorschau Seite für Seite und eine Liste jedes erkannten Werts, gruppiert nach Familie, etwa Namen, E-Mails oder Ausweisnummern. Jeder Wert hat sein eigenes Kästchen, sodass Erika Mustermann ihren eigenen Namen auf einer Deckseite sichtbar lassen kann, wenn sie das möchte.
- 1Lesen Sie jede Seite der Vorschau, nicht nur die erste.
- 2Öffnen Sie die Liste der erkannten Daten und suchen Sie nach einem Fehltreffer oder einem übersehenen Wert.
- 3Achten Sie auf die Warnung, dass ein Wert nicht platziert werden konnte. Prüfen Sie diese Stelle selbst.
- 4Wechseln Sie zwischen Schwarzer Balken und Token-Modus, wenn die erste Wahl nicht passt.
- 5Laden Sie erst herunter, wenn die Vorschau stimmt. Der Export ist gerastert, eine nachträgliche Änderung ist nicht möglich.
Die OCR bringt einen Scan näher an ein normales Dokument, aber die Schwärzung bleibt deshalb nicht perfekt. Die Erkennung ist nicht erschöpfend, ein grober Scan kann der Engine weiterhin einen Namen verbergen, und die Vorschau zu prüfen bleibt Ihre Aufgabe. Behandeln Sie die OCR als Vorsprung, nie als letzte Kontrolle.
Häufige Fragen
- Lädt ONYRI Sanitize mein gescanntes Dokument auf einen Server hoch?
- Nein. Die OCR läuft wie der Rest der Verarbeitung in Ihrem Browser. Der Server erhält nur Nutzungszähler, etwa die Anzahl bearbeiteter Dokumente oder Seiten, niemals die Datei, ihren Text oder einen erkannten Wert.
- Kann die OCR Handschrift lesen?
- Nein, sie liest nur gedruckten oder getippten Text. Eine handschriftliche Notiz, eine Unterschrift oder ein von Hand ausgefülltes Formularfeld bleibt genau so, wie sie gescannt wurde. Prüfen Sie diese Stellen also selbst, bevor Sie die Datei teilen.
- Warum wurde mein Dokument blockiert statt anonymisiert?
- Eine Seite blockiert den Export, wenn ihr eine nutzbare Textebene fehlt und auch die OCR kein brauchbares Ergebnis liefert. Das ist eine Sicherheitsregel. ONYRI stoppt lieber, als Ihnen eine Datei zu geben, die geschwärzt wirkt, den ursprünglichen Text darunter aber noch zeigt.
- Welche Sprachen unterstützt die OCR?
- Deutsch, Englisch und Französisch, alle gleichzeitig. ONYRI prüft alle drei bei jedem Scan, Sie müssen also nichts vorher auswählen. Bei einem Dokument in einer anderen Sprache bleibt die Erkennung trotzdem schwächer.
- Erkennt ein Scan mit höherer Auflösung immer mehr?
- Meist nur bis zu einem gewissen Punkt. Stellen wie Tesseract oder das BSI nennen für Textseiten etwa 300 dpi als sinnvolles Minimum. Danach zählt ein gerader, gut beleuchteter, scharfer Scan mehr als zusätzliche Auflösung.
Quellen und Verweise
- Technische Richtlinie TR-03138, Ersetzendes Scannen, häufig gestellte Fragen — Bundesamt für Sicherheit in der Informationstechnik (BSI)
- Hinweise zum Schwärzen von Dokumenten — Landesbeauftragte für den Datenschutz Niedersachsen
- Improve the quality of the output — Tesseract OCR (Projektdokumentation)
Maskieren Sie ein Dokument, ohne es hochzuladen
ONYRI Sanitize findet Namen, Kennungen, Bankdaten und Geheimnisse in einer PDF, einer Word-Datei oder einem Scan und maskiert sie in Ihrem Browser. Sie prüfen die Vorschau und laden dann eine reduzierte Bildkopie herunter.