Eine Excel- oder CSV-Datei anonymisieren, bevor Sie sie mit KI analysieren
Ein HR-, Kunden- oder Finanzexport enthält Dutzende personenbezogener Daten pro Zeile. Wie Sie ihn mit KI analysieren, ohne alles preiszugeben.
Um eine Excel- oder CSV-Datei mit KI zu analysieren, ohne sensible Daten preiszugeben, anonymisieren Sie die identifizierenden Spalten vor dem Senden: Jeder Wert (Name, E-Mail, Telefon, IBAN…) wird durch ein konsistentes Token ersetzt, die KI erstellt ihre Analyse auf den Tokens, und Sie stellen die echten Werte in Ihrem Browser wieder her. Die Analyse bleibt exakt; die Personen hinter den Zeilen werden nie preisgegeben.
Warum eine Tabelle ein Hochrisikofall ist
Ein HR-, Kunden- oder Buchhaltungsexport bündelt personenbezogene Daten über ganze Spalten und Hunderte von Zeilen. Ihn unverändert in einen Assistenten einzufügen bedeutet, eine Datei weiterzugeben, mit der sich Personen direkt re-identifizieren lassen — genau das, was der Grundsatz der Datenminimierung verhindern soll.
- Identitätsspalten: Vor-/Nachname, E-Mail, Telefon, Adresse.
- Finanzspalten: IBAN, Gehalt, Steuernummer.
- HR-Spalten: Personalnummer, Status, möglicherweise Gesundheitsdaten.
- Querbezüge: Selbst oberflächlich anonymisiert, re-identifizieren kombinierte Spalten.
Die Methode, Spalte für Spalte
- 1Erkennen Sie die identifizierenden Spalten (direkt und indirekt).
- 2Tokenisieren Sie: Derselbe Wert erhält immer dasselbe Token (Aggregate bleiben korrekt).
- 3Führen Sie Ihre Analyse (Zusammenfassung, Trend, Kategorisierung) auf dem tokenisierten Text durch.
- 4Stellen Sie die Ausgabe in Ihrem Browser wieder her, um die Ergebnisse den echten Zeilen zuzuordnen.
Die Analyse exakt halten
Das Ziel ist nicht, die Daten zu verschlechtern, sondern die Kennung zu entfernen. Beträge, Daten und Kategorien können bleiben (je nach Bedarf), während Identitäten zu Tokens werden. Sie erhalten eine getreue Analyse, ohne preiszugeben, wer wer ist.
Der Tabellenbereich von ONYRI Sanitize wendet diesen Ablauf in großem Maßstab an (Web-Worker-Verarbeitung ab 1.000 Zeilen), mit länderabhängiger Erkennung und der Möglichkeit, eigene sensible Spalten hinzuzufügen.
Häufig gestellte Fragen
- Verfälscht die Anonymisierung meine Statistiken?
- Nein, sofern die Tokens konsistent sind: Derselbe Wert behält dasselbe Token, sodass Zählungen, Durchschnittswerte pro Gruppe und Gruppierungen korrekt bleiben. Nur die Identitäten werden ersetzt.
- Muss ich die gesamte Datei anonymisieren?
- Nur die identifizierenden Spalten (direkt und indirekt). Rein numerische, nicht identifizierende Spalten können oft bleiben, je nach Ihrer Analyse und interner Richtlinie.
- Und was ist mit großen Dateien?
- Eine Hintergrundverarbeitung im Browser (Web Worker) anonymisiert Tausende von Zeilen, ohne die Oberfläche zu blockieren — und ohne dass die Datei Ihren Rechner verlässt.
Quellen & Referenzen
Behalten Sie Ihre sensiblen Daten in Ihrem Browser
ONYRI Sanitize erkennt und maskiert Ihre sensiblen Daten, bevor sie die KI erreichen, und stellt anschließend die Antwort wieder her — vom Namen bis zum API-Schlüssel.