Diese 8 sensiblen Dateien sollten Sie niemals in eine KI hochladen
Laden Sie niemals eine Kundentabelle, einen Vertrag, einen Finanzbericht oder eine Patientenakte in eine öffentliche KI. Hier sind die 8 riskantesten Dateien, sortiert, samt Lösung.
Manche Dateien sollten Sie niemals in eine öffentliche KI hochladen. Eine Datei ist kein Prompt. Eine einzige Tabelle kann Tausende Namen, E-Mail-Adressen und Nummern enthalten. Ein einziger Upload kann weit mehr preisgeben als ein getippter Satz. Hier sind die acht riskantesten Dateien, sortiert vom Schlimmsten zum am wenigsten Schlimmen. Die Regel ist einfach. Wenn eine Datei vor dem Teilen geschwärzt werden müsste, laden Sie sie nicht hoch — anonymisieren Sie sie zuerst.
Die Rangfolge auf einen Blick
Hier ist die Rangfolge, vom höchsten zum niedrigsten Risiko. Risiko verbindet hier zwei Dinge. Wie viele sensible Daten die Datei enthält. Und wie schwer ein Leck wiegen würde. Jede Zeile zeigt außerdem, wie ONYRI diese Datei vor dem Upload abdeckt.
- 1Tabellen mit Kunden- oder Mitarbeiterdaten. Eine einzige Datei kann Zehntausende Zeilen personenbezogener Daten enthalten. ONYRI analysiert Tabellen Zelle für Zelle und maskiert jeden Wert.
- 2Verträge und juristische Dokumente. Sie tragen Geschäftsgeheimnisse, Klauseln und namentlich genannte Parteien. ONYRI maskiert Namen, Firmen und Kennungen vor dem Upload.
- 3Finanzberichte und Steuerunterlagen. Bankdaten und Zahlen öffnen den Weg zum Betrug. ONYRI maskiert Kontonummern, IBANs und Beträge.
- 4Patientenakten. Gesundheitsdaten gehören zu den am stärksten geschützten überhaupt, und ein öffentlicher Chatbot unterzeichnet keinen Gesundheitsvertrag. ONYRI erkennt zuerst medizinische Details.
- 5Personalakten: Lohnabrechnungen und Leistungsbeurteilungen. Sie vermischen Gehälter, Adressen und private Notizen über echte Menschen. ONYRI maskiert Namen, Vergütungen und Kontaktdaten.
- 6Quellcode und Konfigurationsdateien mit Geheimnissen. Ein einziger geleakter Schlüssel kann Ihr ganzes System öffnen — das schädlichste einzelne Leck der Liste. ONYRI erkennt API-Schlüssel, Tokens und Zugangsdaten.
- 7Scans von Ausweisdokumenten: Reisepässe und Führerscheine. Eine gestohlene Ausweisnummer befeuert den Identitätsdiebstahl. ONYRI erkennt Ausweis- und Dokumentnummern.
- 8Strategische und interne Dokumente: Vorstandsunterlagen und Roadmaps. Sie liefern Ihre Pläne an jeden aus, der sie liest. ONYRI maskiert interne Namen, Projekte und Zahlen.
| Rang | Element | Warum es riskant ist |
|---|---|---|
| 1 | Kunden- / Mitarbeitertabellen | Zehntausende Zeilen mit PII in einer Datei |
| 2 | Verträge, juristische Dokumente | Ein enthülltes Geheimnis verliert für immer seinen Wert |
| 3 | Finanzberichte, Steuerunterlagen | Bankdaten öffnen den Weg zum Betrug |
| 4 | Patientenakten | Hochgeschützte Daten; kein Gesundheitsvertrag |
| 5 | Personalakten (Lohn, Beurteilungen) | Gehälter und private Notizen über echte Menschen |
| 6 | Quellcode, Konfig mit Geheimnissen | Ein geleakter Schlüssel kann Ihr ganzes System öffnen |
| 7 | Ausweisscans (Pass, Führerschein) | Eine gestohlene Ausweisnummer befeuert Identitätsdiebstahl |
| 8 | Strategische, interne Dokumente | Liefern Ihre Pläne an jeden, der sie liest |
Die Spitze der Liste: die am stärksten exponierten Dateien
Rang eins ist die Kundentabelle. Hier schlägt eine Datei einen Prompt bei Weitem. Ein einziges Blatt kann Zehntausende Zeilen über viele Spalten hinweg enthalten. Jede Zelle ist ein personenbezogenes Datum. Ein Upload trägt also weit mehr als ein ganzer Tag Tippen. Keine menschliche Prüfung skaliert auf dieses Volumen. Im IBM-Bericht 2024 über Datenschutzverletzungen war das personenbezogene Datum der Kunden der Datensatztyp, der in den meisten Verletzungen auftauchte — in 46 % davon. Firmen, die es verloren, sahen sich schärferer behördlicher Kontrolle und Bußgeldern gegenüber. Derselbe Bericht bezifferte die durchschnittlichen Kosten einer Verletzung auf 4,88 Millionen Dollar, plus 10 % in einem Jahr. Unser Leitfaden zum Anonymisieren einer Tabelle vor der KI zeigt, wie Sie eine schnell bereinigen.
Dann kommen Verträge und Finanzdateien. Ein Vertrag enthält Geschäftsgeheimnisse, Preise und namentlich genannte Parteien. Ist ein Geheimnis erst einmal draußen, kann es für immer seinen Wert verlieren. Finanz- und Steuerdateien fügen ein weiteres Risiko hinzu. Bankdaten und Zahlen geben Betrügern einen direkten Weg. Der IBM-Bericht 2024 bezifferte einen gestohlenen Datensatz geistigen Eigentums auf 173 Dollar, plus fast 11 % in einem Jahr. Bevor Sie Vertragsklauseln in einen Chatbot einfügen, lesen Sie unsere Notiz dazu, ob es sicher ist, KI für Verträge zu nutzen.
Patientenakten stehen aus gutem Grund weit oben. Gesundheitsdaten gehören zu den am stärksten geschützten Kategorien im Gesetz. Öffentliche Chatbots wie ChatGPT sind nicht HIPAA-konform. HIPAA ist das US-amerikanische Datenschutzgesetz im Gesundheitswesen. Diese Werkzeuge unterzeichnen kein Business Associate Agreement, den Vertrag, den Gesundheitsdaten verlangen. Das Eingeben von Gesundheitsinformationen von Patienten kann daher als unbefugte Offenlegung gelten — faktisch eine Datenschutzverletzung.
Der Rest der Liste: Personal, Code und Ausweise
Personalakten runden die Risiken bei personenbezogenen Daten ab. Lohnabrechnungen listen Gehälter auf. Beurteilungen enthalten ungeschönte Notizen über namentlich genannte Mitarbeiter. Das sind die privaten Angaben anderer Menschen, die Ihnen anvertraut wurden. Laden Sie sie hoch, geben Sie Daten preis, die nicht Ihre zu teilen sind.
Quellcode und Konfigurationsdateien sind ein Sonderfall. Sie verbergen oft ein Geheimnis in aller Öffentlichkeit — einen API-Schlüssel, ein Token, ein Passwort. Ein einziger geleakter Schlüssel kann Ihr ganzes System öffnen. Das Ausmaß ist real. GitGuardian scannte 1,1 Milliarden öffentliche GitHub-Commits für 2023. Es fand 12,8 Millionen neu geleakte Geheimnisse, plus 28 % in einem Jahr. Es sah außerdem einen Anstieg der geleakten OpenAI-Schlüssel um das 1.212-Fache. Und über 90 % der offengelegten Geheimnisse funktionierten fünf Tage nach dem Leck noch. 2023 fügten Samsung-Ingenieure Halbleiter-Quellcode und Besprechungsnotizen in ChatGPT ein. Samsung verbot daraufhin generative KI auf Firmengeräten.
Dann kommen Scans von Ausweisdokumenten. Ein Reisepass oder Führerschein trägt eine Nummer, die beweisen soll, wer Sie sind. Die US-amerikanische Federal Trade Commission erklärt, wie Diebe gestohlene Identitätsdaten nutzen. Sie eröffnen Konten, reichen Steuererklärungen ein, erhalten medizinische Versorgung oder nehmen Kredite in Ihrem Namen auf. Die FTC verweist Opfer zur Meldung an IdentityTheft.gov.
Zuletzt kommen strategische und interne Dokumente. Vorstandsunterlagen und Roadmaps enthalten Ihre Pläne und Ihre Schwachstellen. Sie enthalten selten Ihre eigenen personenbezogenen Daten. Aber sie können einem Wettbewerber Ihren nächsten Schritt liefern. Das Samsung-Leck umfasste interne Besprechungsnotizen, nicht nur Code.
Es gibt einen tieferen Grund, warum Dateien riskant sind. Bei Verbrauchertarifen können Ihre Inhalte zum Training des Modells genutzt werden, sofern Sie nicht widersprechen. OpenAI gibt an, dass seine Geschäftsprodukte — Business, Enterprise und die API — standardmäßig nicht zum Training genutzt werden. Der temporäre Chat wird weder gespeichert noch zum Training verwendet. Unser Artikel dazu, ob es sicher ist, Dokumente in ChatGPT hochzuladen, geht darauf näher ein.
So nutzen Sie das: die Lösung
Die Lösung ist nicht, KI zu meiden. Sie besteht darin, die Datei zuerst zu bereinigen. Dieser Schritt heißt Datenminimierung. Sie entfernen oder maskieren Kennungen, bevor die Datei Ihren Rechner verlässt. Je weniger personenbezogene Daten Sie senden, desto kleiner Ihr Risiko. Unser Leitfaden zum Anonymisieren eines Dokuments vor der KI führt Sie durch die Schritte.
Das Gesetz stützt das. Nach der DSGVO sind vollständig anonymisierte Daten keine personenbezogenen Daten mehr. Doch pseudonymisierte Daten gelten weiterhin als personenbezogen — durch Tokens ersetzte Kennungen bleiben reguliert. Maskieren ist also kein Zauberstab. Der echte Gewinn ist einfach: senden Sie weniger und behalten Sie die Verbindung zwischen Token und Wert bei sich.
- Laden Sie niemals eine rohe Kunden- oder Personaltabelle hoch — maskieren Sie zuerst die Spalten.
- Entfernen Sie API-Schlüssel und Passwörter aus jeder Code- oder Konfigurationsdatei.
- Entfernen Sie Namen, Kennungen und Kontonummern aus Verträgen und Finanzdateien.
- Eine Gesundheits- oder Ausweisdatei fügen Sie überhaupt nicht in einen Verbraucher-Chatbot ein.
- Im Zweifel machen Sie den Schwärzungstest: Würden Sie diese Datei öffentlich teilen?
Genau das leistet ONYRI Sanitize. Es erkennt sensible Daten in Text und Tabellen und ersetzt dann jeden Wert durch ein umkehrbares Token. Die Erkennung und das Mapping Token↔Wert bleiben in Ihrem Browser. Nur anonymisierter Text erreicht das Werkzeug. Ob Sie ChatGPT, Claude oder Gemini nutzen — es sieht nur Tokens, niemals Ihre echten Dateien.
Häufig gestellte Fragen
- Ist es sicher, Dateien in ChatGPT hochzuladen?
- Nicht ohne Vorsicht. Eine Datei trägt oft weit mehr personenbezogene Daten als ein getippter Prompt: Eine einzige Tabelle kann Zehntausende Zeilen aneinanderreihen. Bei Verbraucherkonten können Ihre Inhalte in das Training einfließen, sofern Sie nicht widersprechen, und gespeicherte Daten können geprüft oder gehackt werden. Die sichere Regel: Anonymisieren Sie die Datei vor dem Senden oder nutzen Sie einen Geschäftstarif mit Vertrag.
- Welche Dateien sollten Sie niemals in eine KI hochladen?
- Vor allem acht: Kunden- oder Mitarbeitertabellen, Verträge und juristische Dokumente, Finanz- und Steuerberichte, Patientenakten, Personalakten, Quellcode mit Geheimnissen, Scans von Ausweisdokumenten und interne strategische Dokumente. Jede legt entweder personenbezogene Daten Dritter oder ein Geheimnis offen, dessen Leck sich nicht rückgängig machen lässt.
- Wie kann ich KI auf eine sensible Datei anwenden, ohne sie offenzulegen?
- Wenden Sie Minimierung an: Behalten Sie nur das Nötige und maskieren Sie Kennungen vor dem Senden. Eine Anonymisierungs-Engine ersetzt jeden sensiblen Wert durch ein umkehrbares Token im Browser, in Text wie in Tabellen gleichermaßen. Die KI erhält dann nur anonymisierten Inhalt, niemals die echten Werte in der Datei.
Quellen & Referenzen
- Cost of a Data Breach Report 2024 — zentrale Ergebnisse (Durchschnittskosten 4,88 Mio. $, +10 %; Kunden-PII am häufigsten verletzter Datensatztyp, 46 %; gestohlener IP-Datensatz 173 $) — IBM
- The State of Secrets Sprawl 2024 (12,8 Mio. geleakte Geheimnisse 2023, +28 %; 1.212-facher Anstieg der OpenAI-Schlüssel; über 90 % fünf Tage später noch gültig) — GitGuardian
- What To Know About Identity Theft (wie gestohlene Identitätsdaten genutzt werden; Meldung unter IdentityTheft.gov) — U.S. Federal Trade Commission
Behalten Sie Ihre sensiblen Daten in Ihrem Browser
ONYRI Sanitize erkennt und maskiert Ihre sensiblen Daten, bevor sie die KI erreichen, und stellt anschließend die Antwort wieder her — vom Namen bis zum API-Schlüssel.