Was Sie schwärzen sollten, bevor Sie ein Dokument in eine KI hochladen
Vertrag, Lebenslauf, Arztbrief, Logdatei: Was Sie vor dem Hochladen in einen KI-Assistenten entfernen sollten und warum Platzhalter helfen.
Bevor Sie ein Dokument in einen KI-Assistenten hochladen, machen Sie alles unkenntlich, was auf eine echte Person verweist oder Zugang zu einem System gewährt: Namen, Kontaktdaten, Ausweis- und Kontonummern, Gesundheitsdaten, Passwörter und Schlüssel. Schwärzen Sie auch Geheimnisse Ihres Arbeitgebers und Ihrer Kunden. Nutzen Sie einheitliche Platzhalter wie [NAME1] statt schwarzer Balken. So versteht der Assistent weiterhin, wer was getan hat.
Dieser Leitfaden behandelt Vertrag, Lebenslauf, Arztbrief und Logdatei. Er fasst auch zusammen, was fünf KI-Anbieter im September 2026 zu Ihren Daten angaben. Diese Bedingungen ändern sich, prüfen Sie sie also erneut.
Welche sensiblen Daten stecken in einem typischen Geschäftsdokument?
Mehr, als Sie denken. Die meisten Dokumente enthalten mehrere dieser Datenarten:
- Direkte Kennungen: vollständige Namen, Unterschriften, Fotos.
- Kontaktdaten: E-Mail-Adressen, Telefonnummern, Anschriften.
- Amtliche Nummern: Personalausweis, Reisepass, Sozialversicherungsnummer, Steuer-ID.
- Geld: IBAN, Kartennummern, Gehälter, Preise.
- Besondere Kategorien nach Art. 9 DSGVO (EU), etwa Gesundheitsdaten oder Gewerkschaftszugehörigkeit.
- Zugangsgeheimnisse: Passwörter, API-Schlüssel, Token, interne URLs.
- Geschäftsgeheimnisse: Kundennamen, Margen, Vertragskonditionen.
Dazu kommt, was Sie nicht sehen. Laut Microsoft kann eine Word-Datei Kommentare, Überarbeitungen, den Namen des Autors und ausgeblendeten Text enthalten. Laut Adobe kann ein PDF Metadaten, Kommentare und ausgeblendete Ebenen verbergen. Wer die Datei hochlädt, lädt all das mit hoch.
Schwärzen oder lieber einheitliche Platzhalter nutzen?
Das hängt davon ab, was Sie zurückbekommen möchten. Ein schwarzer Balken entfernt den Wert endgültig. Das passt für eine Nummer, die niemand braucht, etwa eine IBAN. In einem Vertrag voller Balken kann der Assistent aber Käufer und Verkäufer nicht mehr unterscheiden.
Einheitliche Platzhalter lösen das Problem: Derselbe Wert bekommt immer denselben Platzhalter. Erika Mustermann wird überall zu [NAME1], die Muster GmbH zu [FIRMA1]. Der Assistent kann weiterhin antworten: [NAME1] muss gegenüber [FIRMA1] eine Frist von 30 Tagen einhalten. Die Antwort lesen Sie mit dem Original daneben.
Die DSGVO (EU) nennt das Pseudonymisierung. Art. 4 Nr. 5 DSGVO beschreibt sie als Verarbeitung, nach der Daten ohne zusätzliche, gesondert aufbewahrte Informationen keiner Person mehr zugeordnet werden können. Laut Erwägungsgrund 26 bleiben pseudonymisierte Daten personenbezogen. Platzhalter senken das Risiko, das Datenschutzrecht gilt aber weiter.
Was machen KI-Anbieter mit hochgeladenen Dateien?
Das hängt vom Anbieter ab und noch mehr vom Tarif. So stand es im September 2026 in der Dokumentation der Anbieter.
- OpenAI: Laut Hilfecenter kann OpenAI Ihre ChatGPT-Unterhaltungen zum Training nutzen, solange Sie das in den Datenkontrollen nicht abschalten. Daten aus ChatGPT Business, Enterprise, Edu und der API werden standardmäßig nicht genutzt.
- Anthropic: Laut Privacy Center dienen Chats von Privatnutzern nur dann dem Training, wenn Sie das erlauben. Für eine Sicherheitsprüfung markierte Chats können aber Sicherheitssysteme trainieren. Claude for Work und die API werden standardmäßig nicht genutzt.
- Google: Laut Privacy Hub für Gemini-Apps können Chats bei aktivierter Einstellung „Aktivitäten speichern“ zum KI-Training beitragen. Menschliche Prüfer sehen einen Teil davon, vom Konto getrennt. Geprüfte Chats bleiben bis zu drei Jahre gespeichert. Google bittet, nichts Vertrauliches einzugeben.
- Microsoft: Laut Dokumentation werden Prompts, Antworten und Microsoft-Graph-Daten aus Microsoft Copilot für Unternehmen (früher Microsoft 365 Copilot) nicht zum Training von Basismodellen genutzt.
- Mistral: Laut Hilfecenter dienen Daten aus Vibe (früher Le Chat) standardmäßig dem Training, solange Sie nicht widersprechen, außer bei Enterprise-Kunden.
Daraus folgen drei Lehren. Erstens: „Kein Training“ heißt nicht „nicht gespeichert“ oder „nie gelesen“. Zweitens: Laut OpenAI, Anthropic und Mistral kann ein Daumen hoch oder runter das Training mit diesem Chat erlauben. Drittens: Diese Seiten ändern sich. Lesen Sie die aktuelle Fassung für Ihren Tarif, und notieren Sie das Datum.
Was verlangen Unternehmensrichtlinie und Verschwiegenheitspflichten?
Das Versprechen eines Anbieters ersetzt Ihre eigenen Pflichten nicht. Gehört das Dokument Ihrem Arbeitgeber oder einem Kunden, klären Sie zuerst, ob Sie es überhaupt weitergeben dürfen.
Die DSK empfiehlt klare, dokumentierte interne Weisungen, ob, unter welchen Voraussetzungen und wofür welche KI-Anwendungen genutzt werden dürfen. Der Hamburgische Datenschutzbeauftragte geht in seiner Checkliste vom 13. November 2023 weiter: Behält sich der Anbieter eine Nutzung für eigene Zwecke vor, dürfen grundsätzlich keine personenbezogenen Daten eingegeben werden. Die Datenminimierung (Art. 5 DSGVO, EU) weist in dieselbe Richtung.
Für Ärzte, Rechtsanwälte, Steuerberater und andere Berufsgeheimnisträger kommt in Deutschland § 203 StGB hinzu. Wer ein anvertrautes fremdes Geheimnis unbefugt offenbart, riskiert Freiheitsstrafe bis zu einem Jahr oder Geldstrafe.
Was sollten Sie je nach Dokumenttyp schwärzen?
Nehmen Sie diese Tabelle als Ausgangspunkt. Die letzte Spalte zählt ebenso: Wenn Sie alles schwärzen, ist die Antwort wertlos.
| Dokument | Schwärzen oder ersetzen | Oft vergessen | Behalten, damit die Antwort nützt |
|---|---|---|---|
| Vertrag | Parteien, Unterzeichner, Anschriften, Handelsregister- und USt-IdNr., IBAN, geheime Preise | Paraphen, Überarbeitungen, Kommentare | Klauselnummern, Fristen, Rollen als Platzhalter |
| Lebenslauf | Name, Foto, E-Mail, Telefon, Anschrift, Geburtsdatum | Links zu Profilen, Referenzgeber, Autorenfeld der Datei | Fähigkeiten, Stellenbezeichnungen, Berufsjahre |
| Arztbrief | Patient, Geburtsdatum, Versichertennummer, Ärztin, Klinik | Briefkopf, Stempel, Fallnummer, seltene Diagnose plus kleiner Ort | Nur die medizinische Frage, am besten neu getippt |
| Logdatei | API-Schlüssel, Token, Passwörter, E-Mail-Adressen, IP-Adressen | Interne Hostnamen, Benutzerkennungen in Pfaden und URLs | Zeitstempel, Fehlercodes, Reihenfolge der Ereignisse |
Wie bereiten Sie ein Dokument Schritt für Schritt vor?
- 1Arbeiten Sie mit einer Kopie. Das Original brauchen Sie, um die Antwort zu lesen.
- 2Fragen Sie sich, ob der Assistent das Dokument überhaupt braucht. Oft genügt eine neu getippte Frage ohne echte Daten.
- 3Prüfen Sie Ihre Unternehmensrichtlinie und die Bedingungen des Anbieters für Ihren Tarif.
- 4Entfernen Sie verborgene Daten: in Word mit der Dokumentprüfung, in Acrobat Pro mit der Bereinigungsfunktion (Sanitize).
- 5Ersetzen Sie Personen und Firmen durch einheitliche Platzhalter. Schwärzen Sie unnötige Nummern mit einer echten Schwärzungsfunktion, nicht mit einem Rechteck darüber.
- 6Lesen Sie die fertige Datei Zeile für Zeile, und achten Sie auf Hinweise wie Funktion plus Arbeitgeber.
Bei langen Dateien sparen Erkennungswerkzeuge Zeit. ONYRI Sanitize ist eines davon: eine Web-App, die Werte im Browser erkennt und unkenntlich macht, ohne die Datei hochzuladen. Der Export ist ein PDF oder PNG aus reinen Bildern, ohne Textebene. Schwarze Balken gibt es in jedem Tarif, einheitliche Platzhalter im Pro-Tarif.
Das Werkzeug hat Grenzen. Die Erkennung ist nicht lückenlos, und es gibt keinen Detektor für medizinische Begriffe oder Firmennamen: Diese tragen Sie selbst ein. Das Original lässt sich aus dem Export nicht wiederherstellen. Prüfen Sie also jeden Treffer in der Vorschau, und behalten Sie Ihr Original.
Egal welches Werkzeug: Geben Sie so wenig wie möglich weiter, setzen Sie Platzhalter, wo die Antwort sie braucht, und prüfen Sie die Datei selbst, bevor sie Ihren Rechner verlässt.
Häufige Fragen
- Kann man ein vertrauliches PDF gefahrlos in ChatGPT, Claude oder Gemini hochladen?
- Das hängt von Ihrem Tarif, Ihrer Unternehmensrichtlinie und dem Inhalt ab. Im September 2026 konnten Anbieter Chats aus Privattarifen je nach Einstellung zum Training nutzen, aus Unternehmenstarifen standardmäßig meist nicht. Dateien können trotzdem gespeichert werden. Schwärzen Sie das Dokument zuerst, und klären Sie, ob Sie es weitergeben dürfen.
- Ist ein geschwärztes Dokument anonym im Sinne der DSGVO?
- Nicht automatisch. Nach Erwägungsgrund 26 DSGVO (EU) bleiben pseudonymisierte Daten personenbezogen, und der Zusammenhang kann eine Person erkennbar machen. Behandeln Sie die geschwärzte Datei als personenbezogen.
- Löst das Abschalten des Trainings das Problem?
- Nur zum Teil. Google etwa speichert Chats bei deaktivierter Einstellung „Aktivitäten speichern“ weiterhin 72 Stunden, und menschliche Prüfer können sie zu Schutzzwecken sehen. Ihre Verschwiegenheitspflichten bleiben ohnehin bestehen.
- Was gilt für Scans und Fotos von Dokumenten?
- Behandeln Sie sie wie jedes andere Dokument: Viele Assistenten lesen Text in Bildern. Schwärzen Sie das Bild selbst, und achten Sie auf Briefköpfe, Stempel, Unterschriften und handschriftliche Notizen. Automatische Werkzeuge lesen Handschrift oft nicht. Prüfen Sie diese Stellen selbst.
Quellen und Verweise
- Orientierungshilfe Künstliche Intelligenz und Datenschutz, Version 1.0 vom 6. Mai 2024 — Datenschutzkonferenz (DSK)
- Checkliste zum Einsatz LLM-basierter Chatbots (13. November 2023) — Der Hamburgische Beauftragte für Datenschutz und Informationsfreiheit
- Verordnung (EU) 2016/679 (DSGVO): Art. 4, 5 und 9, Erwägungsgrund 26 — EUR-Lex
- § 203 StGB Verletzung von Privatgeheimnissen — Bundesministerium der Justiz, Gesetze im Internet
- How your data is used to improve model performance (englisch) — OpenAI Help Center
- Is my data used for model training? Tarife für Privatnutzer (englisch) — Anthropic Privacy Center
- Is my data used for model training? Kommerzielle Produkte (englisch) — Anthropic Privacy Center
- Privacy Hub für Gemini-Apps — Google
- Data, Privacy, and Security for Microsoft Copilot (englisch) — Microsoft Learn
- Do you use my user data to train your Artificial Intelligence models? (englisch) — Mistral AI Help Center
- Entfernen von ausgeblendeten Daten und persönlichen Informationen durch Prüfen von Dokumenten — Microsoft Support
- Sanitize PDFs and remove hidden content in Acrobat Pro (englisch) — Adobe
Maskieren Sie ein Dokument, ohne es hochzuladen
ONYRI Sanitize findet Namen, Kennungen, Bankdaten und Geheimnisse in einer PDF, einer Word-Datei oder einem Scan und maskiert sie in Ihrem Browser. Sie prüfen die Vorschau und laden dann eine reduzierte Bildkopie herunter.