ChatGPT ou Copilot peuvent-ils anonymiser un document ?
Un assistant peut remplacer les noms par des étiquettes, mais seulement après avoir lu le fichier brut. Ce qu'il rate, où va votre document, et l'ordre sûr.
Oui, un assistant peut réécrire un texte avec des étiquettes à la place des noms, mais seulement après avoir lu le document non masqué. Cette divulgation est justement ce que vous vouliez éviter. Et il renvoie un nouveau texte, pas une copie sûre de votre fichier : masquez d'abord sur votre propre appareil.
Qu'est-ce qui coince quand on demande à un assistant d'anonymiser ?
Trois choses posent problème, et la première arrive avant même que l'anonymisation commence.

- La divulgation passe en premier. L'assistant lit en clair chaque nom, numéro et adresse avant d'en cacher un seul.
- Le résultat est une réécriture. Dans une simple conversation, l'assistant écrit un nouveau texte. Il ne dessine pas de masques sur vos pages. Un tampon, une signature ou une photo dans un scan ne sont pas couverts par une réécriture.
- Les oublis sont invisibles. Si l'assistant saute un nom, rien ne vous le signale. Vous ne le trouvez qu'en relisant chaque ligne face à l'original.
Prenons une lettre de recommandation pour Claire Exemple, infirmière à la clinique du Tilleul. L'assistant remplace son nom et son numéro de compte bancaire, mais laisse « la seule infirmière de nuit de la clinique du Tilleul ». Cette phrase la désigne encore, et seul un lecteur attentif la repérera.
Les autorités alertent aussi sur les résultats. En mai 2024, la task force ChatGPT du CEPD, le comité des autorités européennes de protection des données, a publié des positions préliminaires. Elle écrit que la méthode d'entraînement peut produire des réponses biaisées ou inventées, et que les utilisateurs risquent de les croire exactes. L'agence allemande de cybersécurité (BSI) écrit que les modèles génératifs n'offrent aucune garantie, ou trop peu, sur la qualité de leurs sorties.
Où va votre document quand vous utilisez un assistant ?
Cela dépend de l'outil et de l'offre. Le tableau reprend les pages des éditeurs et des autorités européennes, en l'état d'octobre 2026 sauf date indiquée. Ces conditions changent : vérifiez votre offre avant tout envoi.
| Voie d'accès | Entraînement sur votre contenu | À savoir en plus |
|---|---|---|
| ChatGPT, compte personnel | Selon son centre d'aide, OpenAI peut entraîner ses modèles sur votre contenu, après des mesures pour réduire les données personnelles. Pour refuser, désactivez « Improve the model for everyone » dans Settings, Data controls (intitulés anglais d'OpenAI). | En mai 2024, le CEPD notait qu'OpenAI range les fichiers téléversés parmi les contenus. |
| ChatGPT Business, Enterprise, Edu et API d'OpenAI | Pas d'entraînement par défaut, selon OpenAI. Les clients de l'API peuvent accepter le partage. | API : les journaux de surveillance des abus sont conservés jusqu'à 30 jours par défaut, et les fichiers téléversés restent jusqu'à leur suppression. |
| Microsoft Copilot Chat, compte professionnel ou scolaire | Pas d'entraînement des modèles de base, selon Microsoft. | Les invites et réponses sont journalisées dans l'Exchange de votre organisation (la messagerie Microsoft), et les fichiers téléversés vont dans OneDrive Entreprise. Les administrateurs peuvent les chercher et fixer la durée de conservation. |
| Microsoft Copilot, compte Microsoft personnel | Application mise à jour et web (depuis le 18 août 2026). Selon Microsoft, les invites, réponses et contenus de fichiers ne servent pas à entraîner les modèles de base. | Ancienne application : selon Microsoft, les conversations et fichiers téléversés des utilisateurs connectés servent à l'entraînement, sauf refus. Microsoft dit retirer d'abord les détails identifiants. L'historique est conservé 18 mois par défaut, et certaines conversations sont relues par des humains, sans possibilité de refus. |
| Modèle sur votre propre ordinateur | Rien ne part chez un éditeur si le modèle tourne uniquement sur votre machine. | Selon la CNIL, un déploiement sur site empêche le fournisseur de réutiliser les données. Vous l'exploitez et le sécurisez vous-même. |
Copilot Chat peut aussi envoyer de courtes requêtes web à Bing. Selon Microsoft, elles tiennent en quelques mots et peuvent reprendre des termes d'un fichier téléversé, mais pas le fichier entier. Bing suit d'autres règles : Microsoft indique y agir comme responsable du traitement indépendant, c'est-à-dire qu'elle décide seule de l'usage de ces données.
Quand peut-on utiliser un assistant sur un document ?
Trois cas peuvent le justifier, selon des faits que seule votre organisation connaît. Demandez conseil à votre délégué à la protection des données (DPO), à votre service informatique ou à un avocat. Hors de l'UE, en Suisse ou au Québec par exemple, la règle peut différer.
- Une offre professionnelle avec un contrat qui exclut l'entraînement. L'article 28 du RGPD (UE) exige un contrat écrit, ou un autre acte juridique, dès qu'un prestataire traite des données personnelles pour votre compte. Ce contrat doit prévoir que le prestataire n'agit que sur votre instruction documentée. Microsoft indique que ses offres Copilot pour les organisations relèvent de son addendum sur la protection des données, Microsoft agissant comme sous-traitant.
- Une politique interne qui autorise ce type de document. La CNIL recommande des politiques ou chartes internes qui définissent clairement les usages autorisés et interdits. Le BSI indique que les employeurs devraient dire à leur personnel quelles applications d'IA il peut utiliser et ce qu'il peut y saisir.
- Un document sans donnée personnelle ni confidentielle. La CNIL recommande de ne jamais partager d'informations confidentielles, comme des données personnelles, avec un service grand public.
Dans quel ordre utiliser un assistant sur un document sensible ?
- Travaillez sur une copie. Gardez l'original.
- Masquez la copie sur votre propre appareil, avec un outil qui n'envoie pas le fichier.
- Comparez la copie masquée à l'original, page par page. Cherchez les indices comme les fonctions, lieux et événements rares : ils peuvent encore désigner quelqu'un.
- Seulement alors, demandez de l'aide à l'assistant, sur la copie masquée.
- Lisez sa réponse d'un œil critique, et comparez toute réécriture à l'original.
ONYRI Sanitize peut faire l'étape 2. L'application masque un PDF, un fichier Word (.docx) ou un scan dans votre navigateur, sans téléverser le fichier. En mode Token (offre Pro), chaque valeur devient une étiquette comme [NAME1], toujours la même pour un texte identique dans un document : l'assistant peut suivre qui a fait quoi. Un nom écrit de deux façons reçoit deux étiquettes. L'export est aplati en images de pages, que l'assistant lit comme des images. Rien ne restaure les valeurs d'origine : gardez votre original.
Demandez à l'assistant de repérer, pas de corriger. Une consigne comme celle-ci vous garde aux commandes :
Voici un document masqué. Liste les détails restants qui pourraient désigner une personne réelle, comme les fonctions, lieux, dates ou événements rares. Cite chaque détail et indique où il se trouve. Ne réécris ni ne corrige rien.
Vérifiez sa liste vous-même. S'il ne trouve rien, cela ne prouve pas qu'il ne reste rien. Avant de vous fier à une méthode de masquage, testez-la sur des documents inventés avec un corrigé écrit. Notre guide sur le test d'un outil de caviardage explique comment faire.
Questions fréquentes
Est-ce sûr si je désactive l'entraînement dans ChatGPT ?
Pas à lui seul. Cela change ce que l'éditeur fait de vos conversations. Mais l'assistant a quand même lu votre document non masqué, et votre employeur peut l'interdire. Le tableau le montre : les éditeurs peuvent encore journaliser ou stocker les échanges.
Une offre professionnelle règle-t-elle le problème ?
En partie. Un contrat peut exclure l'entraînement et dire qui peut voir les données. Il ne corrige ni la réécriture ni les oublis : vous comparez toujours le résultat à l'original.
Un modèle qui tourne sur mon ordinateur est-il une façon sûre d'anonymiser ?
Il évite d'envoyer le fichier à un éditeur, et la CNIL juge les systèmes sur site généralement plus sûrs pour les données personnelles. Mais relisez la sortie ligne à ligne : le BSI indique que les modèles n'offrent aucune garantie, ou trop peu, sur la qualité.
Un assistant peut-il aider une fois le document masqué ?
Oui, avec des limites. Demandez-lui de lister les indices restants, puis décidez vous-même. Une copie masquée peut encore désigner quelqu'un par le contexte : la politique de votre organisation s'applique toujours.
Comment vérifier qu'un assistant n'a rien oublié ?
Vous ne pouvez pas le savoir d'après sa seule réponse. Préparez un court fichier de test avec des personnes inventées et la liste écrite de tout ce qu'il faut cacher. Comptez ensuite ce qui reste visible. N'utilisez jamais de vrais fichiers.
Sources et références
- Les questions-réponses de la CNIL sur l'utilisation d'un système d'IA générative, 18 juillet 2024CNIL
- Règlement européen sur la protection des données, chapitre IV, article 28 : sous-traitantCNIL
- Report of the work undertaken by the ChatGPT Taskforce, 23 mai 2024, points 12, 21, 30 et 31 (en anglais)Comité européen de la protection des données (CEPD)
- Generative KI-Modelle : Chancen und Risiken für Industrie und Behörden, version 2.0, 17 janvier 2025 (en allemand)Bundesamt für Sicherheit in der Informationstechnik (BSI)
- How your data is used to improve model performance (en anglais)Centre d'aide OpenAI
- Data controls in the OpenAI platform (en anglais)OpenAI
- Protection des données d'entreprise dans Microsoft Copilot et Microsoft Copilot ChatMicrosoft Learn
- Microsoft Copilot Chat : confidentialité et protectionsMicrosoft Learn
- Données, confidentialité et sécurité pour Microsoft CopilotMicrosoft Learn
- Microsoft Copilot pour les particuliers : votre historique d'activités (web et application mise à jour, depuis le 18 août 2026)Support Microsoft
- FAQ sur la confidentialité pour Microsoft Copilot (comptes personnels, application d'avant le 18 août 2026)Support Microsoft