GitHub Copilot et votre code : secrets et données à protéger
Selon GitHub, Copilot Business et Enterprise n'entraînent pas leurs modèles sur votre code. Le vrai risque : les secrets. Nos conseils par offre.
Faut-il protéger votre code avant de le confier à GitHub Copilot ? Réponse directe. Le vrai risque n'est pas l'IA en soi. C'est ce que votre code contient : clés API, tokens, chaînes de connexion, identifiants, et parfois des données client dans les jeux de test. Selon GitHub, Copilot Business et Copilot Enterprise n'utilisent pas ces données pour entraîner leurs modèles. Les offres Copilot Free, Pro et Pro+ suivent d'autres règles. La règle d'or reste la même : ne jamais stocker un secret réel en clair dans le code. Et pour le code que vous collez dans un chat IA, ONYRI réduit l'exposition, dans votre navigateur.
Ce que dit GitHub, offre par offre
Commençons par les faits, attribués et datés (au 2026-08-08). Selon GitHub (changelog du 25 mars 2026), un changement s'applique à partir du 24 avril 2026. Les données d'interaction des utilisateurs Copilot Free, Pro et Pro+ servent alors à entraîner et à améliorer ses modèles. Cela couvre vos entrées, les sorties, les extraits de code et le contexte associé. Ce régime est en opt-out : l'entraînement est actif par défaut, et vous devez le désactiver dans les paramètres.
Les offres entreprise suivent un régime différent. Selon GitHub, Copilot Business et Copilot Enterprise ne sont pas concernés par cette collecte pour l'entraînement. Leurs données ne servent pas à entraîner les modèles de fondation. Toujours selon GitHub, le contenu des dépôts privés « at rest » n'est pas utilisé pour entraîner ses modèles d'IA. La nuance porte sur les données d'interaction générées pendant l'usage de Copilot.
- Selon GitHub, Copilot Free, Pro et Pro+ : données d'interaction utilisées pour l'entraînement depuis le 24 avril 2026, sauf opt-out.
- Selon GitHub, Copilot Business et Copilot Enterprise : exclus de cette collecte pour l'entraînement des modèles.
- Selon GitHub, le contenu des dépôts privés au repos n'est pas utilisé pour entraîner les modèles d'IA.
GitHub propose aussi un filtre de détection de code public, appelé « code referencing ». Selon la documentation de GitHub, il compare la suggestion et environ 150 caractères de code environnant à l'index des dépôts publics de GitHub.com. En mode « Block », les suggestions qui correspondent à du code public sont bloquées. Toujours selon GitHub, ces correspondances surviennent dans moins de 1 % des suggestions inline.
Le vrai risque : les secrets dans le code
Revenons à l'essentiel. Une politique fournisseur, même favorable, ne protège pas un secret déjà écrit dans le code. Le danger vient de ce que le fichier contient. Un dépôt cache souvent bien plus qu'on ne croit.
- Clés API et tokens d'accès (cloud, services tiers, webhooks).
- Chaînes de connexion à une base de données, avec hôte et mot de passe.
- Identifiants et secrets en dur dans un fichier de configuration.
- Données client réelles glissées dans des fixtures ou des jeux de test.
Les bons réglages, étape par étape
Comment réduire concrètement l'exposition ? Voici un ordre de priorité simple, du plus important au complément utile.
- 1Sortez les secrets du code : variables d'environnement ou gestionnaire de secrets, jamais en clair dans un fichier versionné.
- 2Vérifiez votre offre Copilot et son réglage d'entraînement : sur Free, Pro et Pro+, l'opt-out se fait dans les paramètres.
- 3Activez le filtre de détection de code public (« code referencing ») en mode « Block » quand il est disponible.
- 4Relisez le code avant publication et passez un détecteur de secrets local avant chaque commit, comme le recommande la CNIL.
- 5Pour le code que vous collez dans un chat IA, anonymisez les valeurs sensibles avant l'envoi.
Le tableau ci-dessous récapitule les règles par offre, telles que GitHub les décrit, et ce que vous gardez sous contrôle.
| Offre Copilot | Entraînement sur les données d'interaction, selon GitHub | Ce que vous gardez sous contrôle |
|---|---|---|
| Free, Pro, Pro+ | Depuis le 24 avril 2026 : entraînement sauf opt-out | Sortir les secrets du code + opt-out dans les paramètres |
| Business, Enterprise | Exclus de cette collecte pour l'entraînement | Ne jamais versionner un secret réel, malgré tout |
| Dépôts privés au repos | Contenu non utilisé pour l'entraînement, selon GitHub | Relire et scanner les secrets avant chaque commit |
Où ONYRI aide, et où il n'aide pas
Soyons transparents sur la portée. L'extension ONYRI se greffe sur les sites de chat IA, comme Copilot Chat sur le web ou ChatGPT. Elle anonymise le texte et le code que vous y collez, dans votre navigateur, avant l'envoi. En revanche, elle n'intercepte pas l'autocomplétion inline de l'IDE, le fameux « ghost text ». Elle n'agit pas non plus sur les appels IA internes d'un outil. Sa place, c'est le code que vous copiez-collez dans un chat.
Concrètement, le parcours tient en quelques temps. Vous collez un extrait dans le chat. L'extension détecte les données sensibles et les remplace par des jetons réversibles. Le texte déjà pseudonymisé part vers le modèle. La correspondance jeton ↔ valeur reste dans l'onglet, sur votre poste. À la réponse, vos vraies valeurs sont restaurées à l'écran, côté navigateur.
Deux limites à garder en tête. D'abord, la détection reste heuristique : elle réduit fortement l'exposition, sans promettre le zéro risque. Ensuite, des jetons réversibles relèvent de la pseudonymisation, pas de l'anonymisation au sens du RGPD : vos données gardent un caractère personnel. ONYRI réduit l'exposition. Il ne remplace ni la sortie des secrets hors du code, ni les réglages de Copilot.
En résumé, le vrai risque du code n'est pas Copilot lui-même. C'est ce que le code contient. Selon GitHub, Business et Enterprise excluent vos données d'interaction de l'entraînement, tandis que Free, Pro et Pro+ passent en opt-out depuis le 24 avril 2026. Sortez les secrets du code, réglez votre offre, relisez avant publication. Et pour le code que vous collez dans un chat IA, ONYRI le pseudonymise dans votre navigateur, ce qui réduit l'exposition de vos données. La pseudonymisation reste réversible : elle ne rend pas vos données anonymes au sens du RGPD.
Questions fréquentes
- Faut-il protéger son code et ses secrets avant d'utiliser GitHub Copilot ?
- Oui, surtout les secrets. Selon GitHub, Copilot Business et Enterprise n'utilisent pas vos données d'interaction pour l'entraînement. Mais Free, Pro et Pro+ le font par défaut depuis le 24 avril 2026, sauf opt-out. Dans tous les cas, ne stockez jamais un secret réel en clair dans le code : variables d'environnement ou gestionnaire de secrets.
- GitHub Copilot utilise-t-il mon code pour entraîner ses modèles ?
- Cela dépend de l'offre, selon GitHub. Copilot Business et Enterprise sont exclus de cette collecte pour l'entraînement, et le contenu des dépôts privés au repos n'est pas utilisé. Sur Copilot Free, Pro et Pro+, les données d'interaction servent à l'entraînement depuis le 24 avril 2026, sauf si vous vous désinscrivez dans les paramètres.
- ONYRI protège-t-il l'autocomplétion de GitHub Copilot dans mon IDE ?
- Non. L'extension ONYRI agit sur les sites de chat IA, comme Copilot Chat sur le web ou ChatGPT, pour le texte que vous y collez. Elle n'intercepte pas l'autocomplétion inline de l'IDE (« ghost text »). Pour ce cas, la bonne défense reste de sortir les secrets du code et de scanner avant chaque commit.
Sources et références
- Updates to our Privacy Statement and Terms of Service: How we use your data (données d'interaction Free/Pro/Pro+ pour l'entraînement dès le 24 avril 2026, opt-out) — GitHub
- Code referencing — GitHub Docs (comparaison de ~150 caractères à l'index des dépôts publics, mode « Block », moins de 1 % des suggestions inline) — GitHub
- Guide RGPD du développeur — Gérer son code source (secrets hors du dépôt, relecture avant publication, détection de secrets avant commit) — CNIL / LINC
Gardez vos données sensibles dans votre navigateur
ONYRI Sanitize détecte et masque vos données sensibles avant l'envoi à l'IA, puis restaure la réponse — du nom à la clé API.