Documents Word dans ONYRI Sanitize : ce que garde l'export PDF
Découvrez précisément ce qu'ONYRI Sanitize conserve et supprime quand un fichier Word devient un PDF masqué, et quand exporter vous-même depuis Word.
Vous déposez un fichier Word dans ONYRI Sanitize, et vous récupérez un PDF, pas un fichier Word masqué. C'est voulu. Le navigateur lit votre .docx, le met en pages, masque les données sensibles, puis aplatit le tout dans un seul fichier. Cet article détaille ce qui survit à ce trajet, ce qui disparaît en route, et quand exporter vous-même en PDF depuis Word d'abord.
Comment ONYRI Sanitize lit-il un fichier Word ?
Rien n'est envoyé. Imaginons que Claire Exemple dépose une lettre client signée, lettre-claire.docx, dans l'application. La lecture du fichier, la détection des données sensibles et le dessin des masques se déroulent sur son propre ordinateur. La construction du PDF final aussi. Le serveur n'entend parler que d'un compteur : un document, quelques pages, une poignée de masques.
- 1Le navigateur convertit votre fichier .docx en HTML avec une bibliothèque appelée mammoth, directement dans l'onglet.
- 2Ce HTML est mis en pages au format A4, 794 sur 1123 pixels, sans jamais couper une ligne de texte en deux.
- 3Chaque page est analysée par les mêmes détecteurs qu'ONYRI Sanitize utilise pour les PDF et les images : noms, IBAN, e-mails, et plus encore.
- 4Chaque page masquée est transformée en image, puis assemblée dans un tout nouveau fichier PDF.
Voilà pour ce que vous voyez sur la page. La question plus intéressante est ce qui arrive à tout ce que Word garde en mémoire autour de votre texte, sans le montrer.
Que garde l'export PDF, et que perd-il ?
Un fichier .docx contient plus que des paragraphes. Il peut porter des commentaires, un suivi des modifications, un en-tête répété sur chaque page, et un nom d'auteur dans ses propriétés. Voici exactement ce que le convertisseur d'ONYRI Sanitize, une bibliothèque appelée mammoth, garde et perd, vérifié directement dans son code.
| Élément de votre fichier Word | Ce qui se passe dans l'export |
|---|---|
| Paragraphes, titres et listes | Conservés, avec gras, italique et liens. Le soulignement n'est pas repris par défaut |
| Tableaux | Conservés sous forme de tableau, avec ses lignes et colonnes. Les bordures et le fond des cellules ne sont pas repris |
| Images | Conservées, placées à l'endroit où elles se trouvent dans le texte |
| Notes de bas de page et de fin | Conservées, ajoutées là où mammoth les place |
| Commentaires | Perdus. Le convertisseur les ignore par défaut |
| Suivi des modifications | Perdu. Les insertions apparaissent comme du texte normal, les suppressions disparaissent, sans aucune trace |
| En-têtes et pieds de page | Perdus. Les en-têtes et pieds de page répétés ne sont jamais lus |
| Auteur, titre et autres propriétés du fichier | Perdus. Le nouveau PDF ne reprend aucune des propriétés d'origine |
Le résultat est toujours un PDF aplati : une image par page, construite avec une bibliothèque appelée pdf-lib. Aucune couche de texte ne se cache sous les bandes noires ou les étiquettes de token. C'est aussi pour cela que le fichier revient toujours en PDF, jamais en fichier Word modifiable.
Pourquoi la mise en page peut-elle différer de Word ?
Un fichier .docx ne stocke pas une mise en page fixe comme le fait un PDF. Word calcule lui-même les retours à la ligne et les sauts de page, selon vos polices et votre imprimante. ONYRI Sanitize affiche le même fichier avec ses propres polices et marges, si bien qu'un saut de page peut tomber à un endroit légèrement différent.
Imaginons que Claire Exemple dépose un contrat mis en forme où chaque saut de page compte. Elle devrait l'ouvrir dans Word, choisir Fichier puis Enregistrer sous, sélectionner PDF, puis ajouter ce PDF à ONYRI Sanitize plutôt que le .docx. Le moteur PDF d'ONYRI lit les pages existantes exactement comme Word les a dessinées, au lieu de remettre le texte en page.
Que vérifier avant de partager le fichier ?
Le téléchargement conserve le nom de fichier d'origine et ajoute -anonymized avant l'extension. Un fichier nommé rapport-client.docx revient sous le nom rapport-client-anonymized.pdf. Si le nom du fichier lui-même est sensible, par exemple parce qu'il porte le nom de famille réel d'un client, renommez-le avant de l'envoyer.
- Faites défiler l'aperçu page par page avant de télécharger quoi que ce soit.
- Ouvrez la liste des données détectées et décochez toute valeur qui doit rester visible.
- Repérez un éventuel avertissement signalant qu'une valeur détectée n'a pas pu être placée sur la page.
- Gardez à l'esprit que le PDF téléchargé ne peut pas redevenir un fichier Word modifiable.
Rien de tout cela ne rend le document automatiquement conforme. La détection n'est pas exhaustive, et le PDF aplati ne peut pas redevenir votre fichier d'origine. Gardez le .docx de départ. C'est la seule copie modifiable qu'il vous restera.
Questions fréquentes
- Est-ce que je récupère un fichier Word modifiable ?
- Non. Vous téléchargez un PDF aplati, construit à partir d'images de pages. Cela évite qu'un simple copier-coller ne fasse réapparaître ce qui a été masqué. Pour continuer à modifier le document, repartez de votre .docx d'origine et exportez une nouvelle copie anonymisée à chaque fois.
- ONYRI Sanitize me signale-t-il des commentaires ou un suivi des modifications resté ouvert ?
- Aucun avertissement ne s'affiche. Les commentaires sont supprimés, et le suivi des modifications est traité comme accepté avant que le masquage ne commence. Vérifiez vous-même l'onglet Révision dans Word au préalable si vous avez un doute.
- Pourquoi une lettre Word d'une seule page revient-elle en PDF plutôt qu'en image ?
- Le moteur .docx construit toujours un PDF. Seul un fichier image unique, comme une photo, peut revenir en PNG. Une page Word ne correspond pas à une seule image matricielle comme le fait une photo, donc ONYRI assemble un vrai PDF, page par page.
- Puis-je ajouter un ancien fichier .doc plutôt qu'un .docx ?
- Non, ONYRI Sanitize ne lit que le format .docx. Ouvrez l'ancien fichier .doc dans Word et utilisez Enregistrer sous pour le convertir d'abord en .docx.
- Que devient le nom du fichier après l'export ?
- Le téléchargement conserve votre nom d'origine et ajoute -anonymized avant l'extension. Renommez vous-même le fichier au préalable si son nom d'origine est déjà sensible.
Sources et références
- Enregistrer ou convertir au format PDF ou XPS dans les applications Office de bureau — Support Microsoft
- Supprimer des données masquées et des informations personnelles en inspectant des documents — Support Microsoft
- ECMA-376 : formats de fichiers Office Open XML — Ecma International
Masquez un document sans l'envoyer nulle part
ONYRI Sanitize repère les noms, identifiants, coordonnées bancaires et secrets dans un PDF, un Word ou un scan, et les masque dans votre navigateur. Vous relisez l'aperçu, puis vous téléchargez une copie aplatie.