Rien n'est envoyé, et cela se vérifie
Klarmask ne vous demande pas de le croire. Deux promesses, et le moyen de vérifier chacune : le document ne quitte pas votre poste, et ce qui est masqué n'existe plus dans le fichier.
Rien n'est envoyé
Le document est lu par votre navigateur, dans l'onglet ouvert. La détection, la revue, la reconstruction du fichier et son contrôle s'y font aussi. Il n'y a pas de serveur de traitement : il n'y a nulle part où envoyer le document.
Les seules requêtes de la page sont des lectures de ce site : les pages, le code, les polices standard du format PDF et, si vous le demandez, le modèle des noms, et, si vous déposez un scan ou une photo, le moteur de reconnaissance de texte et le modèle de la langue, une fois, vérifié par son empreinte puis rangé sur votre poste. Pas de compte, pas de cookie, pas de mesure d'audience. La seule requête qui ne soit pas une lecture est le compteur, décrit plus bas. Le serveur ne tient pas de journal d'accès.
Une architecture plutôt qu'une promesse
Un service en ligne peut promettre d'effacer votre document ; vous n'avez aucun moyen de le constater. Une architecture, elle, se constate.
| Un service de caviardage en ligne | Klarmask | |
|---|---|---|
| Où le document est traité | Sur les serveurs du prestataire, ou chez son fournisseur d'intelligence artificielle | Dans votre navigateur, sur votre poste |
| Ce que vous devez croire | Sa politique de conservation et ses conditions | Rien : coupez le réseau et regardez |
| Sous-traitants | Hébergeur, fournisseur de modèles, parfois hors de l'Union européenne | Aucun pour le document : il n'y a pas de traitement à sous-traiter |
| Durée de conservation | Celle de ses conditions, à négocier | Sans objet : rien n'est reçu |
| Réutilisation pour entraîner un modèle | Selon ses conditions | Impossible : nous ne recevons rien |
| Dépendance | Au service, à ses tarifs, au droit de son pays | Aucune : la version auto-hébergée tourne sur votre réseau |
| Compte, cookies | Souvent obligatoires | Aucun |
Le vérifier vous-même
Coupez le réseau
Chargez la page, puis coupez le Wi-Fi ou débranchez le câble. Déposez un document, tranchez, produisez le fichier : tout va au bout. Rechargez même la page : après une première visite, l'outil se rouvre sans réseau.
Regardez l'onglet Réseau
Ouvrez les outils de développement (F12), onglet « Réseau », avant de déposer le document. Pendant le travail, aucune ligne ne s'ajoute ; à l'enregistrement du fichier, une seule,
/compte, le compteur décrit ci-dessous. L'atelier montre aussi sa propre liste, sous la revue ; mais une page pourrait mentir sur elle-même, l'onglet du navigateur non.Lisez la politique de sécurité
Chaque page porte une politique de sécurité du contenu que le navigateur fait respecter. La ligne qui compte :
connect-src 'self'. Elle interdit toute connexion vers un autre site, même si le code de la page le demandait.
La seule chose qui part : un compteur
Quand vous enregistrez un fichier caviardé, ou qu'un document a été vérifié, votre navigateur envoie à ce site une requête, et une seule : POST /compte?f=caviardage&p=12. Elle dit s'il s'agit d'un caviardage ou d'une vérification, et combien de pages avait le document. Rien d'autre : pas un mot du document, pas une valeur masquée, pas un nom de fichier, pas un identifiant.
Le serveur n'écrit qu'une ligne : la date, la famille, le nombre de pages. Ni adresse IP, ni navigateur, ni page d'origine : deux documents de la même personne sont indistinguables de deux documents d'inconnus. Le total est publié tel quel sur l'accueil.
Un navigateur qui demande à ne pas être suivi (Do Not Track, Global Privacy Control) n'envoie rien. Hors ligne, rien ne part, et rien n'est gardé pour plus tard. La version auto-hébergée est construite sans compteur. Dans tous les cas, l'outil fonctionne à l'identique.
Disons-le sans détour : nous enregistrons le nombre de documents caviardés et vérifiés, et leur nombre de pages. Rien dans ces lignes ne dit qui les a traités, ni d'où, ni ce qu'ils contenaient.
Ce que cela change pour le RGPD
Nous ne recevons aucun document, donc nous ne traitons aucune des données qu'il contient. Concrètement, pour une organisation :
- Pas de transfert de données vers un tiers : le document ne quitte pas le poste de la personne qui caviarde. La question du transfert hors de l'Union européenne ne se pose pas, faute de transfert.
- Pas de sous-traitant à qualifier pour le contenu des documents, donc pas de contrat de sous-traitance à signer pour le caviardage lui-même.
- Pas de durée de conservation à fixer ni d'effacement à demander : il n'existe pas de copie ailleurs. Le document ouvert disparaît quand vous fermez l'onglet.
- Aucun fournisseur d'intelligence artificielle ne voit passer vos pièces : le modèle des noms est publié sous licence libre (MIT), épinglé, vérifié et servi par ce site, puis il tourne sur votre poste.
- Aucun cookie, aucun traceur, aucun tiers : pas de bandeau de consentement, parce qu'il n'y a rien à consentir. La seule mesure du site est le compteur décrit plus haut.
- Le site est hébergé en France, par OVH, et ne sert que des fichiers. Pour ne dépendre de personne, la version auto-hébergée tourne sur votre réseau interne.
Ce qui reste à votre charge
Klarmask ne décide pas à votre place de ce qui doit être masqué, et ne garantit pas qu'un document caviardé ne permet plus de reconnaître quelqu'un : c'est votre relecture qui le fait. Si vous pseudonymisez pour pouvoir réidentifier ensuite, la correspondance entre libellés et personnes reste l'information supplémentaire au sens du RGPD : gardez-la à part. Les conditions d'utilisation le rappellent.
Ce qui est rangé sur votre poste
Le modèle des noms et son moteur, si vous les téléchargez, sont rangés dans l'espace privé que le navigateur réserve à ce site, après vérification de leur empreinte. C'est ce qui évite de les retélécharger. L'atelier permet de les supprimer d'un bouton.
Les pages et le code de l'atelier sont gardés par le navigateur (un travailleur de service), pour que l'outil se rouvre sans réseau. Le moteur de lecture des scans y est gardé après sa première utilisation, et reste vérifié par son empreinte à chaque usage. Ce travailleur ne fait aucune requête de lui-même : il ne touche pas au compteur et ne rejoue jamais rien.
Si vous en créez, vos règles (les noms ou les mots à toujours masquer) sont gardées dans le stockage de ce navigateur, pour ce site : elles ne quittent pas le poste, et s'effacent avec les données du site.
Votre document, lui, n'est rangé nulle part : il est lu en mémoire, dans l'onglet, et disparaît quand vous le fermez. Le fichier produit est enregistré par votre navigateur, là où vous le décidez.
Ce qui est masqué n'existe plus dans le fichier
Le fichier produit est un document neuf. Le document d'origine n'est jamais modifié puis réenregistré : c'est ainsi que des documents caviardés ont été décaviardés, par la version d'avant restée dans le fichier.
Un document Word produit est lui aussi un paquet neuf, écrit à partir des seules parties que l'outil comprend : révisions acceptées, commentaires, propriétés, graphiques et objets incorporés retirés, métadonnées des images effacées.
| Où une donnée peut se cacher | Ce que fait Klarmask |
|---|---|
| Le texte sous un rectangle noir | La page est rendue en image et l'aplat est peint sur les pixels. Le texte d'origine n'est recopié nulle part. |
| Le texte cherchable | Réécrit à partir des seuls mots gardés. Un mot dont une lettre est masquée n'y figure pas. |
| Le texte blanc sur blanc, hors page, minuscule | Lu par la détection, donc proposé en revue ; effacé par le rendu en image. |
| Annotations, commentaires, champs de formulaire | Non recopiés. |
| Signets, pièces jointes, JavaScript | Non recopiés. |
| Métadonnées et XMP | Seul le nom du logiciel reste. Pas d'auteur, pas de titre, pas de date. |
| Versions antérieures | Le fichier produit n'a qu'une version. |
| Le nom du fichier | Nom neutre proposé : « document-caviarde.pdf ». |
La lecture des scans
Une page sans texte est lue par Tesseract (licence Apache 2.0), le moteur de Klarfile, compilé pour le navigateur. Le moteur et le modèle de la langue viennent de ce site, pas d'un réseau de diffusion : la bibliothèque habituelle qui les enveloppe irait les chercher ailleurs, elle n'est pas utilisée. Chaque fichier est vérifié par son empreinte avant de servir ; les empreintes sont publiées ci-dessous, avec celles du modèle des noms.
La lecture se fait dans un fil d'exécution à part, dans l'onglet. L'image de la page n'en sort pas.
Le modèle des noms
Les noms sont proposés par un modèle de reconnaissance d'entités, CamemBERT-NER (licence MIT), entraîné sur le français. Il ne se télécharge que si vous le demandez, depuis ce site et non depuis un tiers, une fois : chaque fichier est vérifié par son empreinte SHA-256 avant d'être rangé dans un espace que le navigateur réserve à ce site, sur votre poste. Il ne lit que le texte de la page ouverte, dans l'onglet.
La bibliothèque qui le fait tourner n'a pas le droit d'aller sur le réseau : sa fonction de téléchargement est remplacée par une fonction qui refuse, et elle ne lit que les fichiers déjà vérifiés. Les empreintes publiées ici sont celles que l'outil vérifie.
Modèle : Xenova/camembert-ner, révision 8e1988247e87.
| Fichier | Taille | SHA-256 |
|---|---|---|
ort/ort-wasm-simd-threaded.asyncify.mjs | 0,1 Mo | 0966b6105cd936744498aa60df7a22cbd47af3374dbc64a9ab561c08a71e3611 |
ort/ort-wasm-simd-threaded.asyncify.wasm | 26,9 Mo | 49871f5a4409519797e127440868a6d1923339d9185907f301a5b2a1d90af082 |
modeles/Xenova/camembert-ner/config.json | 0 Mo | 3f928a29f1ee4578745e0a989f2d35666df49c7b431c8a3e01f52be661279699 |
modeles/Xenova/camembert-ner/tokenizer.json | 2,4 Mo | 2fe563b59de779621fa6ef3756e7ae565a87d78ac249afb728daf743ba3821ed |
modeles/Xenova/camembert-ner/tokenizer_config.json | 0 Mo | ec016bffadf7b3ffc0ca3b9318d166b520a364c8ea3e40b0e26245738b1c08b5 |
modeles/Xenova/camembert-ner/special_tokens_map.json | 0 Mo | 5bf5488fdfc958edafccea2aebff4c8b15e383c16bf2061e2cc955688502af8b |
modeles/Xenova/camembert-ner/onnx/model_quantized.onnx | 111,3 Mo | 43507a27e7e5500b5e197c8c7de803bc94bcc29ce156fcbb19bda18ed322960d |
modeles/Xenova/camembert-ner/onnx/model.onnx | 440,4 Mo | 0a2c64c0f051642a3002e5cef91861a26eaa44cceedceac4ce8eabee3fac4f75 |
ocr/tesseract-core-simd-lstm.js | 0,1 Mo | be3504705d7111d1d1f3f7f9dff326c26d334031ede36e31c4d3cf883027e982 |
ocr/tesseract-core-simd-lstm.wasm | 2,9 Mo | 187d76742dfc0d8929f0b49a619f145bb6370730776c7bd0d3e20c6b2098808d |
ocr/tesseract-core-lstm.js | 0,1 Mo | 48a3ee8e00924cb8c7f0cc0d099b1318fea120af56b3ee8fb3a70dd2311806c2 |
ocr/tesseract-core-lstm.wasm | 2,9 Mo | 220e2e87551edccb85519796a170469f8ab2a8055216789e3b8b1ada18b7bc2b |
ocr/fra.traineddata.gz | 0,7 Mo | d611139672b3752c7097e671e4a1d9209dfd37f2aeb081ef6487fba3351e9255 |
ocr/eng.traineddata.gz | 3 Mo | 45b4cb346724ac1774f1c36f42f182b887bcdb28ebe63e6fff90ac41f3fcff91 |
ocr/deu.traineddata.gz | 1,3 Mo | 306c4280d0cbed46fbff727486bd43b92730181bae80f56941a091f363bdf28b |
ocr/spa.traineddata.gz | 2,1 Mo | 40be52f97b5d4eb7460073dc1f94cd546b27150333c0bf854ed7e7132db6bceb |
ocr/ita.traineddata.gz | 1,7 Mo | f702fcfad297ce028ede3626d1467b67939f23ff23595f9badd54681cf25a4d3 |
ocr/nld.traineddata.gz | 3 Mo | a2d904b6ddc4feb0d31ecfcd7361a554102e7aa2e278c54f4fc029e0d0815571 |
Le contrôle de sortie
Avant de vous proposer le fichier, l'outil le relit par des chemins indépendants de celui qui l'a écrit : le texte, par un second lecteur PDF ; les objets du fichier, parcourus un à un, chaque flux décompressé. Chaque élément masqué y est cherché sous toutes ses formes (espaces, accents, majuscules). La structure est vérifiée : ni annotation, ni formulaire, ni signet, ni pièce jointe, ni métadonnée, et une seule version.
S'il retrouve quoi que ce soit, le fichier n'est pas proposé, et l'écran dit ce qui a été retrouvé et où.
Ce qui n'est pas garanti
- Les extensions du navigateur peuvent lire les pages que vous ouvrez. Pour un document sensible, utilisez un profil sans extension.
- Un poste compromis (logiciel espion, capture d'écran) voit tout ce que vous voyez. Aucun site n'y peut rien.
- Le navigateur lui-même envoie des informations à son éditeur (mises à jour, rapports d'incident) selon ses réglages.
- Le contexte : un document dont les noms sont masqués peut rester reconnaissable. Voir pseudonymisation ou anonymisation.
- La détection propose, elle ne garantit pas d'avoir tout vu. La relecture est la vôtre.