Nichts wird gesendet, und das lässt sich prüfen
Klarmask verlangt nicht, dass Sie ihm glauben. Zwei Zusagen, und für jede ein Weg, sie zu prüfen: Das Dokument verlässt Ihren Rechner nicht, und was geschwärzt ist, existiert in der Datei nicht mehr.
Nichts wird gesendet
Ihr Browser liest das Dokument im geöffneten Tab. Erkennung, Durchsicht, Neuaufbau der Datei und ihre Prüfung geschehen ebenfalls dort. Es gibt keinen Verarbeitungsserver: Es gibt keinen Ort, an den das Dokument gesendet werden könnte.
Die einzigen Anfragen der Seite sind Lesezugriffe auf diese Website: die Seiten, der Code, die Standardschriften des PDF-Formats und, wenn Sie es wünschen, das Namensmodell, und, wenn Sie einen Scan oder ein Foto ablegen, die Texterkennung und das Sprachmodell, jeweils einmal, anhand seines Fingerabdrucks geprüft und dann auf Ihrem Rechner abgelegt. Kein Konto, kein Cookie, keine Reichweitenmessung. Die einzige Anfrage, die kein Lesezugriff ist, ist der Zähler, weiter unten beschrieben. Der Server führt kein Zugriffsprotokoll.
Eine Architektur statt eines Versprechens
Ein Onlinedienst kann versprechen, Ihr Dokument zu löschen; Sie haben keine Möglichkeit, das festzustellen. Eine Architektur dagegen lässt sich feststellen.
| Ein Online-Schwärzungsdienst | Klarmask | |
|---|---|---|
| Wo das Dokument verarbeitet wird | Auf den Servern des Anbieters oder bei seinem KI-Anbieter | In Ihrem Browser, auf Ihrem Rechner |
| Was Sie glauben müssen | Seine Aufbewahrungsrichtlinie und seine Bedingungen | Nichts: Trennen Sie das Netz und sehen Sie hin |
| Auftragsverarbeiter | Hoster, Modellanbieter, manchmal außerhalb der Europäischen Union | Keiner für das Dokument: Es gibt keine Verarbeitung, die ausgelagert würde |
| Aufbewahrungsdauer | Die seiner Bedingungen, zu verhandeln | Entfällt: Nichts wird empfangen |
| Wiederverwendung zum Training eines Modells | Je nach seinen Bedingungen | Unmöglich: Wir empfangen nichts |
| Abhängigkeit | Vom Dienst, seinen Preisen, dem Recht seines Landes | Keine: Die Version zum Selbsthosten läuft in Ihrem Netz |
| Konto, Cookies | Oft Pflicht | Keine |
Selbst prüfen
Trennen Sie das Netz
Laden Sie die Seite, dann schalten Sie das WLAN ab oder ziehen das Kabel. Legen Sie ein Dokument ab, entscheiden Sie, erstellen Sie die Datei: Alles läuft bis zum Ende. Laden Sie die Seite sogar neu: Nach einem ersten Besuch öffnet sich das Werkzeug auch ohne Netz.
Sehen Sie in den Tab Netzwerk
Öffnen Sie die Entwicklertools (F12), Tab „Netzwerk“, bevor Sie das Dokument ablegen. Während der Arbeit kommt keine Zeile hinzu; beim Speichern der Datei eine einzige,
/compte, der unten beschriebene Zähler. Die Werkstatt zeigt unter der Durchsicht auch ihre eigene Liste; aber eine Seite könnte über sich selbst lügen, der Tab des Browsers nicht.Lesen Sie die Sicherheitsrichtlinie
Jede Seite trägt eine Content Security Policy, die der Browser durchsetzt. Die entscheidende Zeile:
connect-src 'self'. Sie verbietet jede Verbindung zu einer anderen Website, selbst wenn der Code der Seite sie verlangen würde.
Das Einzige, was hinausgeht: ein Zähler
Wenn Sie eine geschwärzte Datei speichern oder ein Dokument geprüft wurde, sendet Ihr Browser eine Anfrage an diese Website, und nur eine: POST /compte?f=caviardage&p=12. Sie sagt, ob es sich um eine Schwärzung oder eine Prüfung handelt und wie viele Seiten das Dokument hatte. Sonst nichts: kein Wort aus dem Dokument, kein geschwärzter Wert, kein Dateiname, keine Kennung.
Der Server schreibt nur eine Zeile: das Datum, die Art, die Seitenzahl. Keine IP-Adresse, kein Browser, keine Herkunftsseite: Zwei Dokumente derselben Person sind von zwei Dokumenten Unbekannter nicht zu unterscheiden. Die Summe wird unverändert auf der Startseite veröffentlicht.
Ein Browser, der darum bittet, nicht verfolgt zu werden (Do Not Track, Global Privacy Control), sendet nichts. Offline geht nichts hinaus, und nichts wird für später aufbewahrt. Die Version zum Selbsthosten wird ohne Zähler gebaut. In allen Fällen funktioniert das Werkzeug gleich.
Ohne Umschweife: Wir zeichnen die Zahl der geschwärzten und geprüften Dokumente auf, und ihre Seitenzahl. Nichts in diesen Zeilen sagt, wer sie verarbeitet hat, von wo, oder was sie enthielten.
Was das für die DSGVO bedeutet
Wir empfangen kein Dokument, also verarbeiten wir keine der Daten, die es enthält. Konkret für eine Organisation:
- Keine Übermittlung von Daten an Dritte: Das Dokument verlässt den Rechner der Person, die schwärzt, nicht. Die Frage einer Übermittlung außerhalb der Europäischen Union stellt sich nicht, weil es keine Übermittlung gibt.
- Kein Auftragsverarbeiter für den Inhalt der Dokumente, also kein Auftragsverarbeitungsvertrag für das Schwärzen selbst.
- Keine Aufbewahrungsdauer festzulegen und keine Löschung zu verlangen: Es gibt anderswo keine Kopie. Das geöffnete Dokument verschwindet, wenn Sie den Tab schließen.
- Kein KI-Anbieter sieht Ihre Unterlagen: Das Namensmodell ist unter freier Lizenz (MIT) veröffentlicht, auf eine Version festgelegt, geprüft und von dieser Website ausgeliefert, dann läuft es auf Ihrem Rechner.
- Kein Cookie, kein Tracker, keine Dritten: kein Einwilligungsbanner, weil es nichts einzuwilligen gibt. Die einzige Messung der Website ist der oben beschriebene Zähler.
- Die Website wird in Frankreich von OVH gehostet und liefert nur Dateien aus. Um von niemandem abzuhängen, läuft die Version zum Selbsthosten in Ihrem internen Netz.
Was bei Ihnen bleibt
Klarmask entscheidet nicht an Ihrer Stelle, was geschwärzt werden muss, und garantiert nicht, dass ein geschwärztes Dokument niemanden mehr erkennen lässt: Das leistet Ihr Gegenlesen. Wenn Sie pseudonymisieren, um später wieder zuordnen zu können, bleibt die Zuordnung zwischen Platzhaltern und Personen die zusätzliche Information im Sinne der DSGVO: Bewahren Sie sie getrennt auf. Die Nutzungsbedingungen erinnern daran.
Was auf Ihrem Rechner abgelegt wird
Das Namensmodell und sein Laufzeitmodul werden, wenn Sie sie herunterladen, nach Prüfung ihres Fingerabdrucks in dem privaten Speicher abgelegt, den der Browser dieser Website vorbehält. So müssen sie nicht erneut heruntergeladen werden. In der Werkstatt lassen sie sich mit einer Schaltfläche löschen.
Die Seiten und der Code der Werkstatt werden vom Browser aufbewahrt (ein Service Worker), damit sich das Werkzeug ohne Netz wieder öffnet. Die Texterkennung für Scans wird dort nach ihrer ersten Nutzung aufbewahrt und bei jeder Verwendung erneut anhand ihres Fingerabdrucks geprüft. Dieser Service Worker stellt von sich aus keine Anfrage: Er berührt den Zähler nicht und wiederholt nie etwas.
Wenn Sie welche anlegen, werden Ihre Regeln (die Namen oder Wörter, die immer geschwärzt werden) im Speicher dieses Browsers für diese Website aufbewahrt: Sie verlassen den Rechner nicht und werden mit den Daten der Website gelöscht.
Ihr Dokument dagegen wird nirgends abgelegt: Es wird im Arbeitsspeicher gelesen, im Tab, und verschwindet, wenn Sie ihn schließen. Die erstellte Datei speichert Ihr Browser, dort, wo Sie es festlegen.
Was geschwärzt ist, existiert in der Datei nicht mehr
Die erstellte Datei ist ein neues Dokument. Das Originaldokument wird nie geändert und dann neu gespeichert: Genau so wurden geschwärzte Dokumente schon wieder lesbar gemacht, über die vorherige Version, die in der Datei geblieben war.
Ein erstelltes Word-Dokument ist ebenfalls ein neues Paket, geschrieben nur aus den Teilen, die das Werkzeug versteht: Überarbeitungen angenommen, Kommentare, Eigenschaften, Diagramme und eingebettete Objekte entfernt, Metadaten der Bilder gelöscht.
| Wo sich eine Angabe verstecken kann | Was Klarmask tut |
|---|---|
| Text unter einem schwarzen Rechteck | Die Seite wird als Bild gerendert, und der schwarze Balken wird auf die Pixel gemalt. Der Originaltext wird nirgendwohin übernommen. |
| Der durchsuchbare Text | Neu geschrieben, nur aus den behaltenen Wörtern. Ein Wort, von dem ein Buchstabe geschwärzt ist, steht nicht darin. |
| Weißer Text auf Weiß, außerhalb der Seite, winzig | Von der Erkennung gelesen, also zur Durchsicht vorgeschlagen; durch das Rendern als Bild entfernt. |
| Anmerkungen, Kommentare, Formularfelder | Nicht übernommen. |
| Lesezeichen, Anhänge, JavaScript | Nicht übernommen. |
| Metadaten und XMP | Nur der Name der Software bleibt. Kein Autor, kein Titel, kein Datum. |
| Frühere Versionen | Die erstellte Datei hat nur eine Version. |
| Der Dateiname | Vorgeschlagen wird ein neutraler Name: „geschwaerztes-dokument.pdf“. |
Das Lesen von Scans
Eine Seite ohne Text wird von Tesseract gelesen (Apache-2.0-Lizenz), der Texterkennung von Klarfile, für den Browser kompiliert. Texterkennung und Sprachmodell kommen von dieser Website, nicht aus einem Auslieferungsnetz: Die übliche Bibliothek, die sie umhüllt, würde sie anderswo holen, sie wird nicht verwendet. Jede Datei wird vor der Nutzung anhand ihres Fingerabdrucks geprüft; die Fingerabdrücke sind unten veröffentlicht, mit denen des Namensmodells.
Das Lesen geschieht in einem eigenen Ausführungsstrang, im Tab. Das Bild der Seite verlässt ihn nicht.
Das Namensmodell
Namen schlägt ein Modell zur Erkennung benannter Entitäten vor, CamemBERT-NER (MIT-Lizenz), trainiert auf Französisch. Es wird nur heruntergeladen, wenn Sie es wünschen, von dieser Website und nicht von einem Dritten, und nur einmal: Jede Datei wird anhand ihres SHA-256-Fingerabdrucks geprüft, bevor sie in einem Speicher abgelegt wird, den der Browser dieser Website auf Ihrem Rechner vorbehält. Es liest nur den Text der geöffneten Seite, im Tab.
Die Bibliothek, die es ausführt, darf nicht ins Netz: Ihre Download-Funktion ist durch eine Funktion ersetzt, die ablehnt, und sie liest nur bereits geprüfte Dateien. Die hier veröffentlichten Fingerabdrücke sind die, die das Werkzeug prüft.
Modell : Xenova/camembert-ner, Revision 8e1988247e87.
| Datei | Größe | SHA-256 |
|---|---|---|
ort/ort-wasm-simd-threaded.asyncify.mjs | 0,1 MB | 0966b6105cd936744498aa60df7a22cbd47af3374dbc64a9ab561c08a71e3611 |
ort/ort-wasm-simd-threaded.asyncify.wasm | 26,9 MB | 49871f5a4409519797e127440868a6d1923339d9185907f301a5b2a1d90af082 |
modeles/Xenova/camembert-ner/config.json | 0 MB | 3f928a29f1ee4578745e0a989f2d35666df49c7b431c8a3e01f52be661279699 |
modeles/Xenova/camembert-ner/tokenizer.json | 2,4 MB | 2fe563b59de779621fa6ef3756e7ae565a87d78ac249afb728daf743ba3821ed |
modeles/Xenova/camembert-ner/tokenizer_config.json | 0 MB | ec016bffadf7b3ffc0ca3b9318d166b520a364c8ea3e40b0e26245738b1c08b5 |
modeles/Xenova/camembert-ner/special_tokens_map.json | 0 MB | 5bf5488fdfc958edafccea2aebff4c8b15e383c16bf2061e2cc955688502af8b |
modeles/Xenova/camembert-ner/onnx/model_quantized.onnx | 111,3 MB | 43507a27e7e5500b5e197c8c7de803bc94bcc29ce156fcbb19bda18ed322960d |
modeles/Xenova/camembert-ner/onnx/model.onnx | 440,4 MB | 0a2c64c0f051642a3002e5cef91861a26eaa44cceedceac4ce8eabee3fac4f75 |
ocr/tesseract-core-simd-lstm.js | 0,1 MB | be3504705d7111d1d1f3f7f9dff326c26d334031ede36e31c4d3cf883027e982 |
ocr/tesseract-core-simd-lstm.wasm | 2,9 MB | 187d76742dfc0d8929f0b49a619f145bb6370730776c7bd0d3e20c6b2098808d |
ocr/tesseract-core-lstm.js | 0,1 MB | 48a3ee8e00924cb8c7f0cc0d099b1318fea120af56b3ee8fb3a70dd2311806c2 |
ocr/tesseract-core-lstm.wasm | 2,9 MB | 220e2e87551edccb85519796a170469f8ab2a8055216789e3b8b1ada18b7bc2b |
ocr/fra.traineddata.gz | 0,7 MB | d611139672b3752c7097e671e4a1d9209dfd37f2aeb081ef6487fba3351e9255 |
ocr/eng.traineddata.gz | 3 MB | 45b4cb346724ac1774f1c36f42f182b887bcdb28ebe63e6fff90ac41f3fcff91 |
ocr/deu.traineddata.gz | 1,3 MB | 306c4280d0cbed46fbff727486bd43b92730181bae80f56941a091f363bdf28b |
ocr/spa.traineddata.gz | 2,1 MB | 40be52f97b5d4eb7460073dc1f94cd546b27150333c0bf854ed7e7132db6bceb |
ocr/ita.traineddata.gz | 1,7 MB | f702fcfad297ce028ede3626d1467b67939f23ff23595f9badd54681cf25a4d3 |
ocr/nld.traineddata.gz | 3 MB | a2d904b6ddc4feb0d31ecfcd7361a554102e7aa2e278c54f4fc029e0d0815571 |
Die Ausgabeprüfung
Bevor Ihnen die Datei angeboten wird, liest das Werkzeug sie auf Wegen, die von dem unabhängig sind, der sie geschrieben hat: den Text mit einem zweiten PDF-Leser; die Objekte der Datei einzeln durchlaufen, jeder Datenstrom entpackt. Jedes geschwärzte Element wird darin in allen Formen gesucht (Leerzeichen, Akzente, Großbuchstaben). Die Struktur wird geprüft: keine Anmerkung, kein Formular, kein Lesezeichen, kein Anhang, keine Metadaten, und nur eine Version.
Findet es irgendetwas, wird die Datei nicht angeboten, und der Bildschirm sagt, was gefunden wurde und wo.
Was nicht garantiert ist
- Browsererweiterungen können die Seiten lesen, die Sie öffnen. Nutzen Sie für ein sensibles Dokument ein Profil ohne Erweiterungen.
- Ein kompromittierter Rechner (Spionagesoftware, Bildschirmaufzeichnung) sieht alles, was Sie sehen. Dagegen kann keine Website etwas tun.
- Der Browser selbst sendet je nach Einstellungen Informationen an seinen Hersteller (Updates, Absturzberichte).
- Der Kontext: Ein Dokument mit geschwärzten Namen kann erkennbar bleiben. Siehe Pseudonymisierung oder Anonymisierung.
- Die Erkennung schlägt vor, sie garantiert nicht, alles gesehen zu haben. Das Gegenlesen liegt bei Ihnen.