Zum Inhalt springen
Klarmask

Nichts wird gesendet, und das lässt sich prüfen

Klarmask verlangt nicht, dass Sie ihm glauben. Zwei Zusagen, und für jede ein Weg, sie zu prüfen: Das Dokument verlässt Ihren Rechner nicht, und was geschwärzt ist, existiert in der Datei nicht mehr.

Nichts wird gesendet

Ihr Browser liest das Dokument im geöffneten Tab. Erkennung, Durchsicht, Neuaufbau der Datei und ihre Prüfung geschehen ebenfalls dort. Es gibt keinen Verarbeitungsserver: Es gibt keinen Ort, an den das Dokument gesendet werden könnte.

Die einzigen Anfragen der Seite sind Lesezugriffe auf diese Website: die Seiten, der Code, die Standardschriften des PDF-Formats und, wenn Sie es wünschen, das Namensmodell, und, wenn Sie einen Scan oder ein Foto ablegen, die Texterkennung und das Sprachmodell, jeweils einmal, anhand seines Fingerabdrucks geprüft und dann auf Ihrem Rechner abgelegt. Kein Konto, kein Cookie, keine Reichweitenmessung. Die einzige Anfrage, die kein Lesezugriff ist, ist der Zähler, weiter unten beschrieben. Der Server führt kein Zugriffsprotokoll.

Eine Architektur statt eines Versprechens

Ein Onlinedienst kann versprechen, Ihr Dokument zu löschen; Sie haben keine Möglichkeit, das festzustellen. Eine Architektur dagegen lässt sich feststellen.

Ein Online-SchwärzungsdienstKlarmask
Wo das Dokument verarbeitet wirdAuf den Servern des Anbieters oder bei seinem KI-AnbieterIn Ihrem Browser, auf Ihrem Rechner
Was Sie glauben müssenSeine Aufbewahrungsrichtlinie und seine BedingungenNichts: Trennen Sie das Netz und sehen Sie hin
AuftragsverarbeiterHoster, Modellanbieter, manchmal außerhalb der Europäischen UnionKeiner für das Dokument: Es gibt keine Verarbeitung, die ausgelagert würde
AufbewahrungsdauerDie seiner Bedingungen, zu verhandelnEntfällt: Nichts wird empfangen
Wiederverwendung zum Training eines ModellsJe nach seinen BedingungenUnmöglich: Wir empfangen nichts
AbhängigkeitVom Dienst, seinen Preisen, dem Recht seines LandesKeine: Die Version zum Selbsthosten läuft in Ihrem Netz
Konto, CookiesOft PflichtKeine

Selbst prüfen

  1. Trennen Sie das Netz

    Laden Sie die Seite, dann schalten Sie das WLAN ab oder ziehen das Kabel. Legen Sie ein Dokument ab, entscheiden Sie, erstellen Sie die Datei: Alles läuft bis zum Ende. Laden Sie die Seite sogar neu: Nach einem ersten Besuch öffnet sich das Werkzeug auch ohne Netz.

  2. Sehen Sie in den Tab Netzwerk

    Öffnen Sie die Entwicklertools (F12), Tab „Netzwerk“, bevor Sie das Dokument ablegen. Während der Arbeit kommt keine Zeile hinzu; beim Speichern der Datei eine einzige, /compte, der unten beschriebene Zähler. Die Werkstatt zeigt unter der Durchsicht auch ihre eigene Liste; aber eine Seite könnte über sich selbst lügen, der Tab des Browsers nicht.

  3. Lesen Sie die Sicherheitsrichtlinie

    Jede Seite trägt eine Content Security Policy, die der Browser durchsetzt. Die entscheidende Zeile: connect-src 'self'. Sie verbietet jede Verbindung zu einer anderen Website, selbst wenn der Code der Seite sie verlangen würde.

Das Einzige, was hinausgeht: ein Zähler

Wenn Sie eine geschwärzte Datei speichern oder ein Dokument geprüft wurde, sendet Ihr Browser eine Anfrage an diese Website, und nur eine: POST /compte?f=caviardage&p=12. Sie sagt, ob es sich um eine Schwärzung oder eine Prüfung handelt und wie viele Seiten das Dokument hatte. Sonst nichts: kein Wort aus dem Dokument, kein geschwärzter Wert, kein Dateiname, keine Kennung.

Der Server schreibt nur eine Zeile: das Datum, die Art, die Seitenzahl. Keine IP-Adresse, kein Browser, keine Herkunftsseite: Zwei Dokumente derselben Person sind von zwei Dokumenten Unbekannter nicht zu unterscheiden. Die Summe wird unverändert auf der Startseite veröffentlicht.

Ein Browser, der darum bittet, nicht verfolgt zu werden (Do Not Track, Global Privacy Control), sendet nichts. Offline geht nichts hinaus, und nichts wird für später aufbewahrt. Die Version zum Selbsthosten wird ohne Zähler gebaut. In allen Fällen funktioniert das Werkzeug gleich.

Ohne Umschweife: Wir zeichnen die Zahl der geschwärzten und geprüften Dokumente auf, und ihre Seitenzahl. Nichts in diesen Zeilen sagt, wer sie verarbeitet hat, von wo, oder was sie enthielten.

Was das für die DSGVO bedeutet

Wir empfangen kein Dokument, also verarbeiten wir keine der Daten, die es enthält. Konkret für eine Organisation:

  • Keine Übermittlung von Daten an Dritte: Das Dokument verlässt den Rechner der Person, die schwärzt, nicht. Die Frage einer Übermittlung außerhalb der Europäischen Union stellt sich nicht, weil es keine Übermittlung gibt.
  • Kein Auftragsverarbeiter für den Inhalt der Dokumente, also kein Auftragsverarbeitungsvertrag für das Schwärzen selbst.
  • Keine Aufbewahrungsdauer festzulegen und keine Löschung zu verlangen: Es gibt anderswo keine Kopie. Das geöffnete Dokument verschwindet, wenn Sie den Tab schließen.
  • Kein KI-Anbieter sieht Ihre Unterlagen: Das Namensmodell ist unter freier Lizenz (MIT) veröffentlicht, auf eine Version festgelegt, geprüft und von dieser Website ausgeliefert, dann läuft es auf Ihrem Rechner.
  • Kein Cookie, kein Tracker, keine Dritten: kein Einwilligungsbanner, weil es nichts einzuwilligen gibt. Die einzige Messung der Website ist der oben beschriebene Zähler.
  • Die Website wird in Frankreich von OVH gehostet und liefert nur Dateien aus. Um von niemandem abzuhängen, läuft die Version zum Selbsthosten in Ihrem internen Netz.

Was bei Ihnen bleibt

Klarmask entscheidet nicht an Ihrer Stelle, was geschwärzt werden muss, und garantiert nicht, dass ein geschwärztes Dokument niemanden mehr erkennen lässt: Das leistet Ihr Gegenlesen. Wenn Sie pseudonymisieren, um später wieder zuordnen zu können, bleibt die Zuordnung zwischen Platzhaltern und Personen die zusätzliche Information im Sinne der DSGVO: Bewahren Sie sie getrennt auf. Die Nutzungsbedingungen erinnern daran.

Was auf Ihrem Rechner abgelegt wird

Das Namensmodell und sein Laufzeitmodul werden, wenn Sie sie herunterladen, nach Prüfung ihres Fingerabdrucks in dem privaten Speicher abgelegt, den der Browser dieser Website vorbehält. So müssen sie nicht erneut heruntergeladen werden. In der Werkstatt lassen sie sich mit einer Schaltfläche löschen.

Die Seiten und der Code der Werkstatt werden vom Browser aufbewahrt (ein Service Worker), damit sich das Werkzeug ohne Netz wieder öffnet. Die Texterkennung für Scans wird dort nach ihrer ersten Nutzung aufbewahrt und bei jeder Verwendung erneut anhand ihres Fingerabdrucks geprüft. Dieser Service Worker stellt von sich aus keine Anfrage: Er berührt den Zähler nicht und wiederholt nie etwas.

Wenn Sie welche anlegen, werden Ihre Regeln (die Namen oder Wörter, die immer geschwärzt werden) im Speicher dieses Browsers für diese Website aufbewahrt: Sie verlassen den Rechner nicht und werden mit den Daten der Website gelöscht.

Ihr Dokument dagegen wird nirgends abgelegt: Es wird im Arbeitsspeicher gelesen, im Tab, und verschwindet, wenn Sie ihn schließen. Die erstellte Datei speichert Ihr Browser, dort, wo Sie es festlegen.

Was geschwärzt ist, existiert in der Datei nicht mehr

Die erstellte Datei ist ein neues Dokument. Das Originaldokument wird nie geändert und dann neu gespeichert: Genau so wurden geschwärzte Dokumente schon wieder lesbar gemacht, über die vorherige Version, die in der Datei geblieben war.

Ein erstelltes Word-Dokument ist ebenfalls ein neues Paket, geschrieben nur aus den Teilen, die das Werkzeug versteht: Überarbeitungen angenommen, Kommentare, Eigenschaften, Diagramme und eingebettete Objekte entfernt, Metadaten der Bilder gelöscht.

Wo sich eine Angabe verstecken kannWas Klarmask tut
Text unter einem schwarzen RechteckDie Seite wird als Bild gerendert, und der schwarze Balken wird auf die Pixel gemalt. Der Originaltext wird nirgendwohin übernommen.
Der durchsuchbare TextNeu geschrieben, nur aus den behaltenen Wörtern. Ein Wort, von dem ein Buchstabe geschwärzt ist, steht nicht darin.
Weißer Text auf Weiß, außerhalb der Seite, winzigVon der Erkennung gelesen, also zur Durchsicht vorgeschlagen; durch das Rendern als Bild entfernt.
Anmerkungen, Kommentare, FormularfelderNicht übernommen.
Lesezeichen, Anhänge, JavaScriptNicht übernommen.
Metadaten und XMPNur der Name der Software bleibt. Kein Autor, kein Titel, kein Datum.
Frühere VersionenDie erstellte Datei hat nur eine Version.
Der DateinameVorgeschlagen wird ein neutraler Name: „geschwaerztes-dokument.pdf“.

Das Lesen von Scans

Eine Seite ohne Text wird von Tesseract gelesen (Apache-2.0-Lizenz), der Texterkennung von Klarfile, für den Browser kompiliert. Texterkennung und Sprachmodell kommen von dieser Website, nicht aus einem Auslieferungsnetz: Die übliche Bibliothek, die sie umhüllt, würde sie anderswo holen, sie wird nicht verwendet. Jede Datei wird vor der Nutzung anhand ihres Fingerabdrucks geprüft; die Fingerabdrücke sind unten veröffentlicht, mit denen des Namensmodells.

Das Lesen geschieht in einem eigenen Ausführungsstrang, im Tab. Das Bild der Seite verlässt ihn nicht.

Das Namensmodell

Namen schlägt ein Modell zur Erkennung benannter Entitäten vor, CamemBERT-NER (MIT-Lizenz), trainiert auf Französisch. Es wird nur heruntergeladen, wenn Sie es wünschen, von dieser Website und nicht von einem Dritten, und nur einmal: Jede Datei wird anhand ihres SHA-256-Fingerabdrucks geprüft, bevor sie in einem Speicher abgelegt wird, den der Browser dieser Website auf Ihrem Rechner vorbehält. Es liest nur den Text der geöffneten Seite, im Tab.

Die Bibliothek, die es ausführt, darf nicht ins Netz: Ihre Download-Funktion ist durch eine Funktion ersetzt, die ablehnt, und sie liest nur bereits geprüfte Dateien. Die hier veröffentlichten Fingerabdrücke sind die, die das Werkzeug prüft.

Modell : Xenova/camembert-ner, Revision 8e1988247e87.

DateiGrößeSHA-256
ort/ort-wasm-simd-threaded.asyncify.mjs0,1 MB0966b6105cd936744498aa60df7a22cbd47af3374dbc64a9ab561c08a71e3611
ort/ort-wasm-simd-threaded.asyncify.wasm26,9 MB49871f5a4409519797e127440868a6d1923339d9185907f301a5b2a1d90af082
modeles/Xenova/camembert-ner/config.json0 MB3f928a29f1ee4578745e0a989f2d35666df49c7b431c8a3e01f52be661279699
modeles/Xenova/camembert-ner/tokenizer.json2,4 MB2fe563b59de779621fa6ef3756e7ae565a87d78ac249afb728daf743ba3821ed
modeles/Xenova/camembert-ner/tokenizer_config.json0 MBec016bffadf7b3ffc0ca3b9318d166b520a364c8ea3e40b0e26245738b1c08b5
modeles/Xenova/camembert-ner/special_tokens_map.json0 MB5bf5488fdfc958edafccea2aebff4c8b15e383c16bf2061e2cc955688502af8b
modeles/Xenova/camembert-ner/onnx/model_quantized.onnx111,3 MB43507a27e7e5500b5e197c8c7de803bc94bcc29ce156fcbb19bda18ed322960d
modeles/Xenova/camembert-ner/onnx/model.onnx440,4 MB0a2c64c0f051642a3002e5cef91861a26eaa44cceedceac4ce8eabee3fac4f75
ocr/tesseract-core-simd-lstm.js0,1 MBbe3504705d7111d1d1f3f7f9dff326c26d334031ede36e31c4d3cf883027e982
ocr/tesseract-core-simd-lstm.wasm2,9 MB187d76742dfc0d8929f0b49a619f145bb6370730776c7bd0d3e20c6b2098808d
ocr/tesseract-core-lstm.js0,1 MB48a3ee8e00924cb8c7f0cc0d099b1318fea120af56b3ee8fb3a70dd2311806c2
ocr/tesseract-core-lstm.wasm2,9 MB220e2e87551edccb85519796a170469f8ab2a8055216789e3b8b1ada18b7bc2b
ocr/fra.traineddata.gz0,7 MBd611139672b3752c7097e671e4a1d9209dfd37f2aeb081ef6487fba3351e9255
ocr/eng.traineddata.gz3 MB45b4cb346724ac1774f1c36f42f182b887bcdb28ebe63e6fff90ac41f3fcff91
ocr/deu.traineddata.gz1,3 MB306c4280d0cbed46fbff727486bd43b92730181bae80f56941a091f363bdf28b
ocr/spa.traineddata.gz2,1 MB40be52f97b5d4eb7460073dc1f94cd546b27150333c0bf854ed7e7132db6bceb
ocr/ita.traineddata.gz1,7 MBf702fcfad297ce028ede3626d1467b67939f23ff23595f9badd54681cf25a4d3
ocr/nld.traineddata.gz3 MBa2d904b6ddc4feb0d31ecfcd7361a554102e7aa2e278c54f4fc029e0d0815571

Die Ausgabeprüfung

Bevor Ihnen die Datei angeboten wird, liest das Werkzeug sie auf Wegen, die von dem unabhängig sind, der sie geschrieben hat: den Text mit einem zweiten PDF-Leser; die Objekte der Datei einzeln durchlaufen, jeder Datenstrom entpackt. Jedes geschwärzte Element wird darin in allen Formen gesucht (Leerzeichen, Akzente, Großbuchstaben). Die Struktur wird geprüft: keine Anmerkung, kein Formular, kein Lesezeichen, kein Anhang, keine Metadaten, und nur eine Version.

Findet es irgendetwas, wird die Datei nicht angeboten, und der Bildschirm sagt, was gefunden wurde und wo.

Was nicht garantiert ist

  • Browsererweiterungen können die Seiten lesen, die Sie öffnen. Nutzen Sie für ein sensibles Dokument ein Profil ohne Erweiterungen.
  • Ein kompromittierter Rechner (Spionagesoftware, Bildschirmaufzeichnung) sieht alles, was Sie sehen. Dagegen kann keine Website etwas tun.
  • Der Browser selbst sendet je nach Einstellungen Informationen an seinen Hersteller (Updates, Absturzberichte).
  • Der Kontext: Ein Dokument mit geschwärzten Namen kann erkennbar bleiben. Siehe Pseudonymisierung oder Anonymisierung.
  • Die Erkennung schlägt vor, sie garantiert nicht, alles gesehen zu haben. Das Gegenlesen liegt bei Ihnen.