Ein Dokument säubern
DOCX, ODT, HTML, Markdown oder reiner Text. Die Datei wird in deinem Browser geöffnet und nie hochgeladen: Es gibt keinen Server, zu dem sie hochgeladen werden könnte.
- Läuft in deinem Browser
- DOCX · ODT · HTML · MD · TXT
- Deine Originaldatei wird nie verändert
Datei hier ablegen
DOCX, ODT, HTML, Markdown oder reiner Text, bis zu 25 MB.
Was pro Format geprüft wird
Textknoten werden in jedem Format gesäubert. Was darüber hinaus gemeldet wird, hängt davon ab, was das jeweilige Format verstecken kann.
| Format | Säubert | Meldet |
|---|---|---|
| DOCX | Text im Dokument, in Kopf- und Fußzeilen, Fuß- und Endnoten sowie Kommentaren; auch Zeichen, die als numerische Entities geschrieben sind. | Ausgeblendete Abschnitte, Weiß auf Weiß und Winzigtext, nachverfolgte Änderungen, Kommentare, rsid-Sitzungen, Metadaten zur Urheberschaft, benutzerdefinierte Eigenschaften, Makros, Medien. |
| ODT | Jeden Textknoten der content.xml. Attribute werden nie angefasst. | Anmerkungen, Bereiche mit nachverfolgten Änderungen, Formatvorlagen für ausgeblendeten Text, Generator, Erstellende, Bearbeitungszyklen, benutzerdefinierte Felder. |
| HTML | Nur Textknoten. Tags, Attribute, Kommentare, Script und Style gehen Byte-identisch durch. | Kommentare, Elemente mit display:none, hidden oder font-size:0, das Generator-Meta-Tag, verdächtige Zeichen in alt-, title- und aria-Attributen. |
| Markdown · TXT | Die ganze Datei. Zeilenenden bleiben erhalten, solange du nicht darum bittest, sie zu falten. | Außer den Zeichen selbst gibt es nichts zu melden: reiner Text hat keine Struktur, in der sich etwas verstecken ließe. |
So funktioniert es
Datei auswählen
Zieh eine .docx, .odt, .html, .md oder .txt auf die Seite oder wähl eine über den Dateiknopf. Sie wird vom Browser gelesen; nichts wird irgendwohin geschickt.
Den Bericht lesen
Jedes unsichtbare Zeichen steht mit Position, Codepoint und Unicode-Namen darin, daneben das, was die Datei rund um den Text versteckt: unsichtbare Abschnitte, Kommentare, nachverfolgte Änderungen, Metadaten zur Urheberschaft.
Aussuchen, was verschwindet
Die Voreinstellung entfernt Zeichen, die in Fließtext überall Schmuggelware sind. Die dreizehn erweiterten Schalter sowie Metadaten und rsids musst du selbst einschalten, weil jeder davon etwas Sichtbares verändert.
Die gesäuberte Kopie herunterladen
Eine neue Datei entsteht im Speicher und wird zum Herunterladen angeboten. Dein Original wird nie verändert.
So sieht ein Dokumentbericht aus
Eine .docx wird im Browser geöffnet, ohne Server, zu dem sie hochgeladen werden könnte. Der Bericht zählt zuerst die versteckten Zeichen im Text nach Codepoint und wendet sich dann dem zu, was sich um den Text herum verbirgt: Änderungsverfolgung, Kommentare und die Metadaten, die mit der Datei gekommen sind. Die werden gemeldet, nicht für dich gelöscht.
Ansehen
Einen Dokumentbericht lesen
30 Sekunden · Untertitel enthalten
Was das hier nicht tut
- PDF. Text in einem PDF lässt sich nicht gefahrlos an Ort und Stelle neu schreiben; Prüfen und Entfernen der Metadaten sind geplant, Bearbeiten nicht.
- Bilder. EXIF-, XMP- und C2PA-Metadaten sind ein anderes Problem und ein anderes Werkzeug.
- Es löscht nie einen ausgeblendeten Abschnitt, eine nachverfolgte Änderung oder einen Kommentar. Die werden gemeldet, damit du entscheiden kannst.
- Statistische Wasserzeichen wie SynthID-Text stecken in der Wortwahl, nicht in Zeichen. Nichts hier rührt sie an.
Dasselbe auf der Kommandozeile
clean_file.py ist die Referenzimplementierung, von der diese Seite eine Portierung ist. Es läuft offline, nimmt dieselben Flags und hat einen --check-Modus für Pre-Commit-Hooks.
./clean_file.py --show essay.docx
./clean_file.py -i --metadata --rsids essay.docx
./clean_file.py -s --punct essay.docx
Fragen zu Dokumenten
Wird mein Dokument irgendwohin hochgeladen?
Nein. Ghostchars ist eine statische Seite ohne Backend. Die Datei wird von deinem Browser über die FileReader-API gelesen, im Tab verarbeitet, und die gesäuberte Kopie entsteht im Speicher. Nichts wird übertragen, und es gibt keinen Server, der sie entgegennehmen könnte.
Welche Formate werden unterstützt?
DOCX, ODT, HTML, Markdown und reiner Text. DOCX und ODT sind ZIP-Pakete aus XML, die der Browser entpackt und wieder verpackt; HTML wird nur in seinen Textknoten gesäubert; Markdown und reiner Text werden als Ganzes gesäubert.
Warum kein PDF?
Ein PDF speichert Glyphenpositionen, keine bearbeitbaren Textabschnitte; ein ersetztes Zeichen kann das Layout verschieben oder die Datei zerstören. Ein PDF zu prüfen und seine Metadaten zu entfernen ist machbar und geplant; seinen Text umzuschreiben ist nichts, was ein Werkzeug stillschweigend tun sollte.
Was ist ein rsid, und warum sollte ich ihn entfernen?
Word stempelt jede Bearbeitungssitzung mit einer zufälligen achtstelligen Hex-Kennung und schreibt sie an die Abschnitte, die in dieser Sitzung getippt wurden. Ein Dokument mit ein oder zwei verschiedenen rsids im ganzen Textkörper wurde in einem Rutsch eingefügt statt über die Zeit geschrieben. Sie zu entfernen nimmt diesen Rückschluss weg.
Öffnet Word die gesäuberte Datei noch?
Ja. Jeder Teil des Pakets behält seine Position und seine Komprimierungsmethode; neu geschrieben wird nur der Text in den Knoten, die sich geändert haben, und dort, wo das Säubern Word sonst ein Randleerzeichen hätte verschlucken lassen, kommt xml:space="preserve" hinzu. Mit --metadata fällt der Teil mit den benutzerdefinierten Eigenschaften weg, was eine ins Leere zeigende Beziehung hinterlässt, die Word toleriert. Denselben Handel geht auch das Kommandozeilenwerkzeug ein.
Was, wenn ein unsichtbares Zeichen als Entity geschrieben ist?
Es wird trotzdem erwischt. Jeder Textknoten wird vor dem Säubern aus seinen Entities dekodiert und danach wieder maskiert, ein als ​ geschriebenes Leerzeichen ohne Breite wird also genauso entfernt wie ein wörtliches.