Limpar um documento
DOCX, ODT, HTML, Markdown ou texto simples. O arquivo é aberto no seu navegador e nunca é enviado: não existe servidor para onde mandá-lo.
- Roda no seu navegador
- DOCX · ODT · HTML · MD · TXT
- Seu arquivo original nunca é modificado
Solte um arquivo aqui
DOCX, ODT, HTML, Markdown ou texto simples, até 25 MB.
O que é inspecionado, formato por formato
Os nós de texto são limpos em todos os formatos. O que mais é relatado depende do que aquele formato consegue esconder.
| Formato | Limpa | Relata |
|---|---|---|
| DOCX | Texto do documento, cabeçalhos, rodapés, notas de rodapé, notas de fim e comentários, inclusive caracteres escritos como entidades numéricas. | Trechos ocultos, texto branco sobre branco e texto minúsculo, alterações controladas, comentários, sessões de rsid, metadados de autoria, propriedades personalizadas, macros, mídia. |
| ODT | Todos os nós de texto do content.xml. Os atributos nunca são tocados. | Anotações, regiões com alterações controladas, estilos ocultos, gerador, criadores, ciclos de edição, campos definidos pelo usuário. |
| HTML | Só os nós de texto. Tags, atributos, comentários, script e style passam byte a byte idênticos. | Comentários, elementos com display:none / hidden / font-size:0, a meta tag de gerador, caracteres suspeitos em atributos alt/title/aria. |
| Markdown · TXT | O arquivo inteiro. As quebras de linha são preservadas, a menos que você peça para unificá-las. | Nada a relatar além dos próprios caracteres. Texto simples não tem estrutura onde se esconder. |
Como funciona
Escolha um arquivo
Solte um .docx, .odt, .html, .md ou .txt na página, ou escolha um pelo botão de arquivo. Ele é lido pelo navegador; nada é enviado para lugar nenhum.
Leia o relatório
Cada caractere oculto é listado com a sua posição, o seu ponto de código e o seu nome Unicode, ao lado do que o arquivo esconde em volta do texto: trechos invisíveis, comentários, alterações controladas, metadados de autoria.
Escolha o que remover
Os padrões removem os caracteres que são contrabando em qualquer texto. As treze chaves avançadas, mais os metadados e os rsids, são opcionais porque cada uma muda algo visível.
Baixe a cópia limpa
Um arquivo novo é produzido na memória e oferecido para download. O seu original nunca é modificado.
Veja um relatório do documento
Um .docx é aberto no navegador, sem nenhum servidor para onde enviá-lo. O relatório conta primeiro os caracteres ocultos do texto por ponto de código e depois passa ao que se esconde em volta do texto: controle de alterações, comentários e os metadados de autoria que vieram junto com o arquivo. Isso é relatado, não apagado por você.
Assistir
Ler um relatório do documento
30 segundos · Legendas incluídas
O que isto não faz
- PDF. Texto num PDF não é reescrito no lugar com segurança; inspeção e remoção de metadados estão planejadas, edição não.
- Imagens. Metadados EXIF, XMP e C2PA são outro problema e outra ferramenta.
- Ele nunca apaga um trecho oculto, uma alteração controlada ou um comentário. Essas coisas são relatadas para você decidir.
- Marcas d'água estatísticas como a SynthID-Text vivem na escolha das palavras, não nos caracteres. Nada aqui toca nelas.
A mesma coisa, na linha de comando
O clean_file.py é a implementação de referência da qual esta página é uma porta. Ele roda offline, aceita as mesmas flags e tem um modo --check para hooks de pre-commit.
./clean_file.py --show essay.docx
./clean_file.py -i --metadata --rsids essay.docx
./clean_file.py -s --punct essay.docx
Perguntas sobre documentos
Meu documento é enviado para algum lugar?
Não. O Ghostchars é um site estático, sem back-end. O arquivo é lido pelo seu navegador com a API FileReader, processado na aba, e a cópia limpa é criada na memória. Nada é transmitido, e não existe servidor que pudesse receber isso.
Quais formatos são suportados?
DOCX, ODT, HTML, Markdown e texto simples. DOCX e ODT são pacotes ZIP de XML, que o navegador descompacta e recompacta; o HTML é limpo apenas nos seus nós de texto; Markdown e texto simples são limpos por inteiro.
Por que não PDF?
Um PDF guarda posições de glifos, e não trechos de texto editáveis, então substituir um caractere pode mudar o layout ou quebrar o arquivo. Relatar sobre um PDF e remover os seus metadados é viável e está planejado; reescrever o texto dele não é algo que uma ferramenta deva fazer caladinha.
O que é um rsid e por que eu iria querer removê-lo?
O Word carimba cada sessão de edição com um id aleatório de revisão de 8 dígitos hexadecimais e o grava nos trechos digitados naquela sessão. Um documento com um ou dois rsids distintos no corpo inteiro foi colado de uma vez só, em vez de escrito ao longo do tempo. Removê-los remove essa inferência.
O Word ainda vai abrir o arquivo limpo?
Vai. Cada parte do pacote mantém a sua posição e o seu método de compactação; só o texto dentro dos nós que mudaram é reescrito, e xml:space="preserve" é acrescentado onde a limpeza teria deixado o Word descartar um espaço de borda. Com --metadata, a parte de propriedades personalizadas é descartada, o que deixa um relacionamento solto que o Word tolera, a mesma troca que a ferramenta de linha de comando faz.
E se um caractere oculto estiver escrito como entidade?
Ele é pego do mesmo jeito. Todo nó de texto tem as suas entidades decodificadas antes da limpeza e reescapadas depois, então um espaço de largura zero escrito como ​ é removido exatamente como um literal.