Pular para o conteúdo
Ghostchars

Limpar um documento

DOCX, ODT, HTML, Markdown ou texto simples. O arquivo é aberto no seu navegador e nunca é enviado: não existe servidor para onde mandá-lo.

  • Roda no seu navegador
  • DOCX · ODT · HTML · MD · TXT
  • Seu arquivo original nunca é modificado

Solte um arquivo aqui

DOCX, ODT, HTML, Markdown ou texto simples, até 25 MB.

O que é inspecionado, formato por formato

Os nós de texto são limpos em todos os formatos. O que mais é relatado depende do que aquele formato consegue esconder.

FormatoLimpaRelata
DOCXTexto do documento, cabeçalhos, rodapés, notas de rodapé, notas de fim e comentários, inclusive caracteres escritos como entidades numéricas.Trechos ocultos, texto branco sobre branco e texto minúsculo, alterações controladas, comentários, sessões de rsid, metadados de autoria, propriedades personalizadas, macros, mídia.
ODTTodos os nós de texto do content.xml. Os atributos nunca são tocados.Anotações, regiões com alterações controladas, estilos ocultos, gerador, criadores, ciclos de edição, campos definidos pelo usuário.
HTMLSó os nós de texto. Tags, atributos, comentários, script e style passam byte a byte idênticos.Comentários, elementos com display:none / hidden / font-size:0, a meta tag de gerador, caracteres suspeitos em atributos alt/title/aria.
Markdown · TXTO arquivo inteiro. As quebras de linha são preservadas, a menos que você peça para unificá-las.Nada a relatar além dos próprios caracteres. Texto simples não tem estrutura onde se esconder.

Como funciona

  1. Escolha um arquivo

    Solte um .docx, .odt, .html, .md ou .txt na página, ou escolha um pelo botão de arquivo. Ele é lido pelo navegador; nada é enviado para lugar nenhum.

  2. Leia o relatório

    Cada caractere oculto é listado com a sua posição, o seu ponto de código e o seu nome Unicode, ao lado do que o arquivo esconde em volta do texto: trechos invisíveis, comentários, alterações controladas, metadados de autoria.

  3. Escolha o que remover

    Os padrões removem os caracteres que são contrabando em qualquer texto. As treze chaves avançadas, mais os metadados e os rsids, são opcionais porque cada uma muda algo visível.

  4. Baixe a cópia limpa

    Um arquivo novo é produzido na memória e oferecido para download. O seu original nunca é modificado.

Veja um relatório do documento

Um .docx é aberto no navegador, sem nenhum servidor para onde enviá-lo. O relatório conta primeiro os caracteres ocultos do texto por ponto de código e depois passa ao que se esconde em volta do texto: controle de alterações, comentários e os metadados de autoria que vieram junto com o arquivo. Isso é relatado, não apagado por você.

Assistir

Ler um relatório do documento

30 segundos · Legendas incluídas

O que isto não faz

  • PDF. Texto num PDF não é reescrito no lugar com segurança; inspeção e remoção de metadados estão planejadas, edição não.
  • Imagens. Metadados EXIF, XMP e C2PA são outro problema e outra ferramenta.
  • Ele nunca apaga um trecho oculto, uma alteração controlada ou um comentário. Essas coisas são relatadas para você decidir.
  • Marcas d'água estatísticas como a SynthID-Text vivem na escolha das palavras, não nos caracteres. Nada aqui toca nelas.

A mesma coisa, na linha de comando

O clean_file.py é a implementação de referência da qual esta página é uma porta. Ele roda offline, aceita as mesmas flags e tem um modo --check para hooks de pre-commit.

./clean_file.py --show essay.docx
./clean_file.py -i --metadata --rsids essay.docx
./clean_file.py -s --punct essay.docx

Perguntas sobre documentos

Meu documento é enviado para algum lugar?

Não. O Ghostchars é um site estático, sem back-end. O arquivo é lido pelo seu navegador com a API FileReader, processado na aba, e a cópia limpa é criada na memória. Nada é transmitido, e não existe servidor que pudesse receber isso.

Quais formatos são suportados?

DOCX, ODT, HTML, Markdown e texto simples. DOCX e ODT são pacotes ZIP de XML, que o navegador descompacta e recompacta; o HTML é limpo apenas nos seus nós de texto; Markdown e texto simples são limpos por inteiro.

Por que não PDF?

Um PDF guarda posições de glifos, e não trechos de texto editáveis, então substituir um caractere pode mudar o layout ou quebrar o arquivo. Relatar sobre um PDF e remover os seus metadados é viável e está planejado; reescrever o texto dele não é algo que uma ferramenta deva fazer caladinha.

Por que trechos ocultos e comentários são relatados em vez de removidos?

Porque removê-los muda o documento. Um trecho oculto pode ser um marcador de modelo; um comentário pode ser a razão de o documento existir. O Ghostchars avisa que eles estão ali e quantos são; apagá-los é uma decisão editorial que pertence a você.

O que é um rsid e por que eu iria querer removê-lo?

O Word carimba cada sessão de edição com um id aleatório de revisão de 8 dígitos hexadecimais e o grava nos trechos digitados naquela sessão. Um documento com um ou dois rsids distintos no corpo inteiro foi colado de uma vez só, em vez de escrito ao longo do tempo. Removê-los remove essa inferência.

O Word ainda vai abrir o arquivo limpo?

Vai. Cada parte do pacote mantém a sua posição e o seu método de compactação; só o texto dentro dos nós que mudaram é reescrito, e xml:space="preserve" é acrescentado onde a limpeza teria deixado o Word descartar um espaço de borda. Com --metadata, a parte de propriedades personalizadas é descartada, o que deixa um relacionamento solto que o Word tolera, a mesma troca que a ferramenta de linha de comando faz.

E se um caractere oculto estiver escrito como entidade?

Ele é pego do mesmo jeito. Todo nó de texto tem as suas entidades decodificadas antes da limpeza e reescapadas depois, então um espaço de largura zero escrito como ​ é removido exatamente como um literal.

Estatísticas de uso anônimas?

O Ghostchars processa seu texto no navegador e nunca o envia para lugar nenhum. Gostaríamos de contar as visitas às páginas com um serviço de medição hospedado por nós, com o mínimo de cookies. Nunca o conteúdo, em hipótese alguma.