Índice de caracteres ocultos
Cada ponto de código com página própria: para que serve, de onde vem, quando está fazendo um trabalho de verdade e se a limpeza padrão o remove.
49 caracteres documentados
Agrupados pela categoria que o mecanismo informa. Dentro de uma categoria, a opção que remove o caractere é a mesma em todas as linhas.
Largura zero e invisíveis
Governado por Limpeza padrão (sempre ativo)
| Ponto de código | Nome | Limpeza padrão |
|---|---|---|
| U+200B | ZERO WIDTH SPACEUm espaço sem largura nenhuma. Ele ocupa uma posição na string, marca um lugar onde a linha pode quebrar e não desenha absolutamente nada. | Sim |
| U+2060 | WORD JOINERO oposto do espaço de largura zero: um caractere invisível que proíbe a quebra de linha na posição dele, sem acrescentar largura nenhuma. | Sim |
| U+00AD | SOFT HYPHENUm hífen condicional. Ele é invisível até a linha quebrar exatamente ali, e nesse momento um hífen aparece. | Sim |
| U+FEFF | ZERO WIDTH NO-BREAK SPACEA marca de ordem de bytes, U+FEFF, que editores e mensagens de erro costumam escrever como ufeff. Bem no começo de um arquivo ela anuncia a codificação; em qualquer outro lugar é um nada invisível que ainda por cima proíbe a quebra de linha, uso que o Unicode desaconselha desde a versão 3.2. | Sim |
| U+2061 | FUNCTION APPLICATIONUm operador matemático invisível que significa "aplique esta função a este argumento": o operador silencioso entre o f e o (x). | Sim |
| U+2062 | INVISIBLE TIMESO sinal de multiplicação invisível: o operador que se quer dizer quando você escreve "2x" pensando em "2 vezes x". | Sim |
| U+2063 | INVISIBLE SEPARATORA vírgula invisível, U+2063 INVISIBLE SEPARATOR: o separador entre os índices de um subscrito como aij. | Sim |
| U+2064 | INVISIBLE PLUSO sinal de adição invisível usado entre as partes de um número misto: o "e" de "um e meio". | Sim |
| U+034F | COMBINING GRAPHEME JOINERUma marca combinante de largura zero que existe para mudar como dois caracteres são ordenados e agrupados, não como eles aparecem. Ela nunca se desenha. | Sim |
| U+180E | MONGOLIAN VOWEL SEPARATORUm controle ortográfico do mongol que foi reclassificado no Unicode 6.3: ele era um espaço e hoje é um caractere de formatação de largura zero. | Sim |
| U+2800 | BRAILLE PATTERN BLANKA célula braille sem nenhum ponto levantado. É um caractere de impressão com largura de avanço real, mas nada é desenhado. | Sim |
| U+3164 | HANGUL FILLERUm caractere de compatibilidade do hangul sem forma nenhuma, usado historicamente para preencher um lugar vazio dentro de um bloco silábico coreano. | Sim |
| U+FDD0-U+FDEF | NONCHARACTERSPontos de código que o Unicode reservou permanentemente para nunca serem caracteres: U+FDD0-U+FDEF, mais os dois últimos pontos de código de cada plano (U+FFFE, U+FFFF, U+1FFFE e assim por diante). | Sim |
Substituições bidirecionais
Governado por Limpeza padrão (sempre ativo)
| Ponto de código | Nome | Limpeza padrão |
|---|---|---|
| U+202E | RIGHT-TO-LEFT OVERRIDEUm controle invisível que força todos os caracteres seguintes a serem dispostos da direita para a esquerda, não importa a que escrita eles pertençam. | Sim |
| U+202D | LEFT-TO-RIGHT OVERRIDEO espelho do U+202E: força tudo o que vem depois a ser disposto da esquerda para a direita, passando por cima da direção natural do hebraico ou do árabe. | Sim |
| U+202A | LEFT-TO-RIGHT EMBEDDINGAbre um trecho da esquerda para a direita dentro do texto ao redor, até que um POP DIRECTIONAL FORMATTING correspondente o feche. | Sim |
| U+202B | RIGHT-TO-LEFT EMBEDDINGAbre um trecho da direita para a esquerda dentro do texto ao redor, até que um POP DIRECTIONAL FORMATTING correspondente o feche. | Sim |
| U+202C | POP DIRECTIONAL FORMATTINGFecha a incorporação ou a sobreposição mais recente. Sozinho, não faz nada; em par, encerra um trecho direcional. | Sim |
Marcas bidirecionais
Governado por Marcas bidi --bidi
| Ponto de código | Nome | Limpeza padrão |
|---|---|---|
| U+200E | LEFT-TO-RIGHT MARKUm caractere invisível de largura zero com direção forte da esquerda para a direita. Ele resolve ambiguidades em texto misto sem reordenar nada por conta própria. | Quando está solto |
| U+200F | RIGHT-TO-LEFT MARKO espelho do U+200E: um caractere invisível com direção forte da direita para a esquerda, usado para resolver ambiguidades em texto de direção mista. | Quando está solto |
| U+061C | ARABIC LETTER MARKUma marca invisível com a direção de uma letra árabe, criada no Unicode 6.3 para os casos em que uma marca da direita para a esquerda não é forte o bastante. | Quando está solto |
| U+2066-U+2069 | BIDIRECTIONAL ISOLATESQuatro controles invisíveis (LRI, RLI, FSI e PDI) que embrulham um trecho de texto para que a direção dele não vaze para o texto em volta. Eles são a substituição moderna dos controles de incorporação e de sobreposição. | Quando está solto |
Ligadores, seletores e preenchedores
Governado por Agressivo -a
| Ponto de código | Nome | Limpeza padrão |
|---|---|---|
| U+200D | ZERO WIDTH JOINERUm caractere invisível que pede para dois vizinhos serem desenhados como um só. É ele que transforma três pessoas separadas em um emoji de família e é ele que liga letras árabes e índicas que ficariam soltas. | Quando está solto |
| U+200C | ZERO WIDTH NON-JOINERO oposto do ligador: um caractere invisível que proíbe dois vizinhos de serem desenhados como uma forma conectada só. | Quando está solto |
| U+FE00-U+FE0F | VARIATION SELECTORSDezesseis modificadores invisíveis que escolhem qual das várias formas o caractere anterior deve assumir. O VS15 (U+FE0E) pede a forma de texto em preto e branco; o VS16 (U+FE0F) pede a forma colorida de emoji. | Quando está solto |
| U+E0000-U+E007F | TAG CHARACTERSUma cópia fantasma do ASCII. Os pontos U+E0020-U+E007E espelham os caracteres imprimíveis do ASCII, um a um, e não desenham nada. O U+E007F CANCEL TAG encerra a sequência. | Quando está solto |
| U+180B-U+180D | MONGOLIAN FREE VARIATION SELECTORSTrês seletores invisíveis (FVS1-FVS3) que escolhem qual forma posicional uma letra mongol assume quando a modelagem padrão não é a que a palavra pede. | Quando está solto |
| U+17B4-U+17B5 | KHMER INHERENT VOWELSDois sinais de vogal invisíveis do khmer, AQ e AA, que escrevem por extenso uma vogal que normalmente fica implícita. | Quando está solto |
| U+115F-U+1160 | HANGUL JAMO FILLERSDois preenchedores de largura zero, U+115F HANGUL CHOSEONG FILLER e U+1160 HANGUL JUNGSEONG FILLER, que ocupam o lugar de uma consoante inicial ou de uma vogal medial ausente quando um bloco silábico coreano é escrito em jamo. No dia a dia eles são o preenchedor choseong e o preenchedor jungseong. | Quando está solto |
Caracteres de uso privado
Governado por Caracteres de uso privado --pua
| Ponto de código | Nome | Limpeza padrão |
|---|---|---|
| U+E000-U+F8FF | PRIVATE USE AREAPontos de código a que o Unicode nunca vai atribuir significado, reservados para acordos privados entre uma fonte e o software que a usa. U+E000-U+F8FF, mais dois planos suplementares grandes. | Não |
Espaços exóticos
Governado por Espaços -s
| Ponto de código | Nome | Limpeza padrão |
|---|---|---|
| U+00A0 | NO-BREAK SPACEUm espaço que proíbe a quebra de linha. Ele é exatamente igual a um espaço comum na tela e é um ponto de código completamente diferente. | Não |
| U+202F | NARROW NO-BREAK SPACEUm espaço inquebrável mais fino, com cerca de metade da largura de um espaço comum, usado onde um espaço inteiro ficaria largo demais. | Não |
| U+205F | MEDIUM MATHEMATICAL SPACEUm espaço de quatro dezoito avos de em, definido para a composição de matemática: o intervalo em volta de um operador binário. | Não |
| U+3000 | IDEOGRAPHIC SPACEUm espaço de largura total, exatamente tão largo quanto um caractere CJK. É a barra de espaço de um método de entrada japonês, chinês ou coreano no modo de largura total. | Não |
| U+1680 | OGHAM SPACE MARKO separador de palavras da escrita ogâmica. Ao contrário do que se espera de um espaço, ele é desenhado como um traço curto na maioria das fontes de ogâmico, e fica em branco em todas as outras. | Não |
| U+2000-U+200A | GENERAL PUNCTUATION SPACESOnze espaços tipográficos de largura fixa: quadratim en, quadratim em, espaço en, espaço em, espaço de um terço de em, de um quarto de em, de um sexto de em, espaço de algarismo, espaço de pontuação, espaço fino e espaço capilar. | Não |
Separadores de linha
Governado por Quebras de linha -n
| Ponto de código | Nome | Limpeza padrão |
|---|---|---|
| U+2028 | LINE SEPARATORO caractere de "nova linha aqui" do próprio Unicode, diferente do line feed do ASCII. Ele termina uma linha sem terminar o parágrafo. | Não |
| U+2029 | PARAGRAPH SEPARATORA quebra de parágrafo do Unicode: a contraparte do U+2028, um nível acima. | Não |
| U+0085 | NEXT LINEO NEL, um controle C1 que significa "comece uma nova linha". Ele vem do EBCDIC, onde era o caractere de nova linha. | Não |
Caracteres de controle
Governado por Caracteres de controle --controls
| Ponto de código | Nome | Limpeza padrão |
|---|---|---|
| U+0000-U+001F | C0 CONTROL CHARACTERSOs 32 códigos de controle do ASCII: NUL, BEL, ESC, os separadores de arquivo e de registro e o resto. Eles são comandos para um teletipo, não texto. | Não |
| U+0080-U+009F | C1 CONTROL CHARACTERSUm segundo bloco de 32 códigos de controle herdado da ISO 8859. No Unicode eles são controles; no Windows-1252, os mesmos valores de byte são as aspas curvas, o travessão e o símbolo do euro. | Não |
Pontuação tipográfica
Governado por Pontuação --punct
| Ponto de código | Nome | Limpeza padrão |
|---|---|---|
| U+2013 | EN DASHO traço de comprimento médio usado em intervalos e algumas relações na tipografia editorial. | Não |
| U+2014 | EM DASHO traço longo, com a largura de um em. Ele destaca um aparte, ou marca uma interrupção onde a vírgula seria discreta demais. | Não |
| U+2019 | RIGHT SINGLE QUOTATION MARKA aspa simples curva de fechamento e, em português, o apóstrofo correto: copo d’água, Sant’Ana, pingo d’água. | Não |
| U+2026 | HORIZONTAL ELLIPSISTrês pontos em um único caractere, com espaçamento mais apertado que três pontos finais e sem chance de a linha quebrar no meio. | Não |
Letras parecidas
Governado por Letras parecidas --confusables
| Ponto de código | Nome | Limpeza padrão |
|---|---|---|
| U+0430 | CYRILLIC SMALL LETTER AA letra a do cirílico. Em quase toda fonte ela é desenhada igualzinha ao a latino, e é um ponto de código completamente diferente. | Não |
| U+043E | CYRILLIC SMALL LETTER OA letra o do cirílico, desenhada igualzinha ao o latino em toda fonte de uso comum. | Não |
| U+0435 | CYRILLIC SMALL LETTER IEA letra ie do cirílico, desenhada exatamente como um e latino. | Não |
| U+0441 | CYRILLIC SMALL LETTER ESA letra es do cirílico, desenhada exatamente como um c latino. | Não |