Ähnlich aussehende Buchstaben
CYRILLIC SMALL LETTER A (U+0430)
Der kyrillische Buchstabe a. In fast jeder Schriftart wird er genauso gezeichnet wie das lateinische a, und er ist ein völlig anderer Codepoint.
- Codepoint
U+0430- Kategorie
- Ähnlich aussehende Buchstaben
- Standardmäßig entfernt
- Nein
- Zuständige Option
- Ähnlich aussehende Buchstaben
--confusables - Kann tragend sein
- Nein
Woher es kommt
Russischer, ukrainischer, bulgarischer und serbischer Text, ganz selbstverständlich. In lateinischen Wörtern kommt er von einer noch aktiven kyrillischen Tastaturbelegung, aus dem Kopieren aus gemischtem Text und aus absichtlicher Vertauschung – Domain-Täuschung, Filterumgehung und Homoglyphen-Steganografie, die Bits kodiert, indem sie lateinische Buchstaben gegen Doppelgänger tauscht.
Warum es zählt
Ein einziger vertauschter Buchstabe hebelt jede exakte Prüfung aus und bleibt beim Lesen unsichtbar. So wird „pаypal.com“ registriert, so rutscht ein gesperrtes Wort an einem Filter vorbei, und so landet ein verstecktes Bit in einem Wort.
Vorher und nachher
Ein kyrillischer Buchstabe in einem ansonsten lateinischen Wort. Die Darstellung ist identisch, die Zeichenkette nicht.
Das Zeichen wird als beschriftete Marke dargestellt, damit du siehst, wo es sitzt. In deinem Text zeichnet es überhaupt nichts.
Wann es berechtigt ist
Im Russischen, Ukrainischen, Bulgarischen, Serbischen und jeder anderen kyrillisch geschriebenen Sprache – also in einer sehr großen Menge ganz gewöhnlichen Textes.
So entfernst du es
Schalte Ähnlich aussehende Buchstaben (`--confusables`) ein, dann wird er durch das lateinische „a“ ersetzt. Vorsicht: Diese Option bildet 1.513 Codepoints auf das Lateinische ab und zerstört echten kyrillischen, griechischen, armenischen und Cherokee-Text. Benutz sie, wenn du weißt, dass der Text lateinisch sein soll.
Ist das ein KI-Wasserzeichen?
Kein Wasserzeichen
Nein. Ein kyrillischer Buchstabe in einem lateinischen Wort ist entweder ein Tastaturartefakt oder eine absichtliche Vertauschung durch einen Menschen. Sprachmodelle setzen keine Homoglyphen als Markierung; sie erzeugen sie nur, wenn der umgebende Text tatsächlich kyrillisch ist.
Keine Verbindung zu maschinell erzeugtem Text. Es kommt aus einer Software, von einer Tastatur oder von einem Menschen.
Fragen
Funktionieren Doppelgänger-Domains so?
Ja. Ein internationalisierter Domainname kann kyrillische Buchstaben enthalten, die wie lateinische aussehen. Browser wehren sich dagegen, indem sie die Punycode-Form anzeigen, sobald ein Name Schriften mischt.
Zerstört `--confusables` russischen Text?
Ja. Die Option bildet Doppelgänger bedingungslos auf das Lateinische ab, russischer, griechischer, armenischer und Cherokee-Text wird also zerstört. Deshalb ist sie voreingestellt aus, und deshalb sagt der Schalter das auch.
Wie finde ich sie, ohne etwas zu ändern?
Lass dir den Text zeigen, statt ihn zu säubern. Jeder ähnlich aussehende Buchstabe wird mit Position, Codepoint und dem lateinischen Buchstaben aufgeführt, den er nachahmt – und nichts wird verändert.
Prüf deinen eigenen Text
Füg irgendetwas in den Textreiniger ein und sieh jedes unsichtbare Zeichen darin – mit Position, Codepoint und dem, was mit jedem einzelnen passiert. Nichts wird hochgeladen.