Onzichtbare karakter detector
Plak elke tekst en de detector rapporteert alle onzichtbare tekens die erin zitten: nulbreedte-ruimtes, richtingsaanduidingen, BOM’s, zachte strepen, niet-onderbrekende ruimtes en een groep Unicode-controlecodepunten die eruit zien als lege ruimtes, maar die de zoekfunctie, differentiatiefunctie en kopie-en-plakfunctie belemmeren. Elke detectie wordt vergezeld door het corresponderende codepunt (U+200B), de officiële Unicode-naam en de positie in de string, zodat u precies kunt bepalen waar een mysterieuze fout zich bevindt voordat u deze verwijdert.
Hoe je onzichtbare tekens kunt detecteren
-
1
Plak de tekst
Voeg de verdachte string toe, een codefragment, een gekopieerde bericht of een configuratiewaarde.
-
2
Voer de scan uit
Het hulpmiddel doorloopt elke codepositie en merkt die aan, die overeenkomt met de lijst van onzichtbare of formatieve tekens.
-
3
Beoordeel het rapport
Elke treffer toont zijn positie (met index vanaf 1), zijn codepoint in het formaat `U+HHHH` en zijn Unicode-naam (Spatie met nulbreedte, BOM, enz.).
-
4
De tekst schoonmaken
Gebruik de vervangingsfunctie om de verborgen tekens te verwijderen of zichtbaar te maken, en plak daarna de gesaniteerde versie terug.
Onzichtbare karakters en waar ze vandaan komen
Deze tekens bestaan om legitieme redenen (tekstopmaak, schrijfrichting, combinerende tekens). Ze worden fouten wanneer ze buiten de context waarvoor ze zijn ontworpen terechtkomen in code, configuratie, zoekopdrachten of gebruikersnamen.
Tekens waar de detector naar zoekt
| Codepoint | Naam | Waar het meestal binnensluipt |
|---|---|---|
U+200B |
Spatie met nulbreedte | Tekstverwerkers en rijketeksteditors |
U+200C |
Niet-samenvoeger met nulbreedte | Perzische en Hindi-typografie |
U+200D |
Samenvoeger met nulbreedte | Emoji-reeksen, Indische schriften |
U+200E |
Links-naar-rechts-markering | Tekst met zowel LTR- als RTL-schrift |
U+200F |
Rechts-naar-links-markering | Idem |
U+202A..E |
Inbedding / overschrijving | Idem; soms kwaadaardig gebruikt (Trojan Source) |
U+2028 |
Regelscheidingsteken | Gekopieerd uit Word, breekt JSON-encoders |
U+2029 |
Alineascheidingsteken | Idem |
U+FEFF |
Bytevolgorde-markering | Bestanden die in Notepad als UTF-8 met BOM zijn opgeslagen |
U+00A0 |
Vaste spatie | Typografische witruimte uit Word |
U+00AD |
Zacht afbreekstreepje | Afbreekhints in rijke tekst |
Veelvoorkomende symptomen van een verborgen-tekenfout
- Een stringvergelijking die “gelijk” zou moeten zijn, is dat niet. Kopieer de waarden naar dit hulpmiddel en controleer het aantal bytes.
- Een regex die er met het oog uitziet alsof hij matcht, maar in code faalt. Vaak een
U+00A0die zich voordoet als een spatie. - Een JSON-parser crasht op een geplakte payload. Meestal een BOM aan het begin, of
U+2028in een stringliteral die JavaScript binnen JSON afwijst. - De SEO-titel heeft een verkeerde lengte. Een spatie met nulbreedte laat je een limiet overschrijden zonder zichtbare wijziging.
De invalshoek Trojan Source
Bidirectionele overschrijvingstekens (U+202E, U+2066..U+2069) kunnen broncode in de ene volgorde laten weergeven terwijl die in een andere volgorde wordt gecompileerd; de aanvalsklasse “Trojan Source”. Als u code van niet-vertrouwde bijdragers beoordeelt, haal hun diffs dan door deze detector voordat u samenvoegt.
Veelgestelde vragen
Notepad en sommige oudere Windows-hulpmiddelen gebruiken standaard ‘UTF-8 met BOM’. De BOM (U+FEFF) is geschikt voor Windows-apps, maar werkt niet met veel shell-pipelines, PHP-bestanden (de BOM wordt als uitvoer weergegeven vóór de <?php-tag) en JSON-parsers.
Het ziet er op het scherm uit als een gewone ruimte, maar gedraagt zich anders: het ondersteunt geen regelbraking en komt niet voor in de meeste \s regex-varianten in alle talen. Het komt vaak voor in bestandspaden, e-mailadressen en gebruikersnamen die zijn gekopieerd uit bronnen met rijke tekst.
Niet altijd. In Arabisch, Perzisch of Devanagari-text zijn de zero-width joiner en de non-joiner semantisch vereist. In code, configuratiegegevens en de meeste Engelse teksten mogen deze elementen vrij worden verwijderd. Voor inhoud in natuurlijke taal dient u eerst een detector te gebruiken om deze te controleren voordat u ze verwijdert.
Nee – de analyse wordt uitgevoerd voor de huidige verzoek en niets van wat u invoert wordt opgeslagen of vastgelegd nadat de respons is gegenereerd.
Gerelateerde tools
Kleiner dan of gelijk aan-symbool
Kopieer het teken ≤ en de bijbehorende wiskundige vergelijkingstekens. Inclusief Unicode, HTML-entiteiten en LaTeX-opmaak voor spreadsheets, artikelen en webpagina's.
Pijlsymbolen om te kopiëren
Kopieer veelgebruikte Unicode-pijlen met één klik: recht, dubbel, diagonaal, gehaakt, rond en driehoekig voor documenten, chat en ontwerp.
Dyslexievriendelijke tekstconverter
Herschik geplakte tekst in korte alinea's en regels van ongeveer 72 tekens voor makkelijker lezen. Kopieer het resultaat naar elk document, bericht of elke editor.
Domeinnaamgenerator
Genereer domeinnaamideeën uit één trefwoord: voorvoegsels, achtervoegsels, verdubbelde letters en cijferuitgangen in zes gangbare TLD's.
Anagramoplosser
Voer maximaal 10 letters in en zie elke unieke rangschikking daarvan, met dubbele permutaties verwijderd en een lijst die wordt beperkt tot 200 resultaten.
Woordenteller
Tel woorden, tekens, zinnen en alinea's met leestijd, spreektijd, zoekwoorddichtheid en een Flesch-leesbaarheidsscore voor essays, posts, bijschriften en meta descriptions.
Tool beschikbaar in andere talen
- Détecteur de caractères invisibles [FR]
- Detektor för osynliga tecken [SV]
- เครื่องตรวจจับตัวอักษรที่มองไม่เห็น [TH]
- أداة كشف الأحرف غير المرئية [AR]
- Detektor Karakter Tak Terlihat [ID]
- Bộ phát hiện ký tự vô hình [VI]
- 보이지 않는 문자 탐지기 [KO]
- Unsichtbarer Zeichendetektor [DE]
- Detector de Caracteres Invisibles [ES]
- Detektor niewidzialnych znaków [PL]
- 不可視文字検出器 [JA]
- Detector de Caracteres Invisíveis [PT]
- Обнаружитель невидимых символов [RU]
- Görünmez Karakter Tespit Cihazı [TR]
- 不可见字符检测器 [ZH]
- Invisible Character Detector [EN]
- Rilevatore di Caratteri Invisibili [IT]