Unicode opzoeken

Plak een mysterieus teken, de vreemde witruimte die je gebruiker plakte, een glyph uit een lettertypevoorbeeld of een emoji die je regex breekt, en het opzoeken geeft het Unicode-codepunt (U+XXXX) en de rauwe UTF-8-bytes in hexadecimaal terug, één regel per teken.

Zo identificeer je een Unicode-teken

  1. 1

    Plak het teken

    Je kunt één glyph of een hele tekenreeks plakken: elk teken wordt op volgorde geanalyseerd.

  2. 2

    Lees het codepunt

    Krijg de canonieke U+-notatie in hoofdletters, aangevuld met nullen tot minstens vier hexadecimale cijfers.

  3. 3

    Bekijk de UTF-8-bytes

    Zie de reeks van 1–4 bytes die het teken op schijf of over het netwerk inneemt.

  4. 4

    Kopieer de resultaten

    De uitvoer is een tabel in CSV-vorm (teken, codepunt, UTF-8-bytes) die je kunt selecteren en plakken in een spreadsheet of foutrapport.

Typisch speurwerk dat je met een opzoeking kunt doen

De meeste Unicode-bugs zien er op het scherm identiek uit. De enige manier om een gewone spatie van een vaste spatie te onderscheiden, of een gekrulde apostrof van een prime, is het codepunt te bekijken.

Veelvoorkomende valkuilen die het opzoeken oplost

Lijkt op Is in werkelijkheid Codepunt
Spatie Vaste spatie U+00A0
Spatie Smalle vaste spatie U+202F
(niets) Spatie met nulbreedte U+200B
(niets) Verbinder met nulbreedte U+200D
Apostrof Rechter enkel aanhalingsteken U+2019
Apostrof Prime (voet/minuten) U+2032
Koppelteken En-streepje U+2013
Koppelteken Vast koppelteken U+2011

UTF-8-byte-indeling in één oogopslag

  • 1 byte, ASCII, U+0000 tot U+007F (0xxxxxxx)
  • 2 bytes, Latijnse aanvulling, Arabisch, Hebreeuws (110xxxxx 10xxxxxx)
  • 3 bytes, CJK, de meeste symbolen (1110xxxx 10xxxxxx 10xxxxxx)
  • 4 bytes, emoji, zeldzame schriften (11110xxx 10xxxxxx 10xxxxxx 10xxxxxx)

Als je databasekolom een vaste bytelengte heeft, neemt een emoji van 4 bytes vier plekken in, ook al wordt hij als één glyph weergegeven, een veelvoorkomende oorzaak van afkapfouten.

Veelgestelde vragen

Meestal BOM-markeringen (U+FEFF) aan het begin van het bestand of verdwaalde verbinders met nulbreedte uit een tekstverwerker. Plak er een in het opzoeken en het vertelt je meteen wat het is, waarna je ze met een simpele zoek-en-vervang kunt verwijderen.

Ja. Het opzoeken gaat teken voor teken, dus een heel woord levert één regel per teken op met het codepunt en de UTF-8-bytes.

Een codepunt is de abstracte identiteit van een teken: U+00E9 is altijd “é”, waar je het ook opslaat. UTF-8 is een van de vele coderingen die een codepunt in bytes omzetten; dezelfde “é” is de twee bytes C3 A9 in UTF-8, maar de enkele byte E9 in Latin-1.

Ja. Het opzoeken gebeurt op onze server: de geplakte tekens worden verstuurd, geanalyseerd en hun codepunt en UTF-8-bytes komen direct terug. We bewaren de verzonden tekst niet.

Gerelateerde tools

Tool beschikbaar in andere talen