Unicode naar UTF-8 converter
Zet letterlijke Unicode-tekst om naar de escape-syntaxis \u00E9, \u{1F600} die programmeertalen in broncode inbedden, of plak een geëscapete tekenreeks en decodeer die terug naar de oorspronkelijke tekens. Werkt voor BMP-tekens (viercijferige escapes) en aanvullende vlakken zoals emoji (variabele lengte \u{...}).
Zo converteer je tussen Unicode en UTF-8-escapes
-
1
Kies een richting
Codeer tekens naar `\u`-escapes, of decodeer een geëscapete tekenreeks terug naar tekst.
-
2
Plak je invoer
Platte tekst om te coderen; een tekenreeks met `\uXXXX`- of `\u{XXXXX}`-reeksen om te decoderen.
-
3
Lees de uitvoer
BMP-tekens leveren viercijferige escapes in de stijl `\u0041`; tekens boven U+FFFF gebruiken de ES6-vorm `\u{...}`.
-
4
Kopieer naar je code
Zet het resultaat in een JavaScript-tekenreeks, een JSON-literal, een configuratiebestand of een testfixture.
Escape-syntaxis in verschillende talen
Verschillende talen drukken hetzelfde idee anders uit. De converter geeft de gangbare JavaScript/JSON-vorm, maar dit is waarnaar je vertaalt wanneer je hetzelfde teken elders schrijft.
Escape-syntaxis per taal
| Taal | BMP (<= U+FFFF) | Aanvullend (> U+FFFF) |
|---|---|---|
| JavaScript | \u00E9 |
\u{1F600} (ES6+) |
| JSON | \u00E9 |
Surrogaatpaar \uD83D\uDE00 |
| Python | \u00e9 |
\U0001F600 |
| Java | \u00e9 |
Surrogaatpaar |
| C / C++ | \u00e9 |
\U0001F600 |
| Ruby | \u00e9 |
\u{1F600} |
| Rust | \u{00e9} |
\u{1F600} |
| HTML-entiteit | é |
😀 |
| CSS | \0000e9 |
\1F600 |
Waarom emoji de lange vorm nodig hebben
De Basic Multilingual Plane (BMP) omvat U+0000 tot U+FFFF, alles past in één 16-bits eenheid, waarvoor de oude \uXXXX-syntaxis is ontworpen. Emoji zitten vooral in vlak 1 (U+1F000 en hoger), dat niet in vier hexadecimale cijfers past. Twee opties:
- ES6-accolades,
\u{1F600}accepteert elke lengte. - UTF-16-surrogaatparen, twee
\uXXXX-escapes voor één teken. JSON-parsers accepteren dit, en het is wat JSON-encoders meestal produceren.
Beide decoderen naar dezelfde tekenreeks, maar surrogaatparen zijn kwetsbaar: een tekenreeks knippen tussen het hoge en lage surrogaat geeft ongeldige UTF-16.
Veelgestelde vragen
Vier hexadecimale cijfers reiken maximaal tot U+FFFF. Emoji beginnen bij U+1F000, dus hebben ze de ES6-accoladevorm \u{...} nodig, of een UTF-16-surrogaatpaar als je met oudere doelen werkt. Dit hulpmiddel gebruikt accolades voor alles boven U+FFFF.
Niet als paar. De decoder begrijpt de accoladevorm \u{1F600} en viercijferige \uXXXX-escapes, maar hij voegt een UTF-16-surrogaatpaar (de vorm met twee escapes die JSON gebruikt) niet samen tot één emoji: elke helft wordt afzonderlijk gedecodeerd en valt niet te reconstrueren. Plak voor alles boven U+FFFF de accoladevorm \u{...}, precies wat de encoder ook produceert.
Nee. Een escape als \u00E9 staat voor het codepunt U+00E9, niet voor de UTF-8-bytereeks (die C3 A9 zou zijn). Gebruik voor de weergave van ruwe bytes het hulpmiddel Unicode Lookup, dat UTF-8-bytes in HEX toont.
De conversie gebeurt aan de serverzijde binnen dit verzoek, maar er wordt niets bewaard: geen logging, geen opslag van de tekenreeksen die je converteert.
Gerelateerde tools
ASCII-tabelreferentie
Volledige ASCII-tabel van 0 tot 127 met decimale, hexadecimale, octale en binaire waarden en HTML-numerieke referentienotatie, inclusief control codes zoals NUL, LF en DEL.
HTML-tekenreferentie
Een doorzoekbare lijst met HTML-entiteiten, hun benoemde en numerieke codes, plus kopiëren met één klik voor speciale tekens en symbolen.
JSON naar PHP-array
Zet JSON om naar een PHP-array-literal met korte syntaxis, associatieve/geïndexeerde arrays en geneste structuren, klaar om in een .php-bestand te plakken.
Luhn-algoritme-checker
Controleer de creditcardnummer, IMEI, SIN en andere door Luhn beschermden nummers. Geef een resultaat terug (goed of fout) en toon elke stap van het verdubbelen en het berekenen van de controlesom aan.
Sneltoetsenoverzicht
Zoek gedocumenteerde standaardsneltoetsen voor VS Code, Chrome en Bash met GNU Readline op macOS, Windows en Linux.
JavaScript-obfuscator
Obfusceer JavaScript met string-array-codering, hernoemen van variabelen, control-flow-flattening en injectie van dode code ter bescherming van de front-end.
Tool beschikbaar in andere talen
- Konverter Unicode ke UTF-8 [ID]
- Konwerter Unicode na UTF-8 [PL]
- Unicode till UTF-8-omvandlare [SV]
- เครื่องแปลง Unicode เป็น UTF-8 [TH]
- Unicode zu UTF-8 Konverter [DE]
- UnicodeからUTF-8への変換ツール [JA]
- 유니코드-UTF-8 변환기 [KO]
- Convertidor de Unicode a UTF-8 [ES]
- Conversor de Unicode para UTF-8 [PT]
- Chuyển đổi từ Unicode sang UTF-8 [VI]
- Convertisseur Unicode en UTF-8 [FR]
- مُحوّل يونيكود إلى UTF-8 [AR]
- Unicode to UTF-8 Converter [EN]
- Convertitore da Unicode a UTF-8 [IT]
- Конвертер Unicode в UTF-8 [RU]
- Unicode'dan UTF-8'e Dönüştürücü [TR]
- Unicode 到 UTF-8 转换器 [ZH]