Tekencodering-converter voor tekstbestanden

Als een tekst café toont als café of naïve als naïve, dan zijn de tekens prima: de codering wordt verkeerd gelezen. Plak de tekst, geef de converter aan met welke codering hij hem moet lezen en naar welke hij hem moet schrijven, en hij hercodeert netjes tussen UTF-8, UTF-16, ISO-8859-1 (Latin-1), Windows-1252 en andere gangbare codetabellen. Kopieer het gecorrigeerde resultaat rechtstreeks naar je editor, spreadsheet of database.

Zo converteer je de tekstcodering

  1. 1

    Plak je tekst

    Elke tekst die verminkt lijkt of die je opnieuw moet coderen voor een ander programma.

  2. 2

    Bekijk de detectie

    Een indicatieve hint toont de waarschijnlijke codering boven het veld.

  3. 3

    Kies de broncodering

    Stel «Van» in op hoe de bytes gelezen moeten worden: UTF-8, Windows-1252, ISO-8859-1, SJIS en meer.

  4. 4

    Kies de doelcodering

    UTF-8 is de moderne standaard; UTF-16, Big5 of GB2312 staan klaar als een specifiek programma ze nodig heeft.

  5. 5

    Converteer en kopieer

    De tekst wordt opnieuw gecodeerd en met één klik kopieer je het resultaat naar het klembord.

Waar coderingsconflicten vandaan komen

Bron Waarschijnlijke codering
Excel «Opslaan als CSV» op Windows Windows-1252
Oude Windows-toepassing Windows-1252
Oud Unix-hulpprogramma ISO-8859-1 (Latin-1)
Moderne macOS-/Linux-editor UTF-8
Japanse Windows-tekst Shift-JIS (SJIS)
Vereenvoudigd Chinees op Windows GB2312
Traditioneel Chinees (Taiwan/Hongkong) Big5

De klassieke symptomen

  • café verschijnt als café wanneer UTF-8-bytes als Latin-1 worden gelezen. Zet «Van» op UTF-8 om de bytes weer juist te interpreteren.
  • ñ wordt ñ om dezelfde reden.
  • Dubbele mojibake zoals café betekent dat de tekst opnieuw is opgeslagen na de eerste verkeerde lezing, waardoor de foute interpretatie een tweede keer werd gecodeerd.
  • Een  vooraan is een UTF-8-bytevolgordemarkering die als drie Latin-1-tekens is gelezen.

Zodra je het symptoom herkent, is de weg meestal duidelijk: lees de tekst als wat hij werkelijk is (Latin-1, Windows-1252 of wat van toepassing is) en schrijf hem terug als UTF-8.

Bytevolgordemarkeringen (BOM)

Deze converter voegt niet bewust een bytevolgordemarkering toe en verwijdert die evenmin: het gedrag volgt de doelcodering. UTF-8-uitvoer heeft geen BOM. Gewone UTF-16-uitvoer begint met een BOM en is big-endian, terwijl UTF-16BE en UTF-16LE de bytes zonder BOM schrijven. Kies UTF-8 tenzij een specifiek programma om UTF-16 vraagt.

Wanneer een teken geen equivalent heeft

Sommige bytes hebben geen betekenis in de gekozen broncodering, en sommige tekens kunnen niet in de doelcodering worden weergegeven. Dan vervangt de conversie ze door een markering in plaats van te stoppen. Het belangrijkste is de juiste broncodering: een tekenreeks met alleen ASCII is geldig in elke codering, dus een conflict komt meestal pas naar voren bij tekens met accenten of niet-Latijnse tekens.

Veelgestelde vragen

De lijsten «Van» en «Naar» bieden beide UTF-8, UTF-16, UTF-16BE, UTF-16LE, ISO-8859-1, ISO-8859-15, Windows-1252, ASCII, EUC-JP, SJIS (Shift-JIS), GB2312 en Big5. Je kunt van elke naar elke andere converteren.

Voor het web, databases en vrijwel elke moderne verwerking: ja. De uitzonderingen zijn oude Windows-apps die alleen Windows-1252 lezen, sommige oudere mainframe-tools en bepaalde Japanse software die Shift-JIS verwacht.

Het is een schatting op basis van het bytepatroon, gekozen uit UTF-8, UTF-16, ISO-8859-1, Windows-1252 en ASCII. Bij korte of alleen-ASCII-tekst kan hij fout zitten; behandel hem als een hint en stel de codering «Van» zelf in als je het beter weet.

De tekst wordt naar onze server gestuurd om de conversie uit te voeren en wordt niet bewaard nadat het antwoord is teruggestuurd. Voor vertrouwelijk materiaal is een offline-editor met ingebouwde coderingsconverter beter.

Gerelateerde tools

Tool beschikbaar in andere talen