Mojibake herstellen

Vergelijking van coderingshypothesen
Je geplakte tekst en alle kandidaten blijven in deze browser. De stappenmodus bewaart maximaal 30 minuten één gevalideerd record in dit tabblad en zet alleen een ondoorzichtig taak-ID in de URL. Er wordt niets via onze servers of een herstel-API verzonden.

Plak de beschadigd ogende tekst

Plak tekst zoals café of een Japanse tekenreeks die door een coderingsconflict onleesbaar werd. Het origineel blijft ongewijzigd in de editor staan.

Maximaal 50.000 tekens. Deze tool vergelijkt alleen geplakte Unicode-tekst en inspecteert of herstelt geen bestanden, bytestromen, databases of HTTP-headers.

Mojibake ontstaat wanneer leesbare gegevens als verkeerde tekens verschijnen doordat bytes met een niet-passende tekenset zijn gedecodeerd. Een bekend voorbeeld is café: café was als UTF-8 gecodeerd, maar de bytes werden als Latin-1 of Windows-1252 geïnterpreteerd. Plak de zichtbare tekst om strikt omkeerbare herstelhypothesen te vergelijken. De tool houdt het origineel ongewijzigd, benoemt elke kandidaat als hypothese en voert de vergelijking lokaal in je browser uit.

Zo vergelijk je een hypothese voor mojibake-herstel

  1. 1

    Plak de zichtbare tekst

    Gebruik de tekst precies zoals je die hebt ontvangen. De tool uploadt of onderzoekt geen bronbestand.

  2. 2

    Kies bewust voor vergelijken

    Laat de browser Latin-1- en Windows-1252-byte-interpretaties testen met een strikte UTF-8-decoder.

  3. 3

    Vergelijk zonder aan te nemen

    Lees het ongewijzigde origineel naast elke omkeerbare kandidaat en kies alleen als de context dat ondersteunt.

  4. 4

    Kopieer platte tekst

    Kopieer, download of print een gekozen hypothese zonder de oorspronkelijke tekst te overschrijven.

Wat mojibake-herstel wel en niet kan aantonen

Een tekencodering legt de relatie tussen tekens en bytes vast. UTF-8 vertegenwoordigt é met de twee bytes C3 A9. Als software die bytes als Windows-1252 of ISO-8859-1 decodeert, kan é zichtbaar worden. Een bruikbare herstelhypothese keert precies die fout om: behandel de zichtbare verouderde tekens als bytewaarden, decodeer die bytes strikt als UTF-8 en controleer of UTF-8-codering van de kandidaat exact dezelfde bytes teruggeeft.

De retourcontrole verwerpt onvolledige en ongeldige UTF-8-reeksen. Ook een kandidaat met het vervangingsteken wordt geweigerd, omdat de informatie achter dat teken al verloren is gegaan. Een geldige retourconversie ondersteunt een hypothese, maar bewijst niet welke codering het bronsysteem gebruikte of wat de auteur bedoelde.

Zichtbare tekst Geteste hypothese Mogelijke kandidaat Wat je controleert
café UTF-8-bytes gelezen als Latin-1 café Vergelijk de spelling met de bron
It’s UTF-8-bytes gelezen als Windows-1252 It’s Controleer leestekens en huisstijl
文字化け UTF-8-bytes gelezen als Latin-1 文字化け Vergelijk de Japanse tekst met een betrouwbare kopie
café Twee opeenvolgende coderingsfouten café Onderzoek beide bewaakte rondes

Waarom Japanse tekst context nodig heeft

De Japanse term 文字化け verwijst letterlijk naar verminkte tekens. Japanse UTF-8-tekst kan veranderen in een lange mengeling van Latijnse letters, symbolen en tekens die op besturingstekens lijken wanneer de bytes via de verkeerde oude codering worden gelezen. Omkeerbaarheid helpt, maar een korte naam of één los teken kan nog steeds dubbelzinnig zijn. Vergelijk de kandidaat met het oorspronkelijke document, een database-export, de afzender of een andere gezaghebbende kopie.

Grenzen en een veiligere herstelroute

Deze tool ontvangt Unicode-tekst die de browser al heeft gedecodeerd. Hij kan eerder weggegooide bytes niet terughalen, geen codering uit een binair bestand afleiden, geen databasekolom herstellen en geen HTTP-header Content-Type wijzigen. Verschijnt er geen kandidaat, bewaar dan het origineel. Haal zo mogelijk de echte bronbytes op, maak een back-up, stel de opgegeven en werkelijke codering vast en decodeer vervolgens één keer met gereedschap voor bestanden of bytestromen. Sla beschadigde tekst nooit herhaaldelijk over de enige bronkopie heen op.

Veelgestelde vragen

Nee. Een bepaalde interpretatie van oude bytewaarden leverde geldige UTF-8 op en doorstond een exacte retourcontrole. Meerdere interpretaties kunnen dezelfde of verschillende leesbare tekst opleveren. Context en een gezaghebbende bron blijven nodig.

De zichtbare tekens zijn misschien geen UTF-8-bytes die als ISO-8859-1 of Windows-1252 zijn gelezen, de reeks kan onvolledig zijn of een vervangingsteken kan al informatie hebben verwijderd. Bewaar het origineel en onderzoek de echte bytes en coderingsgegevens.

Nee. Hij vergelijkt alleen geplakte Unicode-tekst. De tool leest geen bestanden, detecteert geen bestandscodering, maakt geen databaseverbinding, herschrijft geen opgeslagen waarden en herstelt geen serverheaders. Maak een back-up voordat je een bytebewuste conversie gebruikt.

Nee. Vergelijken, kiezen, kopiëren, het TXT-bestand maken en de afdruk voorbereiden gebeuren in je browser. De stappenmodus kan maximaal 30 minuten een gevalideerd record in dit tabblad bewaren en zet alleen een ondoorzichtig taak-ID in de URL.

Gerelateerde tools