HTML naar tekst converter

E-mails in eenvoudige tekstvorm, tekstanalyse en tools voor het tellen van woorden vereisen allemaal dat HTML wordt omgezet in een leesbare tekststring zoals die door een mens zou worden gelezen, zonder markeringen. Plaats HTML en dit hulpmiddel verwijdert alle tags, decodeert entiteiten (bijvoorbeeld &&), samenvoegt ruimtes tussen regels veroorzaakt door indrukkingen en genereert een heldere, leesbare tekst die klaar is voor analyse of als basis voor de tekstgedeelte van een meerdelige e-mail.

Hoe je HTML omzet in tekst

  1. 1

    Vlak tekst plakken

    In elke grootte, een fragment, een uitgebreide e-mailtekst of een volledige pagina.

  2. 2

    Converteren

    Eén klik: elke tag en elk attribuut wordt verwijderd en entiteiten worden gedecodeerd.

  3. 3

    Controleer de regeleinden

    Alinea's, lijstitems en tabelrijen worden afzonderlijke regels, waardoor de tekst zijn structuur behoudt.

  4. 4

    Kopieer de tekst

    De uitvoer is eenvoudige Unicode-text en geschikt om te gebruiken in een woordteller, een e-mailtemplate of een sentimentmodel.

Hoe de conversie lastige tags verwerkt

Het omzetten van HTML in tekst gaat verder dan string.replace(/<[^>]+>/, ""); een eenvoudige reguliere expressie laat entiteitscodes en inspringende spaties staan en weet niet dat </p> een nieuwe regel moet starten.

Blokniveau versus inline

Tags op blokniveau (<br>, en de afsluitende tags </p>, </div>, </h1> tot </h6>, </li>, </tr>) veroorzaken elk één regeleinde. Inline-tags (<a>, <span>, <strong>) laten geen witruimte achter, zodat woorden niet aan elkaar plakken.

Specifiek gedrag per tag

Tag Verwerking
<br> Eén regeleinde
</p>, </div>, </h1> tot </h6> Eén regeleinde per afsluitende tag
</li>, </tr> Eén regeleinde; er worden geen opsommingstekens of tabel-celseparatoren toegevoegd
<a href="url">text</a> text; het href-attribuut wordt verwijderd
<img alt="text"> Niets, de tag heeft geen zichtbare tekst
<script>, <style> De tags worden verwijderd, de tekst ertussen blijft behouden

Decodering van entiteiten

  • Benoemde entiteiten (&amp;, &copy;, &eacute;) worden gedecodeerd naar hun bijbehorende Unicode-teken.
  • Numerieke entiteiten (&#169;, &#x00A9;) worden eveneens gedecodeerd.
  • Onbekende entiteiten blijven letterlijk behouden, zodat analysetools ze kunnen zien.

Normalisatie van witruimte

  • Spaties en tabs vóór een regeleinde worden verwijderd.
  • Drie of meer lege regels worden samengevoegd tot één lege regel.
  • Spaties tussen woorden blijven ongewijzigd; de converter herschikt de tekst niet.

Toepassingen

  • Het text/plain-gedeelte van een meerdelige e-mail genereren.
  • Gescrapete artikelen opschonen voordat ze aan een taalmodel worden doorgegeven.
  • Een zoekindex met platte tekst vullen.
  • Een eerlijke woordtelling berekenen die opmaak negeert.

Veelgestelde vragen

De visuele formatering (vet lettertje, kleur en lettertype) wordt verloren, dat is precies het punt. De structuur blijft bewaard als regeleinden: alinea’s, lijstitems en tabelrijen worden afzonderlijke regels, zodat de tekst leesbaar blijft.

De zichtbare linktekst blijft staan, maar de URL verdwijnt samen met de tag-attributen. Als u de URL’s nodig heeft, gebruik dan een speciale HTML-naar-Markdown-converter.

De converter verwijdert de tags zelf, maar behoudt de tekst ertussen, dus de inhoud van <script>- en <style>-blokken blijft in de uitvoer staan. Verwijder deze eerst uit de bron-HTML als u ze niet wilt.

Ja. De uitvoer is in UTF-8-indeling en bevat alle niet-ASCII-tekenen uit de invoer. Entiteiten als &copy; en &eacute; worden gedecodeerd naar hun corresponderende Unicode-waarden.

Gerelateerde tools

Tool beschikbaar in andere talen