URL's extraheren uit tekst

Plak een chatlog, een Markdown-document, een e-mailgesprek of een raw HTML-uitvoer en krijg een schone lijst van alle http://- en https://-links die erin staan. De matcher verwijdert eindtekens, herkent Markdown- en HTML-linknotatie en haalt exacte duplicaten eruit, zodat u de lijst direct kunt invoeren in een crawler of archiveringstool.

Hoe u URL's extraheert

  1. 1

    Plak de bron

    Voeg de tekst of HTML toe. Aanhalingstekens, hoekhaken, Markdown-linknotatie en eindtekens worden automatisch verwerkt.

  2. 2

    Voer de scan uit

    Elke `http://`- en `https://`-link wordt gevonden, eindtekens worden verwijderd en exacte duplicaten worden eruit gehaald.

  3. 3

    Controleer het aantal

    U ziet hoeveel unieke URL's zijn gevonden en de volledige lijst.

  4. 4

    Kopieer of exporteer

    Eén URL per regel, klaar voor `curl -I`, een archiveringsprogramma, een schermafbeeldingsservice of Screaming Frog-seedlijsten.

Wat telt als een URL

URL-detectie is moeilijker dan het lijkt, en deze extractor houdt bewust één veilige regel aan: hij herkent alleen volledige http://- en https://-links. Al het andere blijft in uw tekst staan.

Herkende vormen

Vorm Voorbeeld
Absoluut HTTPS https://example.com/path?q=1
Absoluut HTTP http://example.com
Doel van een Markdown-link [text](https://example.com)
Absolute href in HTML href="https://example.com"

Knipregels

Eindtekens worden verwijderd, dus (https://example.com). wordt https://example.com. Spaties, aanhalingstekens, hoekhaken, ronde haken, vierkante haken, komma's en puntkomma's stoppen een match. Een URL met haakjes wordt afgekapt bij het eerste openingshaakje, een titel in Wikipedia-stijl wordt dus alleen tot het openingshaakje vastgelegd.

Wat wordt overgeslagen

  • mailto:, tel:, ftp: en elk ander schema dat geen http of https is.
  • Protocolrelatieve links zoals //cdn.example.com/asset.js.
  • Kale domeinen en adressen met www.-voorvoegsel zonder schema, zoals example.com/docs/intro of www.example.com/page.
  • Alleen ankers zoals #section en JavaScript-pseudo-URL's.

Hoe duplicaten worden behandeld

Exacte duplicaten worden verwijderd: https://example.com telt één keer, hoe vaak het ook voorkomt, terwijl Example.com en example.com aparte items blijven. De lijst behoudt de volgorde waarin elke URL voor het eerst verscheen.

Tips voor nabewerking

  • Zet om naar kleine letters voor canonieke deduplicatie. Als Example.com en example.com als één host moeten tellen, zet u de uitvoer om naar kleine letters en verwijdert u opnieuw duplicaten.
  • Verwijder trackingparameters met een UTM-opschoner vóór het archiveren, anders houdt u tientallen bijna identieke duplicaten over.
  • Controleer de status. Haal de lijst door een controle op verbroken links om 404-fouten te verwijderen voordat u de lijst vastlegt.

Veelgestelde vragen

Alleen als de korte link met het volledige schema is geschreven. bit.ly/xyz alleen wordt niet opgepikt, maar https://bit.ly/xyz wordt als een gewone URL behandeld. De extractor volgt geen doorverwijzingen; los ze apart op als u de uiteindelijke bestemming nodig hebt.

Ja, wanneer de href een volledige http://- of https://-URL is. De waarde wordt schoon geëxtraheerd zonder de omringende tag; relatieve hrefs worden niet vastgelegd.

Ze worden letterlijk behouden. Als u utm_* en vergelijkbare trackingparameters wilt verwijderen, gebruik dan na de extractie een URL-opschoner.

Nee. De tekst wordt tijdens de aanvraag verwerkt en de inhoud wordt niet opgeslagen of geregistreerd.

Gerelateerde tools

Tool beschikbaar in andere talen