Extractor voor externe links

Plak ruwe HTML en krijg een schone lijst zonder duplicaten van elke externe link die erin staat. Geef optioneel een basis-URL op zodat de extractor weet welke host als intern telt; links naar elke andere host worden gerapporteerd. Handig om een website te controleren op linklekken, verouderde partnerplaatsingen of om te bevestigen dat uitgaande links gaan waar uw beleid ze wil hebben.

Zo extraheer je externe links

  1. 1

    Geef de bron op

    Plak de ruwe HTML van de pagina. Voeg optioneel een basis-URL toe zodat de extractor weet welke host als intern telt; laat hem leeg om elke host als extern te behandelen.

  2. 2

    Extractie uitvoeren

    Elke `<a href>` wordt gelezen en alleen absolute http/https-links waarvan de host verschilt van de basishost worden bewaard. Duplicaten worden verwijderd.

  3. 3

    Bekijk de lijst

    U krijgt één externe URL per regel, klaar om in een spreadsheet te plakken of om individuele links te controleren.

  4. 4

    Gebruik het resultaat

    Kopieer de lijst naar het klembord of laat de pagina open terwijl u elke bestemming in een nieuw tabblad controleert.

Wat de extractor als extern beschouwt

Een link is extern wanneer de host ervan verschilt van de basis-URL die u hebt opgegeven (de vergelijking is niet hoofdlettergevoelig). Subdomeinen tellen als afzonderlijke hosts, dus blog.example.com is extern ten opzichte van www.example.com. Voor audits over het hele subdomein verwijdert u het subdomein uit uw basis-URL. Laat de basis-URL leeg om elke http/https-link als extern te tonen.

De extractor rapporteert alleen bestemmings-URL’s. Hij leest geen ankertekst en geen rel-attributen; controleer de tokens nofollow, ugc en sponsored daarom rechtstreeks in de bron-HTML.

Wat het negeert

  • mailto:-, tel:-, javascript:- en alleen-fragment-#-links.
  • Relatieve URL’s en protocolrelatieve URL’s zoals //cdn.example.com (maak er absolute URL’s van in de geplakte HTML als u ze wilt meetellen).
  • Ankertags zonder href (dat zijn geen navigeerbare links).

Tips

  • Plak de gerenderde HTML als de pagina JavaScript gebruikt. Links die een framework aan de clientzijde genereert, verschijnen pas wanneer u de gerenderde DOM plakt (bijvoorbeeld door outerHTML uit DevTools te kopiëren).
  • Let op tracking-wrappers. Affiliate-omleidingen via /go/ of /out/ kunnen de echte bestemming verbergen; de extractor geeft de wrapper-URL terug zoals die er staat, dus inspecteer de ruwe href wanneer een bestemming verdacht lijkt.
  • Normaliseer vóór het vergelijken. Een URL met een ander fragment of een andere trackingparameter telt als een afzonderlijke link; normaliseer URL’s voordat u twee uitvoeringen van de extractor vergelijkt.
  • Vergelijk in de tijd. Voer de extractor maandelijks uit en vergelijk de lijsten; nieuwe externe links die u niet hebt toegevoegd, zijn het eerste teken van een gecompromitteerd thema of een gecompromitteerde plugin.

Veelgestelde vragen

Het haalt de href er precies zo uit als die in de HTML staat. Elke omleiding volgen zou het rapport aanzienlijk vertragen en kan botbeveiliging op de bestemming activeren; los ze apart op als u de uiteindelijke bestemmings-URL nodig hebt.

Nee. De extractor verwerkt de HTML zoals die wordt aangeleverd. Links die een framework aan de clientzijde rendert, verschijnen alleen als u de gerenderde DOM plakt (bijvoorbeeld door outerHTML uit DevTools te kopiëren).

Alleen absolute http/https-URL’s worden gerapporteerd. Protocolrelatieve URL’s zoals //cdn.example.com, relatieve paden en mailto:- of tel:-links worden overgeslagen; maak er absolute URL’s van in de geplakte HTML als u ze wilt meetellen.

De HTML die u plakt, wordt alleen naar onze server gestuurd om de extractie in het huidige verzoek uit te voeren. Hij wordt niet opgeslagen in een database of een log en er wordt niets bewaard nadat het antwoord uw browser heeft bereikt.

Gerelateerde tools

Tool beschikbaar in andere talen