URL's extraheren uit tekst
Plak een chatlog, een Markdown-document, een e-mailgesprek of een raw HTML-uitvoer en krijg een schone lijst van alle http://- en https://-links die erin staan. De matcher verwijdert eindtekens, herkent Markdown- en HTML-linknotatie en haalt exacte duplicaten eruit, zodat u de lijst direct kunt invoeren in een crawler of archiveringstool.
Hoe u URL's extraheert
-
1
Plak de bron
Voeg de tekst of HTML toe. Aanhalingstekens, hoekhaken, Markdown-linknotatie en eindtekens worden automatisch verwerkt.
-
2
Voer de scan uit
Elke `http://`- en `https://`-link wordt gevonden, eindtekens worden verwijderd en exacte duplicaten worden eruit gehaald.
-
3
Controleer het aantal
U ziet hoeveel unieke URL's zijn gevonden en de volledige lijst.
-
4
Kopieer of exporteer
Eén URL per regel, klaar voor `curl -I`, een archiveringsprogramma, een schermafbeeldingsservice of Screaming Frog-seedlijsten.
Wat telt als een URL
URL-detectie is moeilijker dan het lijkt, en deze extractor houdt bewust één veilige regel aan: hij herkent alleen volledige http://- en https://-links. Al het andere blijft in uw tekst staan.
Herkende vormen
| Vorm | Voorbeeld |
|---|---|
| Absoluut HTTPS | https://example.com/path?q=1 |
| Absoluut HTTP | http://example.com |
| Doel van een Markdown-link | [text](https://example.com) |
| Absolute href in HTML | href="https://example.com" |
Knipregels
Eindtekens worden verwijderd, dus (https://example.com). wordt https://example.com. Spaties, aanhalingstekens, hoekhaken, ronde haken, vierkante haken, komma's en puntkomma's stoppen een match. Een URL met haakjes wordt afgekapt bij het eerste openingshaakje, een titel in Wikipedia-stijl wordt dus alleen tot het openingshaakje vastgelegd.
Wat wordt overgeslagen
mailto:,tel:,ftp:en elk ander schema dat geenhttpofhttpsis.- Protocolrelatieve links zoals
//cdn.example.com/asset.js. - Kale domeinen en adressen met
www.-voorvoegsel zonder schema, zoalsexample.com/docs/introofwww.example.com/page. - Alleen ankers zoals
#sectionen JavaScript-pseudo-URL's.
Hoe duplicaten worden behandeld
Exacte duplicaten worden verwijderd: https://example.com telt één keer, hoe vaak het ook voorkomt, terwijl Example.com en example.com aparte items blijven. De lijst behoudt de volgorde waarin elke URL voor het eerst verscheen.
Tips voor nabewerking
- Zet om naar kleine letters voor canonieke deduplicatie. Als
Example.comenexample.comals één host moeten tellen, zet u de uitvoer om naar kleine letters en verwijdert u opnieuw duplicaten. - Verwijder trackingparameters met een UTM-opschoner vóór het archiveren, anders houdt u tientallen bijna identieke duplicaten over.
- Controleer de status. Haal de lijst door een controle op verbroken links om 404-fouten te verwijderen voordat u de lijst vastlegt.
Veelgestelde vragen
Alleen als de korte link met het volledige schema is geschreven. bit.ly/xyz alleen wordt niet opgepikt, maar https://bit.ly/xyz wordt als een gewone URL behandeld. De extractor volgt geen doorverwijzingen; los ze apart op als u de uiteindelijke bestemming nodig hebt.
Ja, wanneer de href een volledige http://- of https://-URL is. De waarde wordt schoon geëxtraheerd zonder de omringende tag; relatieve hrefs worden niet vastgelegd.
Ze worden letterlijk behouden. Als u utm_* en vergelijkbare trackingparameters wilt verwijderen, gebruik dan na de extractie een URL-opschoner.
Nee. De tekst wordt tijdens de aanvraag verwerkt en de inhoud wordt niet opgeslagen of geregistreerd.
Gerelateerde tools
Woordenteller
Tel woorden, tekens, zinnen en alinea's met leestijd, spreektijd, zoekwoorddichtheid en een Flesch-leesbaarheidsscore voor essays, posts, bijschriften en meta descriptions.
Pijlsymbolen om te kopiëren
Kopieer veelgebruikte Unicode-pijlen met één klik: recht, dubbel, diagonaal, gehaakt, rond en driehoekig voor documenten, chat en ontwerp.
Kleiner dan of gelijk aan-symbool
Kopieer het teken ≤ en de bijbehorende wiskundige vergelijkingstekens. Inclusief Unicode, HTML-entiteiten en LaTeX-opmaak voor spreadsheets, artikelen en webpagina's.
Dyslexievriendelijke tekstconverter
Herschik geplakte tekst in korte alinea's en regels van ongeveer 72 tekens voor makkelijker lezen. Kopieer het resultaat naar elk document, bericht of elke editor.
Domeinnaamgenerator
Genereer domeinnaamideeën uit één trefwoord: voorvoegsels, achtervoegsels, verdubbelde letters en cijferuitgangen in zes gangbare TLD's.
Anagramoplosser
Voer maximaal 10 letters in en zie elke unieke rangschikking daarvan, met dubbele permutaties verwijderd en een lijst die wordt beperkt tot 200 resultaten.
Tool beschikbaar in andere talen
- استخراج عناوين URL من النص [AR]
- Metinden URL'leri Çıkarma [TR]
- Extraer URLs del Texto [ES]
- ดึง URL จากข้อความ [TH]
- Wydobywanie URL-ów z tekstu [PL]
- Extrair URLs do Texto [PT]
- 从文本中提取 URL [ZH]
- テキストからURL抽出 [JA]
- URLs aus Text extrahieren [DE]
- Trích xuất URL từ văn bản [VI]
- 텍스트에서 URL을 추출합니다 [KO]
- Extrahera URL:er från text [SV]
- Extraire des URL du texte [FR]
- Extract URLs from Text [EN]
- Ekstrak URL dari Teks [ID]
- Estrai URL dal testo [IT]
- Извлечение URL из текста [RU]