Robots.txt-checker
Plak je robots.txt-regels en het URL-pad dat je wilt testen, en de checker leest de Allow- en Disallow-regels om je te vertellen of dat pad geblokkeerd of toegestaan zou worden. Handig wanneer een pagina plotseling uit Google verdwijnt en je wilt bevestigen of een te strenge Disallow de oorzaak is, of wanneer je nieuwe regels opstelt en een pad wilt controleren voordat je het bestand publiceert.
Hoe de checker werkt
-
1
Plak je regels
Kopieer de Allow- en Disallow-regels uit je robots.txt naar het veld, of stel nieuwe op om te testen.
-
2
Voer een pad in om te testen
Typ het URL-pad dat je wilt controleren, bijvoorbeeld /private/page. Gebruik alleen het pad, niet het volledige domein.
-
3
Controleer de regel
De checker doorzoekt de Allow- en Disallow-regels en vindt de regel die overeenkomt met het ingevoerde pad.
-
4
Lees de uitkomst
Je krijgt het aantal gevonden regels, het geteste pad en de beslissing: standaard toegestaan, geblokkeerd door een Disallow, of toegestaan door een Allow.
Een minimale, correcte robots.txt
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /draft/
Sitemap: https://example.com/sitemap.xml
- User-agent: *. Van toepassing op elke crawler die niet expliciet in een ander blok wordt genoemd.
- Allow: /. Standaard is alles toegestaan.
- Disallow: /admin/. De adminmap is niet toegankelijk.
- Sitemap:. Vertelt zoekmachines waar ze de XML-sitemap kunnen vinden.
Regels die Googlebot daadwerkelijk volgt
De parser van Google is de feitelijke standaard voor het interpreteren van dubbelzinnige regels:
- Paden zijn hoofdlettergevoelig.
/Admin/en/admin/zijn verschillend. - De langste overeenkomst wint.
Allow: /admin/public/wint vanDisallow: /admin/voor een URL die begint met/admin/public/. - Wildcards.
*komt overeen met elke reeks tekens;$verankert aan het einde van de URL. - Opmerkingen beginnen met
#. - Onafhankelijk van de volgorde. Regels worden beoordeeld op specificiteit (padlengte), niet op de volgorde in het bestand.
Veelvoorkomende fouten
| Fout | Effect |
|---|---|
Disallow: / bovenaan, zonder Allow |
Hele website geblokkeerd |
Disallow: *.pdf |
Veel parsers negeren dit, gebruik Disallow: /*.pdf$ |
| Protocolrelatieve of absolute URL in Disallow | Genegeerd, paden moeten relatief zijn |
Meerdere User-agent-regels vóór de regels |
Gecombineerd; de regels gelden voor alle genoemde UA’s |
| Spaties aan het einde van paden | Wordt stilzwijgend als een ander pad behandeld |
| robots.txt in een submap plaatsen | Alleen het bestand op het hoofddomein wordt opgehaald |
robots.txt versus noindex
robots.txt vertelt crawlers om een URL niet op te halen. Een pagina die al is geïndexeerd en daarna in robots.txt wordt geblokkeerd, kan maandenlang in de index blijven, de crawler kan hem niet ophalen om de verwijdering te bevestigen. Wil je hem uit de index, gebruik dan een noindex-metatag of HTTP-header op de pagina zelf en laat de crawler die zien.
Crawl-delay
Crawl-delay: 10 vraagt om 10 seconden tussen verzoeken. Google negeert dit (stel de crawlsnelheid in via Search Console). Bing, Yandex en sommige nichecrawlers respecteren het. Gebruik het voor kleine sites die onder crawldruk staan van nichebots.
Wat Disallow NIET doet
- Voorkomen dat ernaar wordt gelinkt. Andere sites kunnen nog steeds naar een geblokkeerde URL linken, en die URL verschijnt in de zoekresultaten als alleen de URL (zonder titel of beschrijving).
- Voorkomen dat de pagina wordt weergegeven. Gebruikers kunnen een Disallow-URL nog steeds bezoeken.
- De URL voor iedereen verbergen. robots.txt is openbaar; geheime paden erin vermelden maakt ze juist bekend.
Veelgestelde vragen
Omdat Disallow het crawlen blokkeert, niet het indexeren. Als Google de URL al kent (via links of sitemap), kan het de kale URL in de zoekresultaten houden. Gebruik een noindex-tag op de pagina en laat Google hem ophalen om de verwijdering te bevestigen.
Ja. Gebruik een User-agent: BadBot-blok met eigen regels. Let op: bots die zich misdragen negeren robots.txt volledig; alleen nette bots respecteren het.
Nee. robots.txt is openbaar, hem vermelden verraadt de locatie. Gebruik in plaats daarvan authenticatie en toegangscontrole op serverniveau.
Ja, voor paden. Disallow: /Admin/ blokkeert /admin/ niet. Zorg dat het overeenkomt met de werkelijke schrijfwijze van je URL’s.
Ja. Vermeld meerdere Sitemap:-regels om naar aparte XML-sitemaps of een sitemapindex te verwijzen.
Gerelateerde tools
Extractor voor externe links
Plak ruwe HTML, geef optioneel een basis-URL op en krijg een schone lijst zonder duplicaten van elke externe http/https-link in de code voor linkaudits en SEO-beoordelingen.
Extractor voor interne links
Extraheer alle interne links uit een URL of geplakte HTML, inclusief ankertekst, rel-attributen en nofollow-status voor SEO-audits.
FAQ-schemagenerator
Genereer FAQPage-JSON-LD-opmaak op basis van vraag-en-antwoordparen, zodat je pagina in aanmerking komt voor de rich results en het antwoordvak van Google.
XML-sitemapvalidator
Controleer sitemap-XML in uw browser op parseerfouten, ontbrekende of dubbele URL's en ongeldige waarden in gangbare velden.
HTTP-beveiligingsheaders controleren
Plak HTTP-responsheaders en controleer HSTS, CSP, bescherming tegen framing, MIME-, referrer- en cross-originbeleid lokaal in je browser.
Hreflang-checker
Controleer geplakte HTML lokaal op hreflang-codes, volledige URL’s, dubbele waarden, plaatsing en zelfverwijzing.
Tool beschikbaar in andere talen
- Verificador de robots.txt [ES]
- Vérificateur de Robots.txt [FR]
- Verificador de Robots.txt [PT]
- Robots.txt-Prüfer [DE]
- Robots.txt 검사기 [KO]
- เครื่องมือตรวจสอบไฟล์ robots.txt [TH]
- Robots.txtチェッカー [JA]
- Robots.txt-kontroll [SV]
- Trình kiểm tra robots.txt [VI]
- Pemeriksa Robot.txt [ID]
- أداة فحص ملف robots.txt [AR]
- Sprawdzanie robots.txt [PL]
- Robots.txt 检查器 [ZH]
- Robots.txt Checker [EN]
- Controllore Robots.txt [IT]
- Проверка robots.txt [RU]
- Robots.txt Denetleyici [TR]