Robots.txt-checker

Plak je robots.txt-regels en het URL-pad dat je wilt testen, en de checker leest de Allow- en Disallow-regels om je te vertellen of dat pad geblokkeerd of toegestaan zou worden. Handig wanneer een pagina plotseling uit Google verdwijnt en je wilt bevestigen of een te strenge Disallow de oorzaak is, of wanneer je nieuwe regels opstelt en een pad wilt controleren voordat je het bestand publiceert.

Hoe de checker werkt

  1. 1

    Plak je regels

    Kopieer de Allow- en Disallow-regels uit je robots.txt naar het veld, of stel nieuwe op om te testen.

  2. 2

    Voer een pad in om te testen

    Typ het URL-pad dat je wilt controleren, bijvoorbeeld /private/page. Gebruik alleen het pad, niet het volledige domein.

  3. 3

    Controleer de regel

    De checker doorzoekt de Allow- en Disallow-regels en vindt de regel die overeenkomt met het ingevoerde pad.

  4. 4

    Lees de uitkomst

    Je krijgt het aantal gevonden regels, het geteste pad en de beslissing: standaard toegestaan, geblokkeerd door een Disallow, of toegestaan door een Allow.

Een minimale, correcte robots.txt

User-agent: *
Allow: /
Disallow: /admin/
Disallow: /draft/
Sitemap: https://example.com/sitemap.xml
  • User-agent: *. Van toepassing op elke crawler die niet expliciet in een ander blok wordt genoemd.
  • Allow: /. Standaard is alles toegestaan.
  • Disallow: /admin/. De adminmap is niet toegankelijk.
  • Sitemap:. Vertelt zoekmachines waar ze de XML-sitemap kunnen vinden.

Regels die Googlebot daadwerkelijk volgt

De parser van Google is de feitelijke standaard voor het interpreteren van dubbelzinnige regels:

  • Paden zijn hoofdlettergevoelig. /Admin/ en /admin/ zijn verschillend.
  • De langste overeenkomst wint. Allow: /admin/public/ wint van Disallow: /admin/ voor een URL die begint met /admin/public/.
  • Wildcards. * komt overeen met elke reeks tekens; $ verankert aan het einde van de URL.
  • Opmerkingen beginnen met #.
  • Onafhankelijk van de volgorde. Regels worden beoordeeld op specificiteit (padlengte), niet op de volgorde in het bestand.

Veelvoorkomende fouten

Fout Effect
Disallow: / bovenaan, zonder Allow Hele website geblokkeerd
Disallow: *.pdf Veel parsers negeren dit, gebruik Disallow: /*.pdf$
Protocolrelatieve of absolute URL in Disallow Genegeerd, paden moeten relatief zijn
Meerdere User-agent-regels vóór de regels Gecombineerd; de regels gelden voor alle genoemde UA’s
Spaties aan het einde van paden Wordt stilzwijgend als een ander pad behandeld
robots.txt in een submap plaatsen Alleen het bestand op het hoofddomein wordt opgehaald

robots.txt versus noindex

robots.txt vertelt crawlers om een URL niet op te halen. Een pagina die al is geïndexeerd en daarna in robots.txt wordt geblokkeerd, kan maandenlang in de index blijven, de crawler kan hem niet ophalen om de verwijdering te bevestigen. Wil je hem uit de index, gebruik dan een noindex-metatag of HTTP-header op de pagina zelf en laat de crawler die zien.

Crawl-delay

Crawl-delay: 10 vraagt om 10 seconden tussen verzoeken. Google negeert dit (stel de crawlsnelheid in via Search Console). Bing, Yandex en sommige nichecrawlers respecteren het. Gebruik het voor kleine sites die onder crawldruk staan van nichebots.

Wat Disallow NIET doet

  • Voorkomen dat ernaar wordt gelinkt. Andere sites kunnen nog steeds naar een geblokkeerde URL linken, en die URL verschijnt in de zoekresultaten als alleen de URL (zonder titel of beschrijving).
  • Voorkomen dat de pagina wordt weergegeven. Gebruikers kunnen een Disallow-URL nog steeds bezoeken.
  • De URL voor iedereen verbergen. robots.txt is openbaar; geheime paden erin vermelden maakt ze juist bekend.

Veelgestelde vragen

Omdat Disallow het crawlen blokkeert, niet het indexeren. Als Google de URL al kent (via links of sitemap), kan het de kale URL in de zoekresultaten houden. Gebruik een noindex-tag op de pagina en laat Google hem ophalen om de verwijdering te bevestigen.

Ja. Gebruik een User-agent: BadBot-blok met eigen regels. Let op: bots die zich misdragen negeren robots.txt volledig; alleen nette bots respecteren het.

Nee. robots.txt is openbaar, hem vermelden verraadt de locatie. Gebruik in plaats daarvan authenticatie en toegangscontrole op serverniveau.

Ja, voor paden. Disallow: /Admin/ blokkeert /admin/ niet. Zorg dat het overeenkomt met de werkelijke schrijfwijze van je URL’s.

Ja. Vermeld meerdere Sitemap:-regels om naar aparte XML-sitemaps of een sitemapindex te verwijzen.

Gerelateerde tools

Tool beschikbaar in andere talen