Robots.txt-generator

Stel de crawler in die je target, geef de paden op die je wilt blokkeren en de paden die je wilt toestaan, voeg een optionele crawl-delay toe en verwijs naar je sitemap, en de generator stelt een correct opgemaakte robots.txt samen die je kunt kopiëren en publiceren. Hij regelt de exacte regelopmaak en interpunctie, zodat je de syntaxis of de spelling van user-agents niet hoeft te onthouden.

Hoe je het bestand genereert

  1. 1

    Stel de user-agent in

    Voer de crawler in waarvoor de regels gelden, of laat * staan om alle bots te targeten.

  2. 2

    Geef de te blokkeren paden op

    Voeg de mappen of paden toe die je wilt blokkeren, één per regel, bijvoorbeeld /admin/ of /checkout/.

  3. 3

    Geef de toe te staan paden op

    Voeg paden toe die crawlbaar moeten blijven, één per regel, om uitzonderingen te maken binnen een bredere Disallow.

  4. 4

    Voeg sitemap en crawl-delay toe

    Declareer de URL van je sitemap en, indien nodig, een crawl-delay in seconden.

  5. 5

    Kopieer en publiceer

    Kopieer het gegenereerde bestand en plaats het op https://yourdomain.com/robots.txt, in de root, niet in een submap.

Typische startsjablonen

Alles toestaan (de meeste websites):

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

staging / admin blokkeren:

User-agent: *
Disallow: /admin/
Disallow: /staging/
Disallow: /cart/
Disallow: /checkout/
Disallow: /*?session=
Sitemap: https://example.com/sitemap.xml

AI-trainingscrawlers blokkeren, zoekmachines toestaan:

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

User-agents die je moet kennen

User-agent Eigenaar Doel
Googlebot Google Search Webindexering
Googlebot-Image Google Afbeeldingen zoeken
Google-Extended Google Bard/Gemini-training (opt-out)
Bingbot Microsoft Bing-zoeken
DuckDuckBot DuckDuckGo DDG-zoeken
GPTBot OpenAI ChatGPT / training (opt-out)
ClaudeBot Anthropic Claude-training (opt-out)
CCBot Common Crawl Corpus dat door veel LLM’s wordt gebruikt
AhrefsBot Ahrefs SEO-backlinkindex
SemrushBot Semrush SEO-onderzoek
MJ12bot Majestic SEO-onderzoek

AI-trainingsbots zijn opt-out volgens afspraak, niet wettelijk verplicht; betrouwbare aanbieders respecteren de richtlijnen, minder nauwgezette niet.

Regels voor padmatching

  • Paden zijn relatief ten opzichte van de domeinroot en beginnen met /.
  • * matcht elk teken. Disallow: /*.pdf$ blokkeert alle PDF’s.
  • $ verankert aan het einde van de URL. Disallow: /*/trash$ blokkeert /foo/trash maar niet /foo/trashes/....
  • De langste match wint. Allow: /admin/public/ heeft voorrang op Disallow: /admin/ voor dat subpad.
  • Paden zijn hoofdlettergevoelig.

Dingen die robots.txt niet kan

  • Een pagina uit Google verwijderen. Gebruik een noindex-metatag op de pagina zelf.
  • Een URL beschermen tegen mensen. robots.txt is openbaar en slechts suggesties voor volgzame bots.
  • Googlebot beperken in snelheid. Crawl-delay wordt door Google genegeerd; gebruik Search Console.
  • Bots blokkeren die robots.txt negeren. Spamscrapers lezen het bestand niet.

Checklist voor publicatie

  1. Plaats op https://yourdomain.com/robots.txt, alleen in de root.
  2. Serveer met Content-Type: text/plain (de meeste servers doen dit automatisch).
  3. Grootte: onder 500 KB. Google kapt grotere bestanden af.
  4. Controleer na publicatie het opgehaalde bestand in de robots.txt-tester van Google Search Console.
  5. Bij het verwijderen van een Disallow kan het de-indexeren weken duren.

Veelgestelde vragen

Niet strikt. Zonder bestand gaan crawlers uit van “alles toestaan”. Als je iets te blokkeren hebt, staging, admin, checkout, interne zoekfunctie, heb je er een nodig.

Je kunt ze via user-agent-blokken als GPTBot, ClaudeBot, CCBot en Google-Extended vragen te stoppen. Grote spelers respecteren dit; minder nauwgezette scrapers negeren het volledig.

Crawlers zijn vergevingsgezind, onbekende richtlijnen worden genegeerd. Ernstige fouten (HTTP 404 of 500) worden behandeld als “alles toestaan”. Valideer het bestand voor publicatie.

In de root van elke host die je wilt afdekken, https://www.example.com/robots.txt en https://example.com/robots.txt zijn aparte bestanden voor aparte hosts.

Nee. De paden die je invoert worden alleen gebruikt om het bestand samen te stellen; ze worden niet opgeslagen of gelogd.

Gerelateerde tools

Tool beschikbaar in andere talen