Robots.txt-generator
Stel de crawler in die je target, geef de paden op die je wilt blokkeren en de paden die je wilt toestaan, voeg een optionele crawl-delay toe en verwijs naar je sitemap, en de generator stelt een correct opgemaakte robots.txt samen die je kunt kopiëren en publiceren. Hij regelt de exacte regelopmaak en interpunctie, zodat je de syntaxis of de spelling van user-agents niet hoeft te onthouden.
Hoe je het bestand genereert
-
1
Stel de user-agent in
Voer de crawler in waarvoor de regels gelden, of laat * staan om alle bots te targeten.
-
2
Geef de te blokkeren paden op
Voeg de mappen of paden toe die je wilt blokkeren, één per regel, bijvoorbeeld /admin/ of /checkout/.
-
3
Geef de toe te staan paden op
Voeg paden toe die crawlbaar moeten blijven, één per regel, om uitzonderingen te maken binnen een bredere Disallow.
-
4
Voeg sitemap en crawl-delay toe
Declareer de URL van je sitemap en, indien nodig, een crawl-delay in seconden.
-
5
Kopieer en publiceer
Kopieer het gegenereerde bestand en plaats het op https://yourdomain.com/robots.txt, in de root, niet in een submap.
Typische startsjablonen
Alles toestaan (de meeste websites):
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml
staging / admin blokkeren:
User-agent: *
Disallow: /admin/
Disallow: /staging/
Disallow: /cart/
Disallow: /checkout/
Disallow: /*?session=
Sitemap: https://example.com/sitemap.xml
AI-trainingscrawlers blokkeren, zoekmachines toestaan:
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml
User-agents die je moet kennen
| User-agent | Eigenaar | Doel |
|---|---|---|
| Googlebot | Google Search | Webindexering |
| Googlebot-Image | Afbeeldingen zoeken | |
| Google-Extended | Bard/Gemini-training (opt-out) | |
| Bingbot | Microsoft | Bing-zoeken |
| DuckDuckBot | DuckDuckGo | DDG-zoeken |
| GPTBot | OpenAI | ChatGPT / training (opt-out) |
| ClaudeBot | Anthropic | Claude-training (opt-out) |
| CCBot | Common Crawl | Corpus dat door veel LLM’s wordt gebruikt |
| AhrefsBot | Ahrefs | SEO-backlinkindex |
| SemrushBot | Semrush | SEO-onderzoek |
| MJ12bot | Majestic | SEO-onderzoek |
AI-trainingsbots zijn opt-out volgens afspraak, niet wettelijk verplicht; betrouwbare aanbieders respecteren de richtlijnen, minder nauwgezette niet.
Regels voor padmatching
- Paden zijn relatief ten opzichte van de domeinroot en beginnen met
/. *matcht elk teken.Disallow: /*.pdf$blokkeert alle PDF’s.$verankert aan het einde van de URL.Disallow: /*/trash$blokkeert/foo/trashmaar niet/foo/trashes/....- De langste match wint.
Allow: /admin/public/heeft voorrang opDisallow: /admin/voor dat subpad. - Paden zijn hoofdlettergevoelig.
Dingen die robots.txt niet kan
- Een pagina uit Google verwijderen. Gebruik een
noindex-metatag op de pagina zelf. - Een URL beschermen tegen mensen. robots.txt is openbaar en slechts suggesties voor volgzame bots.
- Googlebot beperken in snelheid.
Crawl-delaywordt door Google genegeerd; gebruik Search Console. - Bots blokkeren die robots.txt negeren. Spamscrapers lezen het bestand niet.
Checklist voor publicatie
- Plaats op
https://yourdomain.com/robots.txt, alleen in de root. - Serveer met
Content-Type: text/plain(de meeste servers doen dit automatisch). - Grootte: onder 500 KB. Google kapt grotere bestanden af.
- Controleer na publicatie het opgehaalde bestand in de robots.txt-tester van Google Search Console.
- Bij het verwijderen van een Disallow kan het de-indexeren weken duren.
Veelgestelde vragen
Niet strikt. Zonder bestand gaan crawlers uit van “alles toestaan”. Als je iets te blokkeren hebt, staging, admin, checkout, interne zoekfunctie, heb je er een nodig.
Je kunt ze via user-agent-blokken als GPTBot, ClaudeBot, CCBot en Google-Extended vragen te stoppen. Grote spelers respecteren dit; minder nauwgezette scrapers negeren het volledig.
Crawlers zijn vergevingsgezind, onbekende richtlijnen worden genegeerd. Ernstige fouten (HTTP 404 of 500) worden behandeld als “alles toestaan”. Valideer het bestand voor publicatie.
In de root van elke host die je wilt afdekken, https://www.example.com/robots.txt en https://example.com/robots.txt zijn aparte bestanden voor aparte hosts.
Nee. De paden die je invoert worden alleen gebruikt om het bestand samen te stellen; ze worden niet opgeslagen of gelogd.
Gerelateerde tools
ASCII-tabelreferentie
Volledige ASCII-tabel van 0 tot 127 met decimale, hexadecimale, octale en binaire waarden en HTML-numerieke referentienotatie, inclusief control codes zoals NUL, LF en DEL.
HTML-tekenreferentie
Een doorzoekbare lijst met HTML-entiteiten, hun benoemde en numerieke codes, plus kopiëren met één klik voor speciale tekens en symbolen.
Sneltoetsenoverzicht
Zoek gedocumenteerde standaardsneltoetsen voor VS Code, Chrome en Bash met GNU Readline op macOS, Windows en Linux.
Luhn-algoritme-checker
Controleer de creditcardnummer, IMEI, SIN en andere door Luhn beschermden nummers. Geef een resultaat terug (goed of fout) en toon elke stap van het verdubbelen en het berekenen van de controlesom aan.
JSON naar PHP-array
Zet JSON om naar een PHP-array-literal met korte syntaxis, associatieve/geïndexeerde arrays en geneste structuren, klaar om in een .php-bestand te plakken.
E-mailvalidator
Valideer een e-mailadres: RFC 5322-syntaxcontrole, live MX-record-zoekopdracht, plus details over lokaal deel, domein en lengte. Er wordt geen e-mail verstuurd.
Tool beschikbaar in andere talen
- Generador de Robots.txt [ES]
- Générateur de Robots.txt [FR]
- Generator Robots.txt [ID]
- Robots.txt-generator [SV]
- مولد ملفات robots.txt [AR]
- Robots.txtジェネレーター [JA]
- Robots.txt 생성기 [KO]
- Generator robots.txt [PL]
- Bộ tạo file robots.txt [VI]
- เครื่องมือสร้างไฟล์ robots.txt [TH]
- Gerador de Robots.txt [PT]
- Robots.txt-Generator [DE]
- Генератор robots.txt [RU]
- Robots.txt Oluşturucu [TR]
- Robots.txt 生成器 [ZH]
- Robots.txt Generator [EN]
- Generatore di Robots.txt [IT]