Robots.txt: zo werkt het, zo test je het en welke AI-crawlers 1.000 .nl-sites weren
Robots.txt uitgelegd: regels, voorbeelden en testen in Search Console. Plus: 119 van de 1.000 populairste .nl-sites weren GPTBot.

In het kort
- Een robots.txt vertelt crawlers welke URL’s ze niet mogen opvragen, maar haalt volgens Google (bijgewerkt 10 december 2025) geen pagina uit de zoekresultaten; dat doet noindex.
- Op 28 september 2026 hadden 762 van de 1.000 populairste .nl-domeinen een leesbare robots.txt; 586 wezen daarin naar een sitemap en 115 hadden een Crawl-delay-regel, die Google negeert (AI-crawlerscan van RankPilot).
- Op 28 september 2026 weerden 119 van de 1.000 populairste .nl-domeinen GPTBot, de trainingscrawler van OpenAI: nieuwsmedia 77 van de 175 (44%), webshops 10 van de 134 (7%).
- Van de 77 Nederlandse mediadomeinen die op 28 september 2026 GPTBot weerden, hielden 48 ook OAI-SearchBot buiten, waardoor ze volgens OpenAI niet in de zoekantwoorden van ChatGPT staan.
Een robots.txt is een tekstbestand in de hoofdmap van je website dat crawlers vertelt welke delen van je site ze niet mogen opvragen. Het is een verzoek, geen slot, en het haalt een pagina niet uit Google; daarvoor is noindex. Op 28 september 2026 lazen we de robots.txt van de 1.000 populairste .nl-domeinen: 762 hebben er een, en 119 weren er GPTBot mee, de trainingscrawler van OpenAI.
Robots.txt regelt wat crawlers opvragen, niet wat Google toont
Volgens Google (bijgewerkt 10 december 2025) is robots.txt vooral bedoeld om te voorkomen dat crawlers je server overbelasten of onbelangrijke pagina’s afstruinen. Het is geen manier om een pagina uit Google te houden, en ook geen beveiliging: RFC 9309 (september 2022) noemt de regels geen vorm van toegangsbeveiliging, en elk pad erin is voor iedereen leesbaar. Wat privé is, zet je achter een wachtwoord.
Het bestand staat altijd op jouwdomein.nl/robots.txt
Een robots.txt werkt alleen in de hoofdmap van een host, als platte tekst in UTF-8. Volgens Google (bijgewerkt 21 november 2025) geldt het bestand alleen voor dat protocol, die host en die poort: shop.jouwdomein.nl heeft een eigen bestand nodig. Geen robots.txt is geen fout, dan mag alles; 83 van de 1.000 domeinen in onze scan hadden er geen.
Noindex haalt een pagina uit Google, robots.txt niet
Noindex is een metatag of HTTP-header die Google vraagt een pagina niet op te nemen. Een URL die je in robots.txt afsluit, kan nog steeds in Google staan, zonder beschrijving, als andere sites ernaar linken. En noindex werkt alleen als Google de pagina mag ophalen (Google, bijgewerkt 10 december 2025). Dus: laten crawlen en noindex erop.
Een robots.txt bestaat uit groepen met user-agent, disallow en allow
Een groep begint met een of meer regels User-agent: de naam van een crawler, of * voor alle crawlers. Daaronder staan Disallow (niet opvragen) en Allow (wel opvragen). Google ondersteunt volgens zijn specificatie (bijgewerkt 31 augustus 2026) vier velden: user-agent, allow, disallow en sitemap. Paden zijn hoofdlettergevoelig: /Blog/ is niet /blog/. Een crawler volgt de groep met zijn eigen naam, anders die voor *.
Bij twee passende regels wint de langste
Past een URL op een Disallow én een Allow, dan wint het langste pad; bij gelijke lengte wint Allow (RFC 9309). De volgorde in het bestand maakt voor Google niet uit. Zo sluit je een map af en laat je één pagina open:
User-agent: *
Disallow: /klantportaal/
Allow: /klantportaal/inloggen/Jokertekens zijn er twee: * voor elke reeks tekens, $ voor het einde van de URL. Disallow: /*.pdf$ sluit alle pdf’s af. Reguliere expressies werken niet.
Een sitemap-regel wijst elke crawler de weg
Met Sitemap: en een volledige URL vertel je crawlers waar je sitemap staat. De regel hoort bij geen groep en mag vaker voorkomen (Google, specificatie). 586 van de 762 leesbare bestanden in onze scan hebben er een (77%).
Alles open laten is hetzelfde als geen robots.txt
Mag elke crawler alles, dan volstaat dit. Volgens Google’s lijst met nuttige regels (bijgewerkt 12 juni 2026) doet een lege Disallow hetzelfde als Allow: / of helemaal geen robots.txt.
User-agent: *
Disallow:
Sitemap: https://www.jouwdomein.nl/sitemap.xmlDisallow: / sluit je hele site af
Dit is “disallow all”: elke crawler die zich aan robots.txt houdt, blijft weg. Sommige bouwers zetten het op een testomgeving; op een live site kost het je je vindbaarheid. 7 van de 1.000 populairste .nl-domeinen sluiten Googlebot helemaal buiten, 5 met precies dit bestand.
User-agent: *
Disallow: /WordPress maakt zelf een robots.txt aan
Zonder eigen bestand toont WordPress een virtuele robots.txt uit de functie do_robots: /wp-admin/ dicht, admin-ajax.php open. Sinds versie 5.5 komt er een verwijzing naar de eigen sitemap bij (WP_Sitemaps); werkt je SEO-plugin met een andere sitemap, kijk dan welke URL erin staat. 39 van de 762 bestanden in onze scan bevatten precies deze twee WordPress-regels.
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://www.jouwdomein.nl/wp-sitemap.xmlEen teksteditor is genoeg, een generator mag
Een robots.txt maak je in Kladblok of TextEdit, niet in Word: tekstverwerkers voegen volgens Google tekens toe waar crawlers over struikelen. Sla op in UTF-8 en zet het in de hoofdmap. Generators werken ook, maar vijf regels typ je net zo snel zelf.
Je robots.txt test je in drie stappen, zonder betaalde tool
De stappen komen uit Google’s handleiding en de hulp van Search Console (gelezen 28 september 2026).
- Open jouwdomein.nl/robots.txt in een privévenster. Zie je platte tekst met je regels, dan is het bestand openbaar. Een webpagina of een 404 betekent: geen robots.txt. Bij 44 van de 1.000 populairste .nl-domeinen kwam er een webpagina terug; Google haalt daar hooguit losse regels uit (specificatie).
- Kijk in het robots.txt-rapport van Search Console. Het rapport staat onder Instellingen en toont per host welk bestand Google vond, wanneer en met hoeveel problemen; regels met een fout slaat Google over. Na een reparatie vraag je hier een nieuwe crawl aan.
- Controleer losse pagina’s met de URL-inspectie. Staat bij Crawl toegestaan? een Nee, dan houdt robots.txt Google tegen. Let op: bij een geblokkeerde pagina staat Indexering toegestaan? altijd op Ja, omdat Google de noindex niet kan zien (hulp bij de URL-inspectie).
Google leest een gewijzigde robots.txt doorgaans binnen 24 uur
Google bewaart je robots.txt meestal maximaal 24 uur in een cache (specificatie); een nieuwe crawl aanvragen kan dat versnellen, maar garandeert volgens Google niet dat vrijgegeven URL’s meteen worden gecrawld. OpenAI noemt voor zijn zoekfunctie ook ongeveer 24 uur. Voor syntaxfouten verwijst Search Console naar externe validators.
Vier robots.txt-fouten die je vindbaarheid kosten
In de 762 leesbare bestanden van de 1.000 populairste .nl-domeinen telden we dit:
| In de robots.txt | Domeinen | Wat Google ermee doet |
|---|---|---|
| Sitemap-regel | 586 van 762 | Gebruikt hem om je sitemap te vinden |
| Crawl-delay | 115 van 762 | Negeert hem |
| De twee WordPress-standaardregels | 39 van 762 | Volgt ze: /wp-admin/ dicht |
| Googlebot mag niet in /wp-includes/ | 16 van 762 | Haalt daar geen scripts en stijlbestanden op |
| Crawl-delay-groep smelt samen met een Disallow: / | 15 van 762 | Leest ze als één groep |
| Noindex-regel | 4 van 762 | Negeert hem sinds 1 september 2019 |
| Googlebot helemaal buitengesloten | 7 van 1.000 | Crawlt de site niet |
Disallow: / na een lancering of migratie zet je site op slot
Google noemt in zijn gids voor een siteverhuizing (bijgewerkt 20 augustus 2026) vergeten robots.txt- en noindex-blokkades uit de bouwfase als veelgemaakte fout. Het WordPress-vinkje Zichtbaarheid voor zoekmachines werkt sinds versie 5.3 niet meer met Disallow: / maar met noindex in je pagina’s (do_robots): je site verdwijnt net zo goed, alleen zie je het niet in robots.txt.
CSS en JavaScript blokkeren maakt je pagina onleesbaar voor Google
Google heeft je CSS- en JavaScript-bestanden nodig om een pagina te renderen, staat in zijn specificatie. Sluit ze volgens de introductie alleen af als de pagina zonder ze niet wezenlijk verandert. Bij 16 van de 762 bestanden in onze scan mag Googlebot niet in /wp-includes/, de map met de eigen scripts en stijlbestanden van WordPress.
Met robots.txt de-indexeren werkt averechts
Wie een pagina in robots.txt dichtzet om hem uit Google te krijgen, bereikt het omgekeerde: Google kan de noindex niet meer lezen. In het rapport Pagina-indexering heet dat “Geïndexeerd, maar geblokkeerd door robots.txt”; Google raadt aan de blokkade weg te halen en noindex te gebruiken. Een Noindex-regel in robots.txt negeert Google sinds 1 september 2019 (Google, 2 juli 2019); 4 bestanden hebben er nog een.
Google negeert Crawl-delay, en die regel kan groepen samenvoegen
Google ondersteunt Crawl-delay niet, Anthropic wel; 115 van de 762 bestanden gebruiken hem. Let op de plek: Google leest een groep met alleen Crawl-delay als deel van de groep eronder (specificatie). Bij een grote webshop staat onder “Slow crawling rate for some agents” bingbot met een Crawl-delay, boven een rij bots met Disallow: /. Volgens de leesregels van Google mag bingbot daar dus niets; of Bing het ook zo leest, is aan Bing. Dat patroon zagen we bij 15 domeinen.
Zulke fouten zie je pas als iemand ernaar kijkt; in onze pakketten zit daarom elke week een controle van de techniek. Wat daaronder valt, lees je bij technische SEO.
AI-crawlerscan: 119 van de 1.000 populairste .nl-domeinen weren GPTBot
Met robots.txt bepaal je ook welke AI-crawlers binnenkomen. Voor de AI-crawlerscan van RankPilot toetsten we de 1.000 hoogst gerangschikte .nl-domeinen uit de Tranco-lijst op 16 AI-crawlers; 159 weren er minstens één. Trainingscrawlers verzamelen teksten voor taalmodellen, zoekcrawlers halen een pagina op voor een antwoord met bronlink. 151 domeinen weren een trainingscrawler, 92 een zoek- of gebruikersbot, 61 alleen training.
| Crawler | Van | Soort | Geweerd door | Waarvan met de bot bij naam |
|---|---|---|---|---|
| GPTBot | OpenAI | training | 119 van 1.000 | 104 |
| CCBot | Common Crawl | training | 104 van 1.000 | 88 |
| Bytespider | ByteDance | training | 101 van 1.000 | 85 |
| Amazonbot | Amazon | overig | 101 van 1.000 | 86 |
| ClaudeBot | Anthropic | training | 98 van 1.000 | 82 |
| Google-Extended | training | 86 van 1.000 | 71 | |
| anthropic-ai | Anthropic (oude naam) | training | 84 van 1.000 | 68 |
| ChatGPT-User | OpenAI | zoeken of gebruiker | 82 van 1.000 | 67 |
| cohere-ai | Cohere | training | 80 van 1.000 | 64 |
| Meta-ExternalAgent | Meta | training | 77 van 1.000 | 61 |
| PerplexityBot | Perplexity | zoeken of gebruiker | 76 van 1.000 | 60 |
| Applebot-Extended | Apple | training | 71 van 1.000 | 55 |
| OAI-SearchBot | OpenAI | zoeken of gebruiker | 70 van 1.000 | 54 |
| Perplexity-User | Perplexity | zoeken of gebruiker | 64 van 1.000 | 48 |
| Claude-SearchBot | Anthropic | zoeken of gebruiker | 53 van 1.000 | 37 |
| Claude-User | Anthropic | zoeken of gebruiker | 46 van 1.000 | 30 |
GPTBot is de trainingscrawler van OpenAI
GPTBot is de crawler waarmee OpenAI teksten verzamelt die het kan gebruiken om zijn modellen te trainen. Volgens OpenAI staat hij los van OAI-SearchBot, die bepaalt of je in de zoekantwoorden van ChatGPT verschijnt, en van ChatGPT-User, die pagina’s ophaalt voor gebruikers. GPTBot is de vaakst geweerde crawler: 119 domeinen. 69 weren GPTBot en OAI-SearchBot samen, 50 alleen GPTBot.
ClaudeBot is de trainingscrawler van Anthropic
ClaudeBot is de crawler waarmee Anthropic webteksten verzamelt die kunnen bijdragen aan de training van Claude. Anthropic (7 april 2026) heeft daarnaast Claude-SearchBot voor zoekresultaten en Claude-User voor gebruikersvragen. 98 domeinen weren ClaudeBot. De oude naam anthropic-ai, die Anthropic zelf niet noemt, staat bij 84 domeinen op slot; de zoekcrawler Claude-SearchBot maar bij 53.
Google-Extended haalt je niet uit Google Zoeken
Google-Extended is een token in robots.txt, geen aparte crawler. Volgens Google (bijgewerkt 14 juli 2026) regelt het training van Gemini en grounding in de Gemini-apps, zonder invloed op Google Zoeken. Voor AI Overviews gelden Googlebot, nosnippet en noindex (Google, bijgewerkt 10 december 2025). 79 domeinen weren Google-Extended en laten Googlebot toe: hun teksten kunnen gewoon in een AI Overview staan.
Nieuwsmedia weren GPTBot bijna zes keer zo vaak als webshops
Aandeel domeinen dat GPTBot weert, per sector
De 1.000 populairste .nl-domeinen (Tranco-lijst 64X3X), robots.txt opgehaald op 28 september 2026.
Bron: AI-crawlerscan van RankPilot, 28 september 2026. Sectorindeling met de hand, per domein vastgelegd.
Cijfers als tabel
| Sector | Weert GPTBot |
|---|---|
| Nieuws en media (77 van 175) | 44,0% |
| Overheid en onderwijs (9 van 100) | 9,0% |
| Webshop en retail (10 van 134) | 7,5% |
| Zorg (1 van 14) | 7,1% |
| Reizen (2 van 35) | 5,7% |
| Overig (20 van 516) | 3,9% |
| Financieel (0 van 26) | 0,0% |
| Sector | Domeinen | Leesbare robots.txt | Weert GPTBot | Weert ook OAI-SearchBot | Weert minstens één AI-crawler |
|---|---|---|---|---|---|
| Nieuws en media | 175 | 168 | 77 | 48 | 81 |
| Overheid en onderwijs | 100 | 92 | 9 | 6 | 10 |
| Webshop en retail | 134 | 112 | 10 | 4 | 20 |
| Zorg | 14 | 12 | 1 | 1 | 1 |
| Reizen | 35 | 32 | 2 | 0 | 7 |
| Overig | 516 | 325 | 20 | 10 | 38 |
| Financieel | 26 | 21 | 0 | 0 | 2 |
| Totaal | 1.000 | 762 | 119 | 69 | 159 |
Webshops laten de deur bijna overal open: 10 van de 134 weren GPTBot, 4 OAI-SearchBot. Amazon.nl is de uitzondering, met 13 van de 16 crawlers op slot; MediaMarkt heet GPTBot en OAI-SearchBot juist met naam welkom. Geen van de 21 financiële domeinen met een leesbare robots.txt weert GPTBot. In de zorg gaat het om één domein van de 14, en dat weert ook Googlebot.
De meeste nieuwssites houden ook de zoekcrawler van ChatGPT buiten
Van de 77 mediadomeinen die GPTBot weren, weren er 48 ook OAI-SearchBot, onder meer nu.nl, de Volkskrant, NRC, De Telegraaf, het FD en De Correspondent. Tien van de dertien regionale omroepen weren alle 16 crawlers, Omroep Brabant en Omroep Flevoland geen enkele. In de zoekantwoorden van ChatGPT verschijnen de blokkerende sites volgens OpenAI niet.
De NOS weert training maar laat ChatGPT-zoeken toe
De NOS weert GPTBot, ClaudeBot en PerplexityBot, maar niet OAI-SearchBot. Jeugdjournaal, BNR en de VPRO weren ook GPTBot en laten OAI-SearchBot toe. NH Nieuws en AT5 zetten OAI-SearchBot er zelfs met naam in, met de content-signal-regel “ai-train=no, search=yes, ai-input=yes”. Lezen mag, leren niet. Zo doen 29 van de 77 mediadomeinen het.
Wat dit betekent voor jouw bedrijf
Een mkb-site wil juist in AI-antwoorden staan
Voor een uitgever is de tekst het product; voor een installateur, advocaat of webshop is hij de etalage. Hoe vaker ChatGPT of Perplexity je noemt, hoe beter. Weer je OAI-SearchBot, dan sta je volgens OpenAI niet in de zoekantwoorden van ChatGPT; GPTBot weren kost je daar niets. Hoe je in AI-antwoorden komt, lees je in AI SEO uitgelegd.
Zo laat je zoekcrawlers toe en houd je training buiten
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Claude-SearchBot
User-agent: Claude-User
Disallow: /wp-admin/
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /
User-agent: *
Disallow: /wp-admin/
Sitemap: https://www.jouwdomein.nl/sitemap_index.xmlEen bot met een eigen groep negeert de regels onder User-agent: * (RFC 9309); herhaal dus per groep wat dicht moet. Twijfel je, laat dan alles open: voor de meeste ondernemers levert zichtbaarheid meer op dan weren. Cloudflare (bijgewerkt 1 juli 2026) kan AI-bots ook in de firewall tegenhouden, buiten je robots.txt om. Liever dat wij meekijken? Dat doen we bij AI SEO.
Deze cijfers gebruiken
Overnemen mag, met als bron “AI-crawlerscan, RankPilot, september 2026” en een link naar deze pagina. Gemeten op 28 september 2026:
- 119 van de 1.000 populairste .nl-domeinen weren GPTBot.
- Nieuwsmedia weren GPTBot in 44% van de gevallen, webshops in 7%.
- 48 van de 77 mediadomeinen die GPTBot weren, houden ook de zoekcrawler van ChatGPT buiten.
Veelgestelde vragen
Is het negeren van robots.txt illegaal?
Robots.txt is een afspraak, geen wet: RFC 9309 noemt de regels geen vorm van toegangsbeveiliging, en volgens Google volgt niet elke crawler ze. Of negeren juridische gevolgen heeft, hangt af van wat er met je inhoud gebeurt; dat is een vraag voor een jurist.
Wordt robots.txt nog gebruikt?
Ja. Op 28 september 2026 hadden 762 van de 1.000 populairste .nl-domeinen er een, en sinds september 2022 is het protocol een IETF-standaard (RFC 9309). Ook AI-crawlers stuur je ermee.
Hoe los je ‘geblokkeerd door robots.txt’ op in Search Console?
Kijk eerst of de blokkade bedoeld is; bij een winkelwagen is dat prima. Moet de pagina wel in Google, zoek dan met de URL-inspectie de regel die hem tegenhoudt, haal die weg en vraag in het robots.txt-rapport een nieuwe crawl aan.
Houdt ClaudeBot zich aan robots.txt?
Volgens Anthropic wel, en ook aan Crawl-delay. Zet de regel op elk subdomein en blokkeer ClaudeBot niet alleen op IP-adres: dan kan de bot je robots.txt niet lezen en is je opt-out niet gegarandeerd. In onze scan weerden 98 van de 1.000 domeinen ClaudeBot.
Moet ik GPTBot blokkeren?
Dat hoeft niet. Voor ChatGPT-zoeken maakt het volgens OpenAI niets uit, dat regelt OAI-SearchBot. Wil je niet in trainingsdata, weer dan GPTBot en laat OAI-SearchBot toe, zoals 50 van de 1.000 domeinen in onze scan.
Zo is dit gemeten
Bron is de Tranco-lijst 64X3X (Le Pochat e.a., NDSS 2019) van 27 september 2026, gebaseerd op 30 dagen data van onder meer Chrome en Cloudflare; daaruit namen we de 1.000 hoogst gerangschikte .nl-domeinen. Op 28 september 2026 haalden we elke robots.txt op met curl en lazen we hem volgens RFC 9309. Geweerd betekent: homepage en een willekeurige diepere pagina allebei verboden. De sector bepaalden we per domein met de hand. De bronnen lazen we zelf op 28 september 2026.
Robots.txt laat de wens zien, niet de firewall
We meten wat een site vraagt, niet wat een bot doet; firewallblokkades zien we niet. Tranco meet populariteit, dus er staan ook technische domeinen in; zonder de 75 doorverwijzers naar een ander domein weren 117 van de 925 GPTBot. Samengevoegde groepen lazen we zoals Google ze beschrijft. En dit is één dag.
Inhoud
- Robots.txt regelt wat crawlers opvragen, niet wat Google toont
- Een robots.txt bestaat uit groepen met user-agent, disallow en allow
- Je robots.txt test je in drie stappen, zonder betaalde tool
- Vier robots.txt-fouten die je vindbaarheid kosten
- AI-crawlerscan: 119 van de 1.000 populairste .nl-domeinen weren GPTBot
- Nieuwsmedia weren GPTBot bijna zes keer zo vaak als webshops
- Wat dit betekent voor jouw bedrijf
- Deze cijfers gebruiken
- Veelgestelde vragen
- Zo is dit gemeten