ClaudeBot, GPTBot en PerplexityBot: AI-crawlers toelaten of blokkeren?
Blokkeren beschermt tegen training, maar haalt je uit AI-antwoorden. De afweging per bot, de middenweg, en hoe je je robots.txt controleert.
Read this in English →$ cat robots.txt --bots=claudebot,gptbot,perplexitybot
ClaudeBot, GPTBot en PerplexityBot: AI-crawlers toelaten of blokkeren?
ClaudeBot (Anthropic), GPTBot (OpenAI) en PerplexityBot zijn de crawlers waarmee AI-assistenten je site lezen. Toelaten is meestal verstandig: een bot die je site niet mag lezen, kan je nergens citeren. Blokkeren beschermt tegen training, maar haalt je tegelijk uit de antwoorden. De middenweg bestaat: trainingscrawlers weren en zoekbots toelaten. Dit stuk zet de afweging op een rij, zodat je zelf kiest; er is geen keuze die voor iedereen klopt.
In de hoofdmap van vrijwel elke website staat een bestand dat robots.txt heet. Het vertelt geautomatiseerde bezoekers welke delen van de site zij wel en niet mogen lezen. Jarenlang ging dat vooral over de crawler van Google. Sinds AI-assistenten het web lezen, staan er nieuwe namen aan de deur, en de keuze die je in dat bestand maakt bepaalt of die assistenten jou kunnen noemen.
01 / de afwegingWat een blokkade werkelijk doet
Een blokkade doet twee dingen tegelijk, en je kunt ze niet los van elkaar krijgen. Je voorkomt dat je teksten gebruikt worden om taalmodellen te trainen, en je voorkomt dat diezelfde systemen je pagina's kunnen opvragen wanneer een gebruiker iets vraagt waar jij het antwoord op hebt.
Dat tweede gevolg wordt vaak over het hoofd gezien. Wie via een AI-assistent zoekt naar wat jij aanbiedt, krijgt een antwoord met bronnen erbij. Sta je in robots.txt op de zwarte lijst, dan kan jouw pagina die bron niet zijn. Het antwoord komt er toch, alleen met je concurrent erin. Waarom dat zo uitpakt, staat uitgebreider in waarom noemt ChatGPT je concurrent wel en jou niet.
Een crawler die je site niet mag lezen, kan je nergens citeren. De blokkade die je content beschermt, maakt je tegelijk onzichtbaar.
02 / de namenWelke bots er aan je deur staan
Elk platform heeft een eigen crawler met een eigen naam, en je robots.txt behandelt ze per naam. Dit zijn de bots die ertoe doen:
| Bot | Voedt | Doel | Advies |
|---|---|---|---|
| GPTBot en ChatGPT-User | ChatGPT (OpenAI) | zoeken en citeren | toelaten |
| PerplexityBot | Perplexity | zoeken en citeren | toelaten |
| ClaudeBot en anthropic-ai | Claude (Anthropic) | zoeken en citeren | toelaten |
| Google-Extended | Gemini en AI Overviews (Google) | zoeken en citeren | toelaten |
| Bingbot | Copilot (Microsoft) | zoeken en citeren | toelaten |
| CCBot | trainingsdatasets (Common Crawl) | alleen training | weren kan, kost geen citaten |
De onderste regel is het buitenbeentje. CCBot, de crawler van Common Crawl, bouwt een openbare kopie van het web die vooral als trainingsmateriaal dient. CCBot levert geen citaties op; de andere bots in de tabel wel, en daar komt het advies per regel vandaan.
Voor Claude komt daar een bijzonderheid bij: Claude zoekt op het web via Brave Search, dus naast ClaudeBot telt ook je aanwezigheid in de index van Brave. Hoe dat werkt staat in verschijnt je bedrijf in Claude.
03 / de middenwegTrainingscrawlers weren, zoekbots toelaten
De middenweg is simpeler dan hij klinkt: weiger de bots die alleen trainingsmateriaal verzamelen, en laat de bots door die antwoorden van bronnen voorzien. In de praktijk betekent dat CCBot weren en de namen uit de tabel hierboven toelaten.
Helemaal zuiver is die scheiding niet. Wat een platform met opgehaalde pagina's doet, bepaalt het platform zelf, en de grens tussen zoeken en trainen verschuift per aanbieder en per jaar. De middenweg is dus geen garantie dat je teksten nooit in trainingsdata belanden. Het is een afweging: het grootste deel van de trainingsstroom dichtzetten, terwijl de weg naar citaties open blijft.
Best voor: dienstverleners en andere bedrijven waarvan de teksten een uithangbord zijn en geen product. Voor die groep is de middenweg de logische keuze: de trainingsstroom grotendeels dicht, de weg naar citaties open.
04 / de controleZo lees je je eigen robots.txt
Controleren kost twee minuten en vraagt geen technische kennis. Typ je domeinnaam in de browser met /robots.txt erachter, dus bijvoorbeeld jouwbedrijf.nl/robots.txt. Je ziet een tekstbestand met regels die beginnen met User-agent en Disallow.
Zoek in dat bestand naar de namen uit de tabel. Staat er een blok als "User-agent: GPTBot" gevolgd door "Disallow: /", dan is die bot volledig geweerd. Vind je geen van de namen terug, dan geldt wat er onder "User-agent: *" staat, de regel voor alle bezoekers tegelijk.
De uitkomst verrast regelmatig. Sommige sitebouwers en beveiligingspakketten zetten AI-bots standaard op de zwarte lijst, zonder dat de eigenaar die keuze ooit gemaakt heeft. Wie nooit gekeken heeft, weet dus niet welke keuze er namens hem is gemaakt.
05 / de uitzonderingWanneer blokkeren wél logisch is
Er zijn situaties waarin volledig blokkeren de juiste keuze is, en dan hoef je hier verder niets mee. Verdien je rechtstreeks aan je content, bijvoorbeeld met betaalde artikelen, een kennisbank achter een inlog of lesmateriaal, dan is elke gratis doorgifte via een AI-antwoord een lek in je verdienmodel. Datzelfde geldt voor uitgevers die over hergebruik onderhandelen met AI-partijen: open deuren verzwakken je onderhandelingspositie.
Voor een dienstverlener ligt het andersom. Je teksten zijn geen product maar een uithangbord, en een citaat in een AI-antwoord is precies wat dat uithangbord moet doen. In dat geval kost een blokkade zichtbaarheid en levert hij niets op dat je wilt beschermen.
Wat gebeurt er als ik GPTBot blokkeer?+
Wat is het verschil tussen GPTBot en ChatGPT-User?+
Kan ik AI-training weigeren en toch geciteerd worden?+
Waar vind ik mijn robots.txt?+
Blokkeert mijn sitebouwer AI-crawlers soms standaard?+
Weet je welke AI-bots jouw site nu toelaat, en wat dat je aan zichtbaarheid kost of oplevert?
De scan
Dit is de nulmeting: vaste zoekvragen op ChatGPT, Gemini, Claude, Perplexity en Google. Actuele bedragen staan op de prijzenpagina. Ook zonder vervolg houd je het rapport.
Deze tekst is met AI-ondersteuning tot stand gekomen en door een mens gecontroleerd en vastgesteld voor publicatie.