ClaudeBot, GPTBot en PerplexityBot: AI-crawlers toelaten of blokkeren?

Blokkeren beschermt tegen training, maar haalt je uit AI-antwoorden. De afweging per bot, de middenweg, en hoe je je robots.txt controleert.

← terug naar home

AI-vindbaarheid // toegang
ai-crawlers.md

$ cat robots.txt --bots=claudebot,gptbot,perplexitybot

ClaudeBot, GPTBot en PerplexityBot: AI-crawlers toelaten of blokkeren?

ClaudeBot (Anthropic), GPTBot (OpenAI) en PerplexityBot zijn de crawlers waarmee AI-assistenten je site lezen. Toelaten is meestal verstandig: een bot die je site niet mag lezen, kan je nergens citeren. Blokkeren beschermt tegen training, maar haalt je tegelijk uit de antwoorden. De middenweg bestaat: trainingscrawlers weren en zoekbots toelaten. Dit stuk zet de afweging op een rij, zodat je zelf kiest; er is geen keuze die voor iedereen klopt.

DD DataDrift Digital • 18 september 2026 • 6 min

In de hoofdmap van vrijwel elke website staat een bestand dat robots.txt heet. Het vertelt geautomatiseerde bezoekers welke delen van de site zij wel en niet mogen lezen. Jarenlang ging dat vooral over de crawler van Google. Sinds AI-assistenten het web lezen, staan er nieuwe namen aan de deur, en de keuze die je in dat bestand maakt bepaalt of die assistenten jou kunnen noemen.

01 / de afwegingWat een blokkade werkelijk doet

Een blokkade doet twee dingen tegelijk, en je kunt ze niet los van elkaar krijgen. Je voorkomt dat je teksten gebruikt worden om taalmodellen te trainen, en je voorkomt dat diezelfde systemen je pagina's kunnen opvragen wanneer een gebruiker iets vraagt waar jij het antwoord op hebt.

Dat tweede gevolg wordt vaak over het hoofd gezien. Wie via een AI-assistent zoekt naar wat jij aanbiedt, krijgt een antwoord met bronnen erbij. Sta je in robots.txt op de zwarte lijst, dan kan jouw pagina die bron niet zijn. Het antwoord komt er toch, alleen met je concurrent erin. Waarom dat zo uitpakt, staat uitgebreider in waarom noemt ChatGPT je concurrent wel en jou niet.

Een crawler die je site niet mag lezen, kan je nergens citeren. De blokkade die je content beschermt, maakt je tegelijk onzichtbaar.

02 / de namenWelke bots er aan je deur staan

Elk platform heeft een eigen crawler met een eigen naam, en je robots.txt behandelt ze per naam. Dit zijn de bots die ertoe doen:

BotVoedtDoelAdvies
GPTBot en ChatGPT-UserChatGPT (OpenAI)zoeken en citerentoelaten
PerplexityBotPerplexityzoeken en citerentoelaten
ClaudeBot en anthropic-aiClaude (Anthropic)zoeken en citerentoelaten
Google-ExtendedGemini en AI Overviews (Google)zoeken en citerentoelaten
BingbotCopilot (Microsoft)zoeken en citerentoelaten
CCBottrainingsdatasets (Common Crawl)alleen trainingweren kan, kost geen citaten

De onderste regel is het buitenbeentje. CCBot, de crawler van Common Crawl, bouwt een openbare kopie van het web die vooral als trainingsmateriaal dient. CCBot levert geen citaties op; de andere bots in de tabel wel, en daar komt het advies per regel vandaan.

Voor Claude komt daar een bijzonderheid bij: Claude zoekt op het web via Brave Search, dus naast ClaudeBot telt ook je aanwezigheid in de index van Brave. Hoe dat werkt staat in verschijnt je bedrijf in Claude.

03 / de middenwegTrainingscrawlers weren, zoekbots toelaten

De middenweg is simpeler dan hij klinkt: weiger de bots die alleen trainingsmateriaal verzamelen, en laat de bots door die antwoorden van bronnen voorzien. In de praktijk betekent dat CCBot weren en de namen uit de tabel hierboven toelaten.

Helemaal zuiver is die scheiding niet. Wat een platform met opgehaalde pagina's doet, bepaalt het platform zelf, en de grens tussen zoeken en trainen verschuift per aanbieder en per jaar. De middenweg is dus geen garantie dat je teksten nooit in trainingsdata belanden. Het is een afweging: het grootste deel van de trainingsstroom dichtzetten, terwijl de weg naar citaties open blijft.

Best voor: dienstverleners en andere bedrijven waarvan de teksten een uithangbord zijn en geen product. Voor die groep is de middenweg de logische keuze: de trainingsstroom grotendeels dicht, de weg naar citaties open.

04 / de controleZo lees je je eigen robots.txt

Controleren kost twee minuten en vraagt geen technische kennis. Typ je domeinnaam in de browser met /robots.txt erachter, dus bijvoorbeeld jouwbedrijf.nl/robots.txt. Je ziet een tekstbestand met regels die beginnen met User-agent en Disallow.

Zoek in dat bestand naar de namen uit de tabel. Staat er een blok als "User-agent: GPTBot" gevolgd door "Disallow: /", dan is die bot volledig geweerd. Vind je geen van de namen terug, dan geldt wat er onder "User-agent: *" staat, de regel voor alle bezoekers tegelijk.

De uitkomst verrast regelmatig. Sommige sitebouwers en beveiligingspakketten zetten AI-bots standaard op de zwarte lijst, zonder dat de eigenaar die keuze ooit gemaakt heeft. Wie nooit gekeken heeft, weet dus niet welke keuze er namens hem is gemaakt.

05 / de uitzonderingWanneer blokkeren wél logisch is

Er zijn situaties waarin volledig blokkeren de juiste keuze is, en dan hoef je hier verder niets mee. Verdien je rechtstreeks aan je content, bijvoorbeeld met betaalde artikelen, een kennisbank achter een inlog of lesmateriaal, dan is elke gratis doorgifte via een AI-antwoord een lek in je verdienmodel. Datzelfde geldt voor uitgevers die over hergebruik onderhandelen met AI-partijen: open deuren verzwakken je onderhandelingspositie.

Voor een dienstverlener ligt het andersom. Je teksten zijn geen product maar een uithangbord, en een citaat in een AI-antwoord is precies wat dat uithangbord moet doen. In dat geval kost een blokkade zichtbaarheid en levert hij niets op dat je wilt beschermen.

Veelgestelde vragen
Wat gebeurt er als ik GPTBot blokkeer?+
ChatGPT kan je pagina's dan niet meer ophalen wanneer een gebruiker iets vraagt waar jouw site het antwoord op heeft. Je verdwijnt uit de bronvermeldingen van ChatGPT-antwoorden. Wat al in eerdere trainingsdata zat, verdwijnt daarmee niet; de blokkade werkt vanaf het moment van plaatsing en alleen vooruit.
Wat is het verschil tussen GPTBot en ChatGPT-User?+
GPTBot is de crawler van OpenAI die het web systematisch afgaat. ChatGPT-User is de bezoeker die langskomt op het moment dat een gebruiker in ChatGPT een vraag stelt waarvoor het systeem live een pagina opvraagt. Wil je geciteerd worden, dan moeten beide toegang hebben; ze staan als aparte namen in robots.txt.
Kan ik AI-training weigeren en toch geciteerd worden?+
Gedeeltelijk. Je kunt pure trainingscrawlers zoals CCBot weren en de zoekbots van OpenAI, Anthropic, Perplexity en Google toelaten. Dat sluit de grootste trainingsstroom af terwijl citaties mogelijk blijven. Een waterdichte scheiding is het niet, omdat platforms zelf bepalen wat zij met opgehaalde pagina's doen.
Waar vind ik mijn robots.txt?+
Op je eigen domein, met /robots.txt achter de domeinnaam, bijvoorbeeld jouwbedrijf.nl/robots.txt. Het bestand is openbaar en voor iedereen leesbaar. Krijg je een foutmelding of een lege pagina, dan heeft je site geen robots.txt en geldt voor alle bots hetzelfde: alles mag gelezen worden.
Blokkeert mijn sitebouwer AI-crawlers soms standaard?+
Dat komt voor. Sommige platforms en beveiligingsdiensten zetten AI-bots uit voorzorg op de zwarte lijst, zonder dat de site-eigenaar daarvoor koos. Controleer daarom je eigen robots.txt in plaats van aan te nemen dat alles openstaat, en vraag je bouwer welke keuze er is gemaakt en waarom.
nulmeting · vast bedrag · geen verplichtingen

Weet je welke AI-bots jouw site nu toelaat, en wat dat je aan zichtbaarheid kost of oplevert?

De scan

Dit is de nulmeting: vaste zoekvragen op ChatGPT, Gemini, Claude, Perplexity en Google. Actuele bedragen staan op de prijzenpagina. Ook zonder vervolg houd je het rapport.

→ De scan · prijzen

Deze tekst is met AI-ondersteuning tot stand gekomen en door een mens gecontroleerd en vastgesteld voor publicatie.