In een Hacker News-draad over verkeer van AI-crawlers beschreef een hostingbeheerder de belasting vanuit het perspectief van de operator: "ongeveer 6 verschillende behoorlijk agressieve AI-bots" die geregeld blijven hangen op productvariant- of categoriepagina's en die vervolgens met ruwweg één verzoek per seconde bestoken, op een site waar "elke paginalading een volle roundtrip van 1 s kan kosten (grotendeels in MySQL)". Het cumulatieve effect, in dezelfde reactie: "bijna alsof de site elke dag opnieuw geslashdot wordt".
Uw website voorbereiden op AI-agents is in de eerste plaats een capaciteitsvraagstuk, dus het meeste werk hier is serverconfiguratie en heel weinig ervan contentstrategie. Het handige aan dit verkeer is dat het grotendeels niet anoniem is: de bedrijven die het genereren publiceren de namen van hun crawlers, documenteren waarvoor elke crawler dient en leggen uit hoe u ze uitschakelt. Hierna volgt wat u moet configureren, wat elk mechanisme in de praktijk afdwingt en de twee stappen die ik zou overslaan: een llms.txt publiceren en schema-markup voor AI toevoegen.
TL;DR
- AI-verkeer valt doorgaans uiteen in training, indexering voor AI-zoeken en door gebruikers uitgelokte opvragingen. OpenAI en Anthropic bieden aparte tokens voor die doeleinden, zodat u ze los van elkaar kunt sturen; sommige crawlers met meerdere doelen combineren rollen onder één identiteit.
- OpenAI, Anthropic, Perplexity en Common Crawl documenteren robots.txt-besturing voor hun automatische crawlers. Door gebruikers uitgelokte ophalers vormen de uitzondering: Anthropic past robots.txt ook toe op Claude-User, OpenAI zegt dat de regels mogelijk niet gelden voor ChatGPT-User, en Perplexity-User negeert ze doorgaans.
- Het bestand robots.txt is een toestemmingsmechanisme, geen toegangscontrole. RFC 9309 geeft het geen eigen handhavingsmacht; bots die zich eraan houden kunnen uw belasting verlagen, maar het bestand kan niet-nalevend verkeer niet afknijpen of stoppen.
- Over 137.210 domeinen in het analytics-klantenbestand van Ahrefs kregen 97 % van de gepubliceerde llms.txt-bestanden in mei 2026 nul verzoeken. Publiceer er gerust een, maar bouw er geen tooling omheen.
- Houd gestructureerde data waar die klassieke Search-functies ondersteunt, maar de documentatie van Google zegt dat er voor zijn AI-functies geen speciaal schema of AI-tekstbestand nodig is.
- Render kritieke content server-side als u wilt dat OpenAI, ClaudeBot, PerplexityBot of CCBot die lezen. Vercel stelde vast dat die crawlers geen JavaScript uitvoeren; Gemini via Googlebot en AppleBot zijn de uitzonderingen.
- Handhaving voorbij de coöperatieve robots.txt-regels zit bij de reverse proxy, in een WAF die u zelf draait, of achter een proof-of-work-challenge, in die volgorde van kosten.
Wat dit artikel niet behandelt
Dit gaat over een site die door agents wordt bezocht, niet over een site die met hen transacties doet. Vier aanpalende onderwerpen blijven buiten beschouwing.
- Agentic commerce en checkout-flows, een ander probleem voor een ander soort site.
- Het juridische en auteursrechtelijke debat over trainingsdata, wat een zakelijke beslissing is en geen serverconfiguratie.
- Een stapsgewijze WebMCP-implementatie, aangezien de standaard nog een origin trial is.
- CDN-specifieke configuratie buiten de ene Cloudflare-sectie hieronder.
Welke AI-crawlers uw site bestoken
GPTBot en ClaudeBot verzamelen content die voor modeltraining kan worden gebruikt. OAI-SearchBot en Claude-SearchBot ondersteunen AI-zoeken en -ophalen. ChatGPT-User en Claude-User halen pagina's op als reactie op gebruikersacties. Bij sommige aanbieders zijn die taken gescheiden, maar niet elke crawler op het web past netjes bij één doel.
Het nalevingsbeeld is preciezer dan de gangbare korte samenvatting doet vermoeden. de crawlerdocumentatie van Anthropic zegt dat ClaudeBot, Claude-User en Claude-SearchBot robots.txt respecteren. de botdocumentatie van OpenAI zegt dat zijn automatische crawlers onafhankelijke besturing gebruiken, maar dat robots.txt-regels mogelijk niet gelden voor ChatGPT-User omdat die verzoeken door een mens worden gestart. de crawlerdocumentatie van Perplexity maakt een vergelijkbaar onderscheid: PerplexityBot volgt webmasterinstellingen, terwijl Perplexity-User robots.txt doorgaans negeert. De algemene bewering dat AI-bots robots.txt negeren gooit dus gedocumenteerde crawlers die het bestand respecteren op één hoop met door gebruikers uitgelokte ophalers waarvan het gedrag per aanbieder verschilt, plus scrapers die zich helemaal nooit bekendmaken.
De tabel hieronder is actueel op het moment van schrijven. Nieuwe tokens verschijnen sneller dan enig artikel ze kan bijhouden, dus zie het als een startkaart met een korte houdbaarheid.
| Crawlertoken | Exploitant | Wat het doet | Respecteert robots.txt | Hoe u de identiteit verifieert |
|---|---|---|---|---|
| GPTBot | OpenAI | Verzamelt content die voor modeltraining kan worden gebruikt | Ja | openai.com/gptbot.json |
| OAI-SearchBot | OpenAI | Laat sites verschijnen in ChatGPT-zoekresultaten | Ja | openai.com/searchbot.json |
| ChatGPT-User | OpenAI | Haalt een pagina op voor een ChatGPT-gebruikersactie | Geldt mogelijk niet | openai.com/chatgpt-user.json |
| OAI-AdsBot | OpenAI | Valideert ingediende advertenties en landingspagina's | Ja | openai.com/adsbot.json |
| ClaudeBot | Anthropic | Verzamelt content die kan bijdragen aan modeltraining | Ja | Gedeelde lijst op claude.com/crawling/bots.json |
| Claude-User | Anthropic | Haalt een pagina op die een Claude-gebruiker opvraagt | Ja | Gedeelde lijst op claude.com/crawling/bots.json |
| Claude-SearchBot | Anthropic | Indexeert content om de zoekkwaliteit te verbeteren | Ja | Gedeelde lijst op claude.com/crawling/bots.json |
| PerplexityBot | Perplexity AI | Indexeert sites en linkt ernaar in Perplexity-resultaten; niet voor training van foundation-modellen | Ja | perplexity.com/perplexitybot.json |
| Perplexity-User | Perplexity AI | Haalt een pagina op om een gebruikersvraag te beantwoorden | Negeert het doorgaans | perplexity.com/perplexity-user.json |
| Google-Extended | Bepaalt Gemini-training en -grounding buiten Search | Ja | Geen crawler; niets te verifiëren | |
| CCBot | Common Crawl | Bouwt het publieke Common Crawl-corpus op | Ja | Reverse DNS voor IPv4; gepubliceerde v4/v6-reeksen |
robots.txt-regels schrijven voor AI-crawlers
RFC 9309 zegt dat de regels in robots.txt geen vorm van toegangsautorisatie zijn. De IETF standaardiseerde in september 2022 syntaxis, parsing en caching; het maakte van het bestand geen handhavingsmechanisme. De details die in de praktijk pijn doen zitten onder de syntaxis: het bestand moet UTF-8-gecodeerd zijn, parsers moeten minstens 500 kibibyte verwerken, en bij tegenstrijdige directieven wint de meest specifieke padovereenkomst. Waar een regel in het bestand staat, maakt niets uit.
Een robots.txt voor AI-bots gebruikt hetzelfde bestand en dezelfde syntaxis die u al hebt; wat verandert is de tokenlijst. Orden de regels op intentie en ze overleven de wisselende namen van aanbieders. Als uw bezwaar training betreft, blokkeer dan de trainingstokens en laat de indexeerders met rust:
# Block training, keep AI search indexing
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Wilt u elk in de tabel genoemd token een site-breed opt-outsignaal sturen, groepeer ze dan onder één regel. Het Disallow elf keer herhalen is niet nodig:
# Send a site-wide opt-out signal to named AI tokens
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: OAI-AdsBot
User-agent: ClaudeBot
User-agent: Claude-User
User-agent: Claude-SearchBot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: CCBot
Disallow: /
Dat is nog steeds geen universele blokkade. Anthropic past robots.txt toe op Claude-User, maar OpenAI zegt dat de regels mogelijk niet gelden voor ChatGPT-User, en Perplexity-User negeert ze doorgaans. Moeten die door gebruikers uitgelokte opvragingen echt worden gestopt en niet slechts ontmoedigd, dwing die beslissing dan af op de proxy of in de WAF.
Google-Extended is het token dat het vaakst verkeerd wordt begrepen, en het onderscheid telt als zoekverkeer uw rekeningen betaalt. de crawlerdocumentatie van Google beschrijft het als een zelfstandig producttoken dat bepaalt of gecrawlde content mag worden gebruikt voor Gemini-training en -grounding buiten Search, en zegt dat het de opname of ranking van een site in Google Zoeken niet beïnvloedt. Het blokkeren raakt het zoekgedrag van Googlebot niet.
Een tokenlijst met de hand actueel houden is geen goede besteding van iemands middag. De door de gemeenschap onderhouden ai.robots.txt-repository houdt AI-useragents bij en genereert configuraties voor robots.txt, nginx, Caddy, HAProxy, Lighttpd en Apache. Apache-beheerders kunnen het gegenereerde blok naast hun overige .htaccess-regels op mapniveau zetten.
Pro-tip: vertrouw de user-agentstring niet. Het is een header, en headers zijn gratis te vervalsen. De CCBot-documentatie van Common Crawl waarschuwt dat crawlers zich ten onrechte als CCBot voordoen. Verifieer voor IPv4 met forward-confirmed reverse DNS onder *.crawl.commoncrawl.org; gebruik voor IPv6 de door Common Crawl gepubliceerde IP-reeksen, want reverse DNS wordt daar momenteel niet ondersteund. De hierboven genoemde leverancierspagina's publiceren eveneens actuele IP-reeksen voor de andere genoemde crawlers. Dat is een gedocumenteerd verificatiepad bij deze leveranciers, geen eigenschap van AI-crawlers in het algemeen.
Doet llms.txt eigenlijk iets?
Op grond van de huidige gegevens: vrijwel niets. llms.txt is een voorgesteld tekstbestand in de root van uw site dat taalmodellen een samengestelde samenvatting van uw content aanbiedt. Er een publiceren is goedkoop, maar het huidige bewijs geeft u weinig reden om erin te investeren, en de documentatie van Google zegt dat u het niet nodig hebt voor zijn AI-zoekfuncties.
Het formaat is minimaal. Het llms.txt-voorstel dateert van september 2024, staat op /llms.txt, en maakt een H1 met de site- of projectnaam tot de enige verplichte sectie.
Het oordeel komt uit de metingen. Het Ahrefs-onderzoek onder 137.210 domeinen stelde vast dat 28 % van de gemeten domeinen een llms.txt-bestand publiceerde en dat 97 % van die bestanden in mei 2026 nul verzoeken kreeg. Van de verzoeken die wél binnenkwamen, kwam 19,5 % van bij naam bekende AI-tools. Ahrefs waarschuwt er ook voor dat een ophaalactie niet bewijst dat het bestand daadwerkelijk is gebruikt.
Mijn lezing van die cijfers is dat llms.txt een gok is op een conventie die de systemen waarvoor ze is bedacht niet breed hebben overgenomen. Publiceer haar als u van opgeruimde roots houdt. Maar bouw er geen generatiepijplijn omheen, laat haar geen blokkerende stap in uw deploy worden, en beschouw iedereen die haar als ranking- of citatiehefboom verkoopt als een flink eind vooruit op het bewijs.
Kernpunt: in het Ahrefs-onderzoek kreeg 97 % van de gepubliceerde llms.txt-bestanden in mei 2026 helemaal geen verzoeken.
Uw pagina's machineleesbaar maken
De crawlermeting van Vercel stelde vast dat de crawlers van OpenAI, ClaudeBot, PerplexityBot, Meta-ExternalAgent, Bytespider en CCBot geen JavaScript uitvoeren. Gemini via Googlebot en AppleBot doen dat wel. Voor de niet-renderende crawlers is content die pas na client-side hydratie verschijnt onzichtbaar, dus render alles wat kritiek is op de server. Markup is de makkelijkere vraag, en Googles eigen advies daarover is ongewoon direct:
"U hoeft geen nieuwe machineleesbare bestanden, AI-tekstbestanden of markup te maken om in deze functies te verschijnen. Er zijn ook geen speciale gestructureerde schema.org-gegevens die u moet toevoegen."
De 40 % zichtbaarheidswinst die soms wordt aangehaald ter ondersteuning van FAQ-schema komt uit het GEO-paper , geaccepteerd voor KDD 2024. Het paper meldt winsten tot 40 %, maar de geteste ingrepen draaien om inhoudelijke wijzigingen zoals bronvermeldingen, citaten, statistieken, vakterminologie en vlotte formuleringen, niet om FAQPage of enige andere Schema.org-markup. Het getal klopt; de koppeling ervan aan schema-markup niet.
Houd gestructureerde data waar die een klassieke Search-functie ondersteunt en overeenkomt met de zichtbare pagina. Google zegt dat aanmerking komen voor zijn AI-functies via gewone zoekindexering loopt, zonder aparte markup-eis. Het is alleen niet aangetoond dat het AI-citaties beweegt.
Als robots.txt niet genoeg is: rate limiting en WAF op de server
Directieven werken bij de bots die zich eraan houden. In dezelfde Hacker News-draadbeschreven meerdere beheerders het verkeer dat dat niet doet: crawlers die hun verzoeken spreiden over enorme pools van IP-blokken en user agents rouleren om op gewone bezoekers te lijken, wat zowel naïeve limieten per IP als user-agentmatching onderuithaalt. Behandel dat als berichten uit de gemeenschap; niemand in de draad publiceerde metingen. Maar het beschrijft precies de groep die robots.txt nooit had moeten bereiken.
Voordat u die ladder beklimt, is er een goedkopere zet voor verkeer dat nog meewerkt. Vertraag het:
User-agent: ClaudeBot
Crawl-delay: 1
Pro-tip: eerst afknijpen, dan pas blokkeren. De documentatie van Anthropic ondersteunt Crawl-delay voor ClaudeBot , zodat u een zware maar welopgevoede crawler kunt afremmen en toch behouden. Diezelfde pagina zegt dat IP-blokkering geen duurzaam opt-outmechanisme is. Beide punten zijn specifiek voor Anthropic; Crawl-delay is geen universele directive, dus raadpleeg eerst de documentatie van elke aanbieder.
Alles daarna is handhaving die u zelf draait, in drie sporten met oplopende kosten en effectiviteit. Elke sport koopt iets en levert iets in.
Sport 1: reverse-proxydirectieven en rate limiting
Rate limiting voor AI-crawlers begint bij de reverse proxy, het eerste in uw stack dat een verzoek ziet en het kan afremmen voordat de applicatie of database ook maar iets doet. De rate-limitdocumentatie van NGINX stelt dat verzoeken met een lege sleutel niet worden geteld, dus een map kan alleen aan de crawlertokens die u wilt afknijpen een rate-limitsleutel geven en laat niet-overeenkomende verzoeken buiten limit_req_zone.
# /etc/nginx/nginx.conf, inside the http block
map $http_user_agent $ai_rate_key {
default "";
~*GPTBot $binary_remote_addr;
~*OAI-SearchBot $binary_remote_addr;
~*ClaudeBot $binary_remote_addr;
~*Claude-SearchBot $binary_remote_addr;
~*PerplexityBot $binary_remote_addr;
~*CCBot $binary_remote_addr;
}
limit_req_zone $ai_rate_key zone=ai_slowlane:10m rate=20r/m;
# /etc/nginx/sites-available/example.conf, inside the server block
location / {
limit_req zone=ai_slowlane burst=10 nodelay;
proxy_pass http://127.0.0.1:8080;
}
Het paar dat u moet afstellen is burst=10 nodelay: verzoeken boven de gemiddelde snelheid mogen de burst meteen opsouperen, en verzoeken daarbovenop krijgen standaard een 503 standaard. Stelt u het te strak in, dan bonjourt u een legitieme crawler midden in zijn ronde eruit, een probleem dat trager te diagnosticeren is dan een storing. Caddy drukt dezelfde twee ideeën uit met een matcher en een handler; twijfelt u tussen beide, dan zijn de configuratiebestanden naast elkaar nuttiger dan een synthetisch doorvoergetal.
De beperking van deze sport is dat de slowlane nog altijd afhangt van de opgegeven user agent. Een scraper in Chrome-vermomming omzeilt deze crawlerspecifieke sleutel volledig; dat verkeer vangen vraagt om een bredere rate limit op basis van IP-/padgedrag, of om de WAF-sport hieronder.
Sport 2: een web application firewall die u zelf draait
Een WAF verplaatst de beslissing van één header naar een regelset die verzoekpatronen, paden en snelheden samen leest, en dat is precies wat u nodig hebt zodra het verkeer zich niet meer aankondigt. Er een op uw eigen machine draaien houdt de regels en de logs op uw eigen schijf, waar u ze om drie uur 's nachts kunt greppen. BunkerWeb is zo'n project, SafeLine is een ander, en beide draaien op een VPS zolang de host voldoet aan de architectuur- en resource-eisen van het project; wij leveren van allebei een-kliksversies om u de installatie te besparen, al is de verpakking niet het interessante deel.
Dat is meteen ook de prijs van deze sport. Regels vragen onderhoud, en een regel die strak genoeg staat om een vastberaden scraper te vangen, vangt uiteindelijk ook een mens. De Monitor-, Balanced- en Strict-modi van SafeLine maken die afweging expliciet: begin met het verkeer lang genoeg te observeren om vals-positieven te vinden, voordat u de WAF automatisch 403-antwoorden laat teruggeven.
Sport 3: proof-of-work-challenges
Anubis slaat het identificatieprobleem helemaal over. Voor verkeer dat u kiest te challengen, laat het het verzoek een kleine rekenkost betalen voordat de origin het bedient. Het policy-systeem kan verzoeken op basis van matchregels ook toestaan, weigeren of challengen. De README van het project noemt het een Web AI Firewall Utility, gebouwd rond challenges om upstreambronnen te beschermen tegen scraperbots. Het werkt zonder dat elke bot zich correct hoeft bekend te maken.
Het project zelf noemt de aanpak een nucleaire reactie, en dat voorbehoud is terecht. De heffing valt op al het verkeer dat uw policy challenget, en dat kunnen mensen op trage apparaten of legitieme crawlers zijn als de regels te breed staan. Houd deze sport in reserve voor echt vijandig verkeer. Een enthousiaste crawler is meestal een rate-limitprobleem, en die rate limit hebt u al.
Dimensioneren voor de piek
Crawlerbelasting komt vaak in pieken, maar of die CPU-, database- of I/O-zwaar is, hangt af van de applicatie en de gecrawlde URL's. In het WordPress-voorbeeld hierboven herleidde de beheerder het grootste deel van die seconde paginatijd tot MySQL, dus dat specifieke incident was een databaseknelpunt vermomd als verkeersprobleem.
Daarmee wordt dimensioneren een allocatievraag, en een ongemakkelijke: u betaalt doorlopend voor speling, en die verdient zichzelf pas terug tijdens een piek waar u geen zeggenschap over hebt. Reserveer toch voor die piek. Als BunkerWeb een host deelt met de applicatie en de database, beschouw 8 GB dan niet als aanbeveling voor de hele stack. De quickstartgids van BunkerWeb adviseert 2 vCPU's en 8 GB RAM voor tests of deployments met heel weinig services, en minstens 4 vCPU's met 16 GB RAM voor productieomgevingen die veel services beschermen. Tel daar de CPU-piek van de applicatie zelf, het databasegeheugen en I/O-speling bovenop.
Kernen met een hogere klok helpen wanneer requestafhandeling of queryuitvoering CPU-gebonden is; méér kernen helpen wanneer u meer gelijktijdig werk in de lucht moet houden. Dimensioneer op piekgelijktijdigheid, p95-responstijd, database-CPU en I/O-wachttijd, en cache-missratio, en niet alleen op crawlerverkeer.
Die laag zelf draaien vraagt twee dingen van de machine eronder: rootrechten, want elk mechanisme hierboven is een configuratiebestand dat u bewerkt en een service die u herstart, en genoeg speling zodat een piek de site niet neerhaalt terwijl de regels hun werk doen. Bent u daarvoor een machine aan het dimensioneren of verhuizen, dan geeft onze Linux VPS u de rootrechten die deze stack vereist en kunt u de proxy-en-WAF-opstelling testen voordat u zich vastlegt op een langetermijnformaat.
Bouw op een Linux VPS met root-toegang, NVMe en AMD EPYC-kracht.
Bekijk Linux-plannenDe nieuwe standaardinstellingen van Cloudflare voor AI-verkeer
Cloudflare heeft AI-verkeer opgesplitst in de categorieën Search, Agent en Training in zijn aankondiging over AI-verkeer van juli 2026. Vanaf 15 september 2026 krijgen nieuwe domeinen die bij Cloudflare instappen Training en Agent standaard geblokkeerd op pagina's met advertenties, terwijl Search toegestaan blijft. Bestaande klanten kunnen de instelling vooraf wijzigen, en de besturing is beschikbaar op alle abonnementen.
Wat u hiervan moet meenemen, is de complicatie die Cloudflare in zijn eigen aankondiging benoemt. In Cloudflares indeling combineren Googlebot, Applebot en Bingbot elk zoekwerk met trainingswerk, dus wie de categorie Training blokkeert, blokkeert ook die crawlers, inclusief het zoekgedrag dat hij juist wilde behouden. Dat is dezelfde val die op de loer ligt bij elke besturing op categorieniveau die een crawler met meerdere taken behandelt alsof hij er maar één had.
Staat uw site niet achter Cloudflare, dan is niets hiervan een hendel die u kunt overhalen. Weet wel dat het eraan komt, want in september zullen verkeerspatronen verschuiven; uw sturing blijven de robots.txt-tokens en de proxylaag hierboven.
WebMCP: het volgen waard, er nog niet op bouwen
WebMCP is de browserzijdige tegenhanger van het Model Context Protocol, de conventie waarmee agents gestructureerde tools aanroepen in plaats van te gokken. Chromes aankondiging van de WebMCP-origin trial verwoordt het doel rechtstreeks: in plaats van dat een agent gokt wat een knop of formulierveld doet, kan een site gestructureerde functies en geannoteerde besturingselementen aanbieden die de agent rechtstreeks kan aanroepen.
Het is de eerste geloofwaardige poging om agents op uw site iets anders te laten doen dan lezen, en daarmee het interessantste in dit artikel. Het is ook experimenteel en onaf: een origin trial in Chrome 149 die in juni 2026 openging. Volg de specificatie. Bouw er nog geen productieafhankelijkheid omheen en laat het uit uw capaciteitsplanning.
Veelgestelde vragen
Houdt robots.txt AI-bots tegen?
Gedeeltelijk, en de precisie ís het antwoord. Anthropic zegt dat ClaudeBot, Claude-User en Claude-SearchBot robots.txt respecteren. De automatische crawlers van OpenAI gebruiken het ook, maar OpenAI zegt dat de regels mogelijk niet gelden voor ChatGPT-User; Perplexity zegt dat Perplexity-User het bestand doorgaans negeert. Naamloze of vermomde scrapers vallen volledig buiten robots.txt.
Wat is het verschil tussen llms.txt en robots.txt?
Ze lossen verschillende problemen op. robots.txt vertelt coöperatieve crawlers wat ze mogen ophalen en is gestandaardiseerd door de IETF. llms.txt is een voorgesteld bestand dat taalmodellen een samengestelde samenvatting van uw content aanbiedt, zonder enige verplichting dat iets het ophaalt of gebruikt. In de meting van Ahrefs van mei 2026 kreeg 97 % van de gepubliceerde bestanden nul verzoeken. Wilt u crawlerdirectieven, dan is robots.txt het standaardmechanisme; llms.txt is optioneel en wordt momenteel nauwelijks gebruikt.
Hoe blokkeer ik GPTBot op mijn website?
Voeg deze twee regels toe aan het robots.txt-bestand in de root van uw site:
User-agent: GPTBot
Disallow: /
Daarmee onttrekt u uw site aan de automatische trainingscrawl van GPTBot. OAI-SearchBot, die voor ChatGPT-zoeken wordt gebruikt, en ChatGPT-User, die pagina's ophaalt bij gebruikersacties, zijn aparte tokens en blijven ongemoeid.
Blokkeert het blokkeren van AI-trainingscrawlers ook indexering in Google Zoeken?
Niet als u de juiste besturing gebruikt. Google-Extended blokkeren houdt Googlebot niet uit Zoeken. Het addertje verschijnt wanneer u een besturing op categorieniveau gebruikt die een crawler met meerdere taken als Training behandelt: Cloudflare bijvoorbeeld classificeert Googlebot, Applebot en Bingbot als combinatie van zoeken en training, dus daar de categorie Training blokkeren blokkeert ook die crawleridentiteiten.
Hoe weet ik of AI-bots mijn site crawlen?
Grep uw accesslog op de gedocumenteerde tokens en verifieer daarna wat u vindt:
grep -ohE 'GPTBot|ClaudeBot|CCBot|PerplexityBot|OAI-SearchBot|ChatGPT-User' \
/var/log/nginx/access.log | sort | uniq -c | sort -rn
De tellingen laten zien welke opgegeven useragents langskomen en hoe vaak. Omdat de string vervalst kan worden, verifieert u de zwaarste bezoekers tegen de door de leverancier gepubliceerde IP-reeksen of diens reverse-DNS-methode voordat u op de cijfers handelt.
Discussie
Reacties
Log in om mee te praten.