Toegangsbeleid voor AI-crawlers
Een toegangsbeleid voor AI-crawlers is een bewuste configuratie van (en soms een firewall) die bepaalt welke AI-systemen je openbare pagina's mogen ophalen en met welk doel. Dit is situationeel, omdat het "juiste" antwoord afhangt van de vraag of je vooral wilt worden geciteerd in antwoorden van assistenten, inhoud buiten modeltraining wilt houden, of beide. Wat niet situationeel is, is een geplakt sjabloon met "alle AI blokkeren" behandelen alsof het een neutrale beveiligingsmaatregel is. Die keuze heeft gevolgen voor je marketing.
Stel op deze pagina dat Fernwood wil verschijnen in antwoorden van ChatGPT en Claude over onkostenbeheer, maar dat het juridische team liever geen nieuwe pagina's bijdraagt aan trainingscorpora voor basismodellen.
Deze techniek gaat over toegang. Zodra een crawler is toegelaten, moet deze nog steeds echte HTML ontvangen. Zie Content leesbaar zonder JavaScript. Een optionele samengestelde kaart wordt afzonderlijk behandeld in llms.txt.
Waarom dit situationeel is
AI-producten gebruiken niet langer één enkele "AI-bot". Grote leveranciers splitsen crawlers op basis van hun taak:
| Taak | Typische bots | Wat blokkeren doet |
|---|---|---|
| Modeltraining | OpenAI GPTBot, Anthropic ClaudeBot, Common Crawl CCBot, Google Google-Extended (controle over Gemini-training / grounding; niet Googlebot) | Geeft aan dat inhoud niet mag worden gebruikt voor training (of, voor Google-Extended, voor Gemini-training / bepaalde AI-functies). Verwijdert je op zichzelf niet uit de klassieke Google Zoeken. |
| Zoek- / antwoordindexering | OpenAI OAI-SearchBot, Anthropic Claude-SearchBot, PerplexityBot | Verkleint of verwijdert de kans dat je wordt weergegeven en geciteerd in zoekachtige antwoorden van dat product. |
| Door gebruiker geactiveerd ophalen | OpenAI ChatGPT-User, Anthropic Claude-User, vergelijkbare agents voor "de gebruiker vroeg om deze URL" | Regelt live ophalen wanneer iemand de assistent naar een pagina verwijst. Regels van leveranciers verschillen wat betreft het respecteren van robots.txt door deze agents. Controleer de actuele documentatie van de leverancier voordat je ervan uitgaat dat een Disallow werkt. |
De eigen crawlerdocumentatie van OpenAI vermeldt deze onafhankelijkheid expliciet: een webmaster kan OAI-SearchBot toestaan om in zoekfuncties van ChatGPT te verschijnen, terwijl GPTBot wordt geweerd zodat gecrawlde inhoud niet wordt gebruikt om generatieve basismodellen te trainen. Anthropic documenteert dezelfde driedeling voor ClaudeBot (training), Claude-SearchBot (zoekkwaliteit) en Claude-User (ophalen op verzoek van de gebruiker).
De beleidsvraag is dus niet "AI: aan of uit?" Het zijn drie afzonderlijke beslissingen die moeten aansluiten bij de risicotolerantie en AEO-doelen van Fernwood.
Sta zoek- en antwoordcrawlers meestal toe wanneer:
- Je wilt dat assistenten de documentatie, onderzoeken en vergelijkingspagina's van Fernwood citeren.
- Concurrenten al in die antwoorden verschijnen en jij niet.
- Silktide's AI-crawler-toegang-controle waarschuwt omdat een sjabloon per ongeluk alles heeft geblokkeerd.
Blokkeer of beperk trainingscrawlers vaak wanneer:
- Juridische of merkregels verbieden dat site-inhoud bijdraagt aan training van modellen door derden.
- Je eigen onderzoek, prijslogica of afgeschermd materiaal publiceert dat buiten trainingscorpora moet blijven, ook als je nog steeds live citaten wilt.
Blokkeer breed wanneer:
- De site niet openbaar is, zich in een testomgeving bevindt of geen marketingreden heeft om in antwoorden van assistenten te verschijnen (intranet, uitsluitend app-interface, partnerportaal).
- Je bewust hebt besloten volledig buiten AI-antwoorden te blijven en bereid bent dat kanaal te verliezen.
Hoe je beslist (het werkblad van Fernwood)
Doorloop deze punten in volgorde. Noteer de antwoorden; het robots.txt-bestand is slechts de codering van het werkblad.
- Willen we überhaupt in AI-antwoorden worden geciteerd? Zo nee, weiger de belangrijkste zoek- en antwoordbots en keur de waarschuwing van Silktide goed. Zo ja, ga verder.
- Welke assistenten zijn belangrijk? ChatGPT, Claude, Perplexity, AI-functies van Google en andere hebben elk hun eigen agents. Geef prioriteit aan de assistenten die je kopers daadwerkelijk gebruiken.
- Is een opt-out voor training vereist? Als de juridische afdeling ja zegt, weiger trainingsagents (
GPTBot,ClaudeBot,Google-Extended,CCBoten vergelijkbare agents), terwijl je zoekagents toestaat waar de leverancier deze scheiding ondersteunt. - Zijn er paden die hoe dan ook privé moeten blijven?
/app/,/internal/, URL's voor conceptvoorbeelden: weiger deze voor*(en bevestig dat authenticatie ze nog steeds beschermt; robots.txt is geen toegangscontrole). - Kan de HTML daadwerkelijk worden opgehaald? Een ruimhartige robots.txt met alleen een lege SPA-shell voldoet nog steeds niet aan AEO. Los het renderen daarna op.
Het beleid implementeren in robots.txt
Robots.txt staat op https://fernwood.example/robots.txt. Regels gelden per user-agentgroep. Specifiekere groepen overschrijven de algemene groep voor die agent. Gebruik bij voorkeur benoemde agents in plaats van te hopen dat User-agent: * je AI-beleid uitdrukt. Sjablonen die onder * Disallow: / instellen, hinderen ook Googlebot en alle anderen.
Patroon A - Zichtbaar in antwoorden, buiten training (gebruikelijk voor AEO-gerichte sites)
# OpenAI: citeren in ChatGPT Search, niet gebruiken voor training van basismodellen
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
# Anthropic: zoekindexering toestaan; trainingscrawl blokkeren
User-agent: Claude-SearchBot
Allow: /
User-agent: ClaudeBot
Disallow: /
# Google: Googlebot (Search) staat los; Google-Extended regelt Gemini-training / AI-functies
User-agent: Google-Extended
Disallow: /
# Privépaden van apps voor iedereen gesloten houden
User-agent: *
Disallow: /app/
Disallow: /internal/
OpenAI merkt op dat wijzigingen in robots.txt voor zoeken ongeveer 24 uur nodig kunnen hebben voordat ze effect hebben. Controleer opnieuw na publicatie.
Patroon B - Volledig open (maximaal bereik in antwoordmachines)
Laat AI-specifieke Disallow-regels weg. Zorg dat niets onder User-agent: * per ongeluk de hele site blokkeert. Bescherm privépaden nog steeds.
Patroon C - Volledig gesloten voor AI-producten
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-SearchBot
Disallow: /
User-agent: Claude-User
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Gebruik dit alleen als bewuste keuze. daarna de AI-crawlerwaarschuwing van Silktide goed, zodat deze bevinding niet langer meetelt voor de site.
Controleer wie je daadwerkelijk bezoekt
User-Agent-strings zijn eenvoudig te vervalsen. Gebruik bij zekerheid liever door leveranciers gepubliceerde IP-lijsten:
- OpenAI publiceert crawler-IP-JSON (gelinkt vanuit de botdocumentatie van OpenAI).
- Anthropic publiceert crawler-IP's op claude.com/crawling/bots.json.
Alleen blokkeren op basis van IP, zonder een robots.txt-signaal, is kwetsbaar. Anthropic merkt op dat IP-blokkades het vermogen van de bot kunnen verstoren om je robots.txt te lezen en een opt-out correct uit te voeren.
Wat robots.txt niet oplost
- Fout-positieven door firewalls en botbeheer. Een webapplicatiefirewall (WAF) - de filterlaag die diensten zoals Cloudflare vóór een site plaatsen - kan "niet-browserclients" uitdagen of een 403-fout geven en zo GPTBot blokkeren, ook wanneer robots.txt dit toestaat. Silktide test dit afzonderlijk als AI-crawlers in de praktijk geblokkeerd.
- Lege JavaScript-shells. Een crawler toegang geven tot
<div id="root"></div>helpt niemand. Combineer deze techniek met Content leesbaar zonder JavaScript. - Een magische rankingboost. Door crawlers toe te staan wordt citeren mogelijk. Citeerbare pagina's, datums, identiteit en bewijs bepalen nog steeds of je wordt gekozen. Zie Antwoordgerichte paginastructuur en Opmaak van organisatie-identiteit.
llms.txtals vervanging. Een indexbestand kan eenDisallowniet overschrijven. Zie llms.txt.
Hoe Silktide helpt
- AI-crawler-toegang analyseert robots.txt aan de hand van een lijst met bekende AI-user-agents en waarschuwt wanneer de site-root wordt geweigerd. Je kunt deze waarschuwing goedkeuren wanneer de blokkade opzettelijk is.
- AI-crawlers in de praktijk geblokkeerd haalt pagina's op als deze crawlers om firewall- en edge-blokkades te detecteren die robots.txt niet kan verklaren.
- Content zonder JavaScript detecteert de foutmodus "toegestaan maar leeg".
Gerelateerd
- AI-crawler-toegang - de Silktide-controle waarop deze techniek voortbouwt
- Content leesbaar zonder JavaScript
- llms.txt - optionele samengestelde index nadat toegang is geregeld
- Crawldocumentatie van OpenAI
- Crawldocumentatie van Anthropic
- Overzicht van Google-crawlers (inclusief Google-Extended)
- Specificatie voor robots.txt (RFC 9309)