Toegang voor AI-crawlers
AI-assistenten zoals ChatGPT, Claude en Perplexity lezen het web met hun eigen automatische crawlers. Silktide controleert of je website die crawlers vertelt dat ze weg moeten blijven. Meestal betekent dit dat AI-assistenten je content niet kunnen lezen, citeren of aanbevelen.
Websites regelen de toegang voor crawlers via een -bestand. Eén regel in dat bestand kan elk belangrijk AI-systeem buitensluiten:
# Blokkeert de crawler van OpenAI voor de hele site
User-agent: GPTBot
Disallow: /
Het blokkeren van kan een bewuste keuze zijn, bijvoorbeeld om je af te melden voor het trainen van modellen. Omdat dit soms opzettelijk gebeurt, rapporteert Silktide dit als een waarschuwing die je kunt goedkeuren, en niet als een bevestigde fout.
Waarom dit belangrijk is
Een groeiend deel van de mensen stelt een vraag aan een AI-assistent in plaats van aan een zoekmachine. Die assistenten kunnen alleen websites beschrijven, citeren en ernaar linken als hun crawlers deze mogen lezen. Als je site hen blokkeert, vullen de content van concurrenten de antwoorden in plaats daarvan, en verlies je bezoekers zonder ooit een foutmelding te zien.
Veel robots.txt-bestanden blokkeren AI-crawlers per ongeluk: de regels zijn gekopieerd uit een sjabloon of een handleiding voor het beveiligen van systemen, en niemand realiseerde zich wat ermee werd uitgesloten. Deze controle maakt dat zichtbaar, zodat de blokkade een beslissing is en geen vergissing.
Hoe je dit oplost
- Open het robots.txt-bestand van je site (op
https://yoursite.com/robots.txt) en zoek de regels waarin de geblokkeerde crawlers worden genoemd, of een regelUser-agent: *metDisallow: /die alles blokkeert. - Als de blokkade niet opzettelijk is, verwijder je die regels of beperk je ze tot de paden die je echt privé wilt houden. Publiceer het bestand daarna opnieuw:
# Voorheen: blokkeert de hele site
User-agent: GPTBot
Disallow: /
# Daarna: staat de site toe, houdt één gebied privé
User-agent: GPTBot
Disallow: /internal/
- Als de blokkade opzettelijk is — bijvoorbeeld omdat je niet wilt dat je
content wordt gebruikt voor het trainen van AI — . Let op: sommige crawlers leveren data voor
training en andere voor live antwoorden. Je kunt daarom ook selectief
blokkeren: door
OAI-SearchBottoe te staan enGPTBotte blokkeren, blijf je zichtbaar in de zoekfunctie van ChatGPT zonder bij te dragen aan training.
Hoe Silktide dit test
- Haal het robots.txt-bestand op vanaf de hoofdmap van je website.
- Als het bestand niet bestaat of niet kan worden opgehaald, slaagt de controle: zonder robots.txt wordt geen enkele crawler geblokkeerd.
- Parseer de regels en test elk gebruikersagent-item uit een lijst van ongeveer 20 bekende AI-crawlers (waaronder GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended, Applebot-Extended en CCBot) tegen de hoofdmap van je site.
- Geef een waarschuwing wanneer één of meer van deze crawlers geen toegang hebben tot de hoofdmap, en vermeld welke crawlers zijn geblokkeerd.
Problemen oplossen
De controle slaagt, maar AI-assistenten kunnen mijn site nog steeds niet lezen
Deze controle leest alleen je robots.txt-regels. Een crawler die op papier is toegestaan, kan in de praktijk nog steeds worden geblokkeerd door een firewall of botbeveiliging — zie AI-crawlers die in de praktijk worden geblokkeerd. Content die pas verschijnt nadat is uitgevoerd, kan ook onzichtbaar zijn voor AI-crawlers — zie Content die zonder JavaScript beschikbaar is.
Ik blokkeer AI-crawlers bewust
Dat is een legitieme keuze. Keur de bevinding goed, dan telt deze niet mee voor je site. Overweeg of je alle AI-crawlers wilt blokkeren of alleen de crawlers die worden gebruikt voor het trainen van modellen.
Meer informatie
- Beleid voor toegang van AI-crawlers - bots voor training, zoeken en ophalen door gebruikers, plus voorbeelden van robots.txt-patronen
- Content die zonder JavaScript leesbaar is - wanneer de crawler wel toegang heeft, maar je content nog steeds niet kan zien
- llms.txt - optionele samengestelde index voor AI-tools (geen vervanging voor het toestaan van crawlers)
- AI-crawlers die in de praktijk worden geblokkeerd
- Content die zonder JavaScript beschikbaar is
- Documentatie over crawlers van OpenAI
- Documentatie over Google-Extended
- Specificatie voor robots.txt (RFC 9309)