AI-crawleråtkomst
AI-assistenter som ChatGPT, Claude och Perplexity läser webben med hjälp av sina egna automatiserade crawlers. Silktide kontrollerar om din webbplats säger åt dessa crawlers att hålla sig borta, vilket vanligtvis innebär att AI-assistenter inte kan läsa, citera eller rekommendera ditt innehåll.
Webbplatser styr åtkomsten för crawlers via en -fil. En enda regel i den filen kan stänga ute alla större AI-system:
# Blockerar OpenAI:s crawler från hela webbplatsen
User-agent: GPTBot
Disallow: /
Att blockera kan vara ett medvetet val, till exempel för att välja bort modellträning. Eftersom det ibland är avsiktligt rapporterar Silktide detta som en varning som du kan godkänna, snarare än som ett bekräftat fel.
Varför detta är viktigt
En växande andel människor frågar en AI-assistent i stället för att använda en sökmotor. Dessa assistenter kan bara beskriva, citera och länka till webbplatser som deras crawlers får läsa. Om din webbplats blockerar dem fyller konkurrenternas innehåll i stället svaren, och du förlorar besökare utan att någonsin se ett fel.
Många robots.txt-filer blockerar AI-crawlers av misstag: reglerna kopierades från en mall eller en guide för säkerhetshärdning, och ingen insåg vad de uteslöt. Den här kontrollen synliggör detta så att blockeringen är ett beslut, inte ett förbiseende.
Så åtgärdar du problemet
- Öppna webbplatsens robots.txt-fil (på
https://yoursite.com/robots.txt) och leta efter regler som anger de blockerade crawlers, eller enUser-agent: *-regel medDisallow: /som blockerar allt. - Om blockeringen är oavsiktlig tar du bort reglerna eller begränsar dem till de sökvägar som du faktiskt vill hålla privata och publicerar sedan filen igen:
# Före: blockerar hela webbplatsen
User-agent: GPTBot
Disallow: /
# Efter: tillåter webbplatsen men håller ett område privat
User-agent: GPTBot
Disallow: /internal/
- Om blockeringen är avsiktlig – till exempel om du inte vill att ditt innehåll används
för AI-träning – du resultatet. Observera
att vissa crawlers bidrar till träning medan andra bidrar till direkta svar,
så du kan också blockera selektivt: om du tillåter
OAI-SearchBotmen blockerarGPTBotförblir du synlig i ChatGPT-sökningar utan att bidra till träning.
Så testar Silktide detta
- Hämtar robots.txt-filen från webbplatsens rot.
- Om filen inte finns eller inte kan hämtas godkänns kontrollen: utan robots.txt blockeras ingen crawler.
- Tolkar reglerna och testar var och en av en lista med omkring 20 välkända AI-crawler- user agents (inklusive GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended, Applebot-Extended och CCBot) mot webbplatsens rot.
- Visar en varning när en eller flera av dessa crawlers blockeras från roten och listar de blockerade crawlers.
Felsökning
Kontrollen godkänns men AI-assistenter kan fortfarande inte läsa min webbplats
Den här kontrollen läser endast reglerna i robots.txt. En crawler som tillåts på papperet kan fortfarande blockeras i praktiken av en brandvägg eller ett botskydd – se AI-crawlers som blockeras i praktiken. Innehåll som bara visas efter att har körts kan också vara osynligt för AI-crawlers – se Innehåll tillgängligt utan JavaScript.
Jag blockerar AI-crawlers med avsikt
Det är ett legitimt val. Godkänn resultatet så räknas det inte mot din webbplats. Överväg om du vill blockera alla AI-crawlers eller bara de som används för modellträning.
Läs mer
- Policy för AI-crawleråtkomst – träning kontra sökning kontra bots som hämtar på användares begäran, samt exempel på robots.txt-mönster
- Innehåll som kan läsas utan JavaScript – när crawlern tillåts komma in men ändå inte kan se ditt innehåll
- llms.txt – valfritt kurerat index för AI-verktyg (ersätter inte att tillåta crawlers)
- AI-crawlers som blockeras i praktiken
- Innehåll tillgängligt utan JavaScript
- OpenAI:s dokumentation om crawlers
- Dokumentation om Google-Extended
- robots.txt-specifikation (RFC 9309)