Naar inhoud springen
SilktideHelp

AI-crawlers blokkeren

Silktide test of verzoeken die zich identificeren als de belangrijkste AI-crawlers daadwerkelijk je website bereiken. Een site kan deze crawlers op papier verwelkomen, terwijl een firewall of beveiligingsproduct ze aan de deur tegenhoudt.

Je kan aangeven dat welkom zijn, terwijl je firewall ze weigert. - en beveiligingsproducten bieden schakelaars met één klik om "AI-bots te blokkeren" - sommige daarvan zijn standaard ingeschakeld - die elk verzoek weigeren dat zich identificeert als GPTBot, ClaudeBot, PerplexityBot of iets vergelijkbaars, ongeacht wat robots.txt verklaart. Site-eigenaren hebben vaak geen idee dat dit is ingeschakeld: voor jou werkt de site perfect, terwijl hij voor elke AI-assistent niet bestaat.

Waarom dit belangrijk is

AI-assistenten kunnen alleen inhoud citeren en aanbevelen die hun crawlers kunnen ophalen. Een blokkade op firew
allniveau is bij normaal gebruik onzichtbaar - je site laadt prima in elke browser en je Analytics zien er gezond uit - maar antwoordmachines kunnen je stilletjes niet lezen en citeren in plaats daarvan concurrenten. Omdat er niets zichtbaar fout gaat, is dit een van de moeilijkst te herkennen zichtbaarheidsproblemen zonder er rechtstreeks op te testen.

Silktide's afzonderlijke controle voor AI-crawler-toegang behandelt wat je robots.txt verklaart. Deze controle behandelt wat er daadwerkelijk over de verbinding gebeurt. De twee zijn het vaak niet met elkaar eens, en wanneer dat gebeurt, wint de firewall.

Zo los je het op

  1. Controleer je CDN- of beveiligingsdashboard op het blokkeren van AI-bots. Kijk in Cloudflare onder Security naar "AI bots" of "Bot Fight Mode"; andere providers, zoals Akamai, Imperva en DataDome, hebben vergelijkbare schakelaars. Deze zijn soms standaard ingeschakeld.
  2. Als de blokkade niet opzettelijk is, schakel de optie dan uit of voeg de specifieke crawlers die je wilt toestaan toe aan je allowlist.
  3. Als je eigen firewall- of serverregels hebt die bot-user-agents herkennen, verwijder dan de vermeldingen van de AI-crawlers die je wilt toelaten.
  4. Als je AI-crawlers bewust blokkeert, de bevinding dan goed - het is een legitieme keuze.

Zo test Silktide dit

  1. Vraag je homepage op met een normale browseridentiteit. Als dat verzoek zelf wordt geweigerd of aan een controle wordt onderworpen, is de controle niet van toepassing - niets kan dan worden toegeschreven aan discriminatie van crawlers.
  2. Vraag de homepage opnieuw op en identificeer je daarbij als elke belangrijke AI-crawler (GPTBot, ClaudeBot, PerplexityBot en CCBot), met de User-Agent-tekenreeksen die hun beheerders publiceren. Alle verzoeken komen vanaf dezelfde locatie, dus elk verschil in de respons wordt veroorzaakt door de crawleridentiteit.
  3. We tellen een crawler als geblokkeerd wanneer het verzoek een expliciete weigeringsstatus ontvangt (bijvoorbeeld 403 Forbidden, 429 Too Many Requests of 503), een controle- of -pagina die een crawler niet kan oplossen, of helemaal geen respons terwijl het browserverzoek wel slaagde.
  4. We waarschuwen wanneer een crawler wordt tegengehouden en vermelden welke crawler(s) dat zijn.

Alle verzoeken zijn uitsluitend gericht op de homepage en worden één keer per test uitgevoerd.

Problemen oplossen

We verifiëren crawlers via hun netwerk, niet alleen via hun naam

Sommige sites laten alleen verzoeken toe die afkomstig zijn van geverifieerde netwerkadressen van een crawlerbeheerder. De probe van Silktide verstuurt de gepubliceerde identiteit van de crawler vanaf het eigen netwerk, waardoor zo'n site de probe kan weigeren terwijl de echte crawler wel wordt toegelaten. Deze configuratie komt veel minder vaak voor dan algemene blokkering op basis van identiteit; als je hebt bevestigd dat je deze gebruikt, keur de bevinding dan goed.

De controle slaagt, maar assistenten missen mijn inhoud nog steeds

Binnenkomen is noodzakelijk, maar niet voldoende. Controleer of je robots.txt AI-crawlers toestaat (AI-crawler-toegang) en of je inhoud niet vereist dat wordt uitgevoerd om zichtbaar te worden (Inhoud zonder JavaScript).

Meer informatie

Laatst bijgewerkt

Was deze pagina nuttig?