Tilgangspolicy for AI-crawlere
En tilgangspolicy for AI-crawlere er en bevisst konfigurasjon av (og noen ganger en brannmur) som angir hvilke AI-systemer som kan hente de offentlige sidene dine – og til hvilket formål. Den er situasjonsavhengig fordi det riktige svaret avhenger av om du først og fremst ønsker å bli sitert i svar fra assistenter, holde innholdet ute av modelltrening, eller begge deler. Det som ikke er situasjonsavhengig, er å behandle en innlimt mal for «blokker all AI» som om den var et nøytralt sikkerhetstiltak. Dette valget får markedsføringsmessige konsekvenser.
På denne siden antar vi at Fernwood ønsker å dukke opp i svar fra ChatGPT og Claude om kostnadsstyring, men at juridisk avdeling helst ikke vil bidra med nye sider til treningskorpora for grunnmodeller.
Denne teknikken handler om tilgang. Når en crawler først er sluppet inn, må den fortsatt motta ekte HTML – se Innhold som kan leses uten JavaScript – og et valgfritt, kuratert kart dekkes separat i llms.txt.
Hvorfor dette er situasjonsavhengig
AI-produkter bruker ikke lenger én enkelt «AI-bot». Store leverandører deler crawlerne etter oppgave:
| Oppgave | Typiske boter | Hva blokkering gjør |
|---|---|---|
| Modelltrening | OpenAI GPTBot, Anthropic ClaudeBot, Common Crawl CCBot, Google Google-Extended (kontroll over Gemini-trening/forankring – ikke Googlebot) | Signaliserer at innholdet ikke skal brukes til trening (eller, for Google-Extended, til å trene Gemini eller drive bestemte AI-funksjoner). Fjerner deg ikke fra det klassiske Google-søket i seg selv. |
| Søke-/svarindeksering | OpenAI OAI-SearchBot, Anthropic Claude-SearchBot, PerplexityBot | Reduserer eller fjerner muligheten for å bli vist og sitert i produktets søkelignende svar. |
| Brukerutløst henting | OpenAI ChatGPT-User, Anthropic Claude-User, lignende agenter av typen «brukeren ba om denne URL-en» | Styrer direkte henting når en person peker assistenten til en side. Leverandørenes regler varierer med hensyn til om robots.txt respekteres for disse agentene – sjekk leverandørens gjeldende dokumentasjon før du antar at en Disallow fungerer. |
OpenAIs egen dokumentasjon for crawlere tydeliggjør uavhengigheten: En nettstedseier kan tillate OAI-SearchBot å vises i ChatGPTs søkefunksjoner, samtidig som GPTBot forbys slik at innhold som crawles, ikke brukes til å trene generative grunnmodeller. Anthropic dokumenterer det samme tredelte skillet for ClaudeBot (trening), Claude-SearchBot (sø kvalitets) og Claude-User (brukerstyrt henting).
Policyspørsmålet er derfor ikke «AI: på eller av?». Det er tre separate beslutninger som bør samsvare med Fernwoods risikotoleranse og AEO-mål.
Tillat vanligvis søke-/svarcrawlere når:
- Du ønsker at assistenter skal sitere Fernwoods dokumentasjon, forskning og sammenligningssider.
- Konkurrenter allerede dukker opp i disse svarene, mens du ikke gjør det.
- Silktides tilgangskontroll for AI-crawlere varsler fordi en mal blokkerte alt ved et uhell.
Blokker eller begrens ofte treningscrawlere når:
- Juridiske eller merkevarerelaterte retningslinjer forbyr at nettstedinnhold bidrar til trening av tredjepartsmodeller.
- Du publiserer egen forskning, prislogikk eller materiale i nærheten av innlogget innhold som må holdes ute av treningskorpora, selv om du fortsatt ønsker direkte sitater.
Blokker bredt når:
- Nettstedet ikke er offentlig, er et staging-nettsted eller ikke har noen markedsføringsmessig grunn til å dukke opp i svar fra assistenter (intranett, rent appgrensesnitt, partnerportal).
- Du bevisst har besluttet at du vil holde deg helt utenfor AI-svar – og er villig til å miste denne kanalen.
Slik tar du beslutningen (Fernwoods arbeidsark)
Gå gjennom disse punktene i rekkefølge. Skriv ned svarene; robots.txt-filen er bare kodingen av arbeidsarket.
- Ønsker vi i det hele tatt å bli sitert i AI-svar? Hvis nei, forby de viktigste søke-/svarbotene og godkjenn Silktides varsel. Hvis ja, fortsett.
- Hvilke assistenter er viktige? ChatGPT, Claude, Perplexity, Googles AI-funksjoner og andre har hver sine agenter. Prioriter dem kjøperne dine faktisk bruker.
- Er det nødvendig å reservere seg mot trening? Hvis juridisk avdeling sier ja, forbys treningsagenter (
GPTBot,ClaudeBot,Google-Extended,CCBotog tilsvarende), samtidig som søkeagenter fortsatt tillates der leverandøren støtter skillet. - Finnes det stier som må holdes private uansett?
\/app\/,\/internal\/, forhåndsvisnings-URL-er for utkast – forbys for*(og bekreft at autentisering fortsatt beskytter dem; robots.txt er ikke tilgangskontroll). - Kan HTML-en faktisk hentes? En tillatende robots.txt med et tomt SPA-skall mislykkes fortsatt med AEO – rett opp gjengivelsen som neste steg.
Implementering av policyen i robots.txt
Robots.txt ligger på https:\/\/fernwood.example\/robots.txt. Reglene gjelder per brukeragentgruppe. Mer spesifikke grupper overstyrer standardgruppen for den aktuelle agenten. Foretrekk navngitte agenter fremfor å håpe at User-agent: * uttrykker AI-policyen din – maler som setter Disallow: \/ under *, gjør også Googlebot og alle andre mindre effektive.
Mønster A – Synlig i svar, ute av trening (vanlig for AEO-orienterte nettsteder)
# OpenAI: bli sitert i ChatGPT-søk, ikke bruk til trening av grunnmodeller
User-agent: OAI-SearchBot
Allow: \/
User-agent: GPTBot
Disallow: \/
# Anthropic: tillat søkeindeksering, blokker treningscrawl
User-agent: Claude-SearchBot
Allow: \/
User-agent: ClaudeBot
Disallow: \/
# Google: Googlebot (søk) er separat; Google-Extended styrer Gemini-trening\/AI-funksjoner
User-agent: Google-Extended
Disallow: \/
# Hold private appstier stengt for alle
User-agent: *
Disallow: \/app\/
Disallow: \/internal\/
OpenAI opplyser at endringer i robots.txt for søk kan ta omtrent 24 timer før de trer i kraft. Kontroller på nytt etter publisering.
Mønster B – Helt åpent (maksimal rekkevidde i svarmotorer)
Utelat AI-spesifikke Disallow-regler. Sørg for at ingenting under User-agent: * ved et uhell forbyr hele nettstedet. Beskytt fortsatt private stier.
Mønster C – Helt stengt for AI-produkter
User-agent: GPTBot
Disallow: \/
User-agent: OAI-SearchBot
Disallow: \/
User-agent: ClaudeBot
Disallow: \/
User-agent: Claude-SearchBot
Disallow: \/
User-agent: Claude-User
Disallow: \/
User-agent: PerplexityBot
Disallow: \/
User-agent: Google-Extended
Disallow: \/
User-agent: CCBot
Disallow: \/
Bruk dette bare som et bevisst valg. deretter Silktides AI-crawler-varsel, slik at funnet slutter å telle mot nettstedet.
Bekreft hvem som faktisk besøker deg
User-Agent-strenger er enkle å forfalske. Foretrekk IP-lister publisert av leverandørene når du trenger sikkerhet:
- OpenAI publiserer JSON med crawler-IP-er (lenket fra OpenAIs botdokumentasjon).
- Anthropic publiserer crawler-IP-er på claude.com/crawling/bots.json.
Blokkering kun basert på IP, uten et robots.txt-signal, er sårbart – Anthropic påpeker at IP-blokkering kan forstyrre botens evne til å lese robots.txt og gjennomføre en reservasjon på riktig måte.
Hva robots.txt ikke løser
- Falske positiver fra brannmur/botadministrasjon. En webapplikasjonsbrannmur (WAF) – filtreringslaget som tjenester som Cloudflare plasserer foran et nettsted – kan utfordre eller returnere 403 for klienter som «ikke er nettlesere», og dermed blokkere GPTBot selv når robots.txt tillater den. Silktide tester dette separat som AI-crawlere blokkert i praksis.
- Tomme JavaScript-skall. Det hjelper ingen å slippe crawleren inn i en
<div id="root"></div>. Kombiner denne teknikken med Innhold som kan leses uten JavaScript. - Et magisk rangeringsløft. Å tillate crawlere gjør sitering mulig. Sider som kan siteres, datoer, identitet og dokumentasjon avgjør fortsatt om du blir valgt – se Svarorientert sidestruktur og Markup for organisasjonsidentitet.
llms.txtsom erstatning. En indeksfil kan ikke overstyre enDisallow. Se llms.txt.
Slik hjelper Silktide
- Tilgangskontroll for AI-crawlere analyserer robots.txt mot en liste over kjente AI-brukeragenter og varsler når nettstedroten er forbudt – et varsel du kan godkjenne når blokkeringen er tilsiktet.
- AI-crawlere blokkert i praksis henter som disse crawlerne for å oppdage brannmur- og kantblokker som robots.txt ikke kan forklare.
- Innhold uten JavaScript oppdager feilen «tillatt, men tomt».
Relatert
- Tilgangskontroll for AI-crawlere – Silktide-kontrollen som denne teknikken utdyper
- Innhold som kan leses uten JavaScript
- llms.txt – valgfri, kuratert indeks etter at tilgangen er løst
- OpenAIs dokumentasjon for crawlere
- Anthropics dokumentasjon for crawlere
- Oversikt over Google-crawlere (inkludert Google-Extended)
- Spesifikasjon for robots.txt (RFC 9309)