Adgangspolitik for AI-crawlere
En adgangspolitik for AI-crawlere er en bevidst konfiguration af (og nogle gange en firewall), der angiver, hvilke AI-systemer der må hente dine offentlige sider – og med hvilket formål. Den er situationsafhængig, fordi det "rigtige" svar afhænger af, om du lægger størst vægt på at blive citeret i AI-assistenters svar, på at holde indhold ude af modeltræning eller på begge dele. Det, der ikke er situationsafhængigt, er at behandle en indsat skabelon med "blokér al AI", som om den var et neutralt sikkerhedshærdningstrin. Det valg har markedsføringsmæssige konsekvenser.
På denne side antager vi, at Fernwood gerne vil optræde i ChatGPT- og Claude-svar om udgiftsstyring, men at virksomhedens juridiske team helst ikke vil bidrage med nye sider til træningskorpusser for grundmodeller.
Denne teknik handler om adgang. Når en crawler først er blevet lukket ind, skal den stadig modtage ægte HTML – se Indhold, der kan læses uden JavaScript – og et valgfrit kurateret kort behandles separat i llms.txt.
Hvorfor dette er situationsafhængigt
AI-produkter bruger ikke længere én enkelt "AI-bot". Større leverandører opdeler crawlere efter opgave:
| Opgave | Typiske bots | Hvad blokering medfører |
|---|---|---|
| Modeltræning | OpenAI GPTBot, Anthropic ClaudeBot, Common Crawl CCBot, Google Google-Extended (kontrol af Gemini-træning/grounding – ikke Googlebot) | Signalerer, at indholdet ikke bør bruges til træning (eller, for Google-Extended, til at træne Gemini eller drive bestemte AI-funktioner). Fjerner dig ikke i sig selv fra klassisk Google Search. |
| Søge-/svarindeksering | OpenAI OAI-SearchBot, Anthropic Claude-SearchBot, PerplexityBot | Reducerer eller fjerner muligheden for at blive vist og citeret i det pågældende produkts søgebaserede svar. |
| Brugerudløst hentning | OpenAI ChatGPT-User, Anthropic Claude-User, lignende AI-agenter af typen "brugeren bad om denne URL" | Styrer live-hentninger, når en person henviser AI-assistenten til en side. Leverandørernes regler varierer med hensyn til, om robots.txt respekteres for disse agenter – tjek leverandørens aktuelle dokumentation, før du antager, at en Disallow virker. |
OpenAIs egen dokumentation om crawlere fastslår uafhængigheden tydeligt: En webmaster kan tillade OAI-SearchBot at optræde i ChatGPTs søgefunktioner, samtidig med at GPTBot blokeres, så crawlet indhold ikke bruges til at træne generative grundmodeller. Anthropic dokumenterer den samme tredeling for ClaudeBot (træning), Claude-SearchBot (søgekvalitet) og Claude-User (brugerinitieret hentning).
Politikspørgsmålet er derfor ikke "AI: til eller fra?" Det er tre separate beslutninger, som bør passe til Fernwoods risikotolerance og AEO-mål.
Tillad som regel søge-/svarcrawlere, når:
- Du ønsker, at AI-assistenter citerer Fernwoods dokumentation, undersøgelser og sammenligningssider.
- Konkurrenter allerede optræder i disse svar, mens du ikke gør.
- Silktides Adgang for AI-crawlere-kontrol advarer, fordi en skabelon ved et uheld blokerede alt.
Blokér eller begræns ofte træningscrawlere, når:
- Juridisk afdeling eller brandpolitikken forbyder, at websiteindhold bidrager til tredjeparts modeltræning.
- Du udgiver proprietær forskning, prislogik eller materiale tæt på gated indhold, som skal holdes ude af træningskorpusser, selv om du stadig ønsker live-citationer.
Blokér bredt, når:
- Sitet ikke er offentligt, er et staging-site eller ikke har nogen markedsføringsmæssig grund til at optræde i AI-assistenters svar (intranet, ren appbrugerflade, partnerportal).
- Du bevidst har besluttet helt at holde dig ude af AI-svar – og er villig til at miste denne kanal.
Sådan træffer du beslutningen (Fernwoods arbejdsark)
Gå gennem disse punkter i rækkefølge. Skriv svarene ned; robots.txt-filen er blot arbejdsarkets kodning.
- Vil vi overhovedet citeres i AI-svar? Hvis nej, skal du afvise de vigtigste søge-/svarbots og acceptere Silktides advarsel. Hvis ja, fortsæt.
- Hvilke AI-assistenter er vigtige? ChatGPT, Claude, Perplexity, Googles AI-funktioner og andre har hver deres agenter. Prioritér dem, dine købere faktisk bruger.
- Er fravalg af træning påkrævet? Hvis juridisk afdeling siger ja, skal du afvise træningsagenter (
GPTBot,ClaudeBot,Google-Extended,CCBotog tilsvarende), samtidig med at søgeagenter tillades, hvor leverandøren understøtter opdelingen. - Er der stier, der under alle omstændigheder skal forblive private?
\/app\/,\/internal\/, URL'er til forhåndsvisning af kladder – afvis dem for*(og bekræft, at godkendelse stadig beskytter dem; robots.txt er ikke adgangskontrol). - Kan HTML'en faktisk hentes? En tilladende robots.txt med en tom SPA-skal fejler stadig AEO – ret gengivelsen som næste skridt.
Implementering af politikken i robots.txt
Robots.txt findes på https:\/\/fernwood.example\/robots.txt. Reglerne gælder pr. user-agent-gruppe. Mere specifikke grupper tilsidesætter catch-all-gruppen for den pågældende agent. Foretræk navngivne agenter frem for at håbe på, at User-agent: * udtrykker din AI-politik – skabeloner, der angiver Disallow: \/ under *, hæmmer også Googlebot og alle andre.
Mønster A – Synlig i svar, ude af træning (almindeligt for AEO-orienterede sites)
# OpenAI: citer i ChatGPT-søgning, brug ikke til træning af grundmodeller
User-agent: OAI-SearchBot
Allow: \/
User-agent: GPTBot
Disallow: \/
# Anthropic: tillad søgeindeksering; blokér træningscrawl
User-agent: Claude-SearchBot
Allow: \/
User-agent: ClaudeBot
Disallow: \/
# Google: Googlebot (Search) er separat; Google-Extended styrer Gemini-træning / AI-funktioner
User-agent: Google-Extended
Disallow: \/
# Hold private appstier lukkede for alle
User-agent: *
Disallow: \/app\/
Disallow: \/internal\/
OpenAI bemærker, at det kan tage omkring ~24 timer, før ændringer i robots.txt for søgning træder i kraft. Kontrollér igen efter publicering.
Mønster B – Helt åbent (maksimal rækkevidde i svarmotorer)
Udelad AI-specifikke Disallow-regler. Sørg for, at intet under User-agent: * ved et uheld blokerer hele sitet. Beskyt stadig private stier.
Mønster C – Helt lukket for AI-produkter
User-agent: GPTBot
Disallow: \/
User-agent: OAI-SearchBot
Disallow: \/
User-agent: ClaudeBot
Disallow: \/
User-agent: Claude-SearchBot
Disallow: \/
User-agent: Claude-User
Disallow: \/
User-agent: PerplexityBot
Disallow: \/
User-agent: Google-Extended
Disallow: \/
User-agent: CCBot
Disallow: \/
Brug kun dette som et bevidst valg. Derefter kan du Silktides AI-crawleradvarsel, så fundet ikke længere tæller negativt for sitet.
Kontrollér, hvem der faktisk besøger dig
User-Agent-strenge er nemme at forfalske. Foretræk leverandørpublicerede IP-lister, når du har brug for sikkerhed:
- OpenAI publicerer crawler-IP'er i JSON (linket fra OpenAIs botdokumentation).
- Anthropic publicerer crawler-IP'er på claude.com/crawling/bots.json.
Blokering udelukkende efter IP, uden et robots.txt-signal, er skrøbelig – Anthropic bemærker, at IP-blokeringer kan forstyrre bottens mulighed for at læse din robots.txt og gennemføre et fravalg korrekt.
Hvad robots.txt ikke løser
- Falske positiver fra firewall-/botstyring. En web application firewall (WAF) – filtreringslaget, som tjenester som Cloudflare placerer foran et site – kan udfordre eller returnere 403 til klienter, der ikke er "browsere", og dermed blokere GPTBot, selv når robots.txt tillader den. Silktide tester dette separat som AI-crawlere blokeret i praksis.
- Tomme JavaScript-skaller. Det hjælper ingen at tillade crawleren adgang til en
<div id="root"></div>. Kombinér denne teknik med Indhold, der kan læses uden JavaScript. - Et magisk rangeringsboost. Tilladelse af crawlere gør citation mulig. Sider, der kan citeres, datoer, identitet og dokumentation afgør stadig, om du bliver valgt – se Svar-først-sidestruktur og Markup for organisationsidentitet.
llms.txtsom erstatning. En indeksfil kan ikke tilsidesætte enDisallow. Se llms.txt.
Sådan hjælper Silktide
- Adgang for AI-crawlere analyserer robots.txt i forhold til en liste over kendte AI-user-agents og advarer, når sitets rod er afvist – som en advarsel, du kan acceptere, når blokeringen er tilsigtet.
- AI-crawlere blokeret i praksis henter som disse crawlere for at opdage firewall- og edge-blokeringer, som robots.txt ikke kan forklare.
- Indhold uden JavaScript opdager fejlen "tilladt, men tom".
Relateret
- Adgang for AI-crawlere – den Silktide-kontrol, som denne teknik udvider
- Indhold, der kan læses uden JavaScript
- llms.txt – valgfrit kurateret indeks, efter at adgang er løst
- OpenAIs dokumentation om crawlere
- Anthropics dokumentation om crawlere
- Oversigt over Googles crawlere (herunder Google-Extended)
- robots.txt-specifikationen (RFC 9309)