Hoppa till innehåll
SilktideHjälp

Policy för åtkomst för AI-crawlers

En policy för åtkomst för AI-crawlers är en medveten konfiguration av (och ibland en brandvägg) som anger vilka AI-system som får hämta dina offentliga sidor – och i vilket syfte. Den är situationsberoende eftersom det ”rätta” svaret beror på om du främst vill citeras i AI-assistenters svar, hålla innehåll borta från modellträning eller båda delarna. Det som inte är situationsberoende är att behandla en inklistrad mall för att ”blockera all AI” som om den vore ett neutralt säkerhetshärdningssteg. Det valet får marknadsföringskonsekvenser.

På hela den här sidan antar vi att Fernwood vill synas i ChatGPT- och Claude-svar om utgiftshantering, men att företagets juridiska team helst inte vill bidra med nya sidor till träningskorpusar för grundmodeller.

Den här tekniken handlar om åtkomst. När en crawler väl har släppts in måste den fortfarande få riktig HTML – se Innehåll som kan läsas utan JavaScript – och en valfri kurerad karta behandlas separat i llms.txt.

Varför detta är situationsberoende

AI-produkter använder inte längre en enda ”AI-bot”. Stora leverantörer delar upp crawlers efter uppgift:

UppgiftTypiska botarVad blockering gör
ModellträningOpenAI GPTBot, Anthropic ClaudeBot, Common Crawl CCBot, Google Google-Extended (kontroll av Gemini-träning/grounding – inte Googlebot)Signalerar att innehållet inte ska användas för träning (eller, för Google-Extended, för att träna Gemini eller driva vissa AI-funktioner). Tar inte i sig bort dig från klassisk Google Sök.
Sök-/svarsindexeringOpenAI OAI-SearchBot, Anthropic Claude-SearchBot, PerplexityBotMinskar eller tar bort möjligheten att visas och citeras i den produktens sökliknande svar.
Användarutlöst hämtningOpenAI ChatGPT-User, Anthropic Claude-User, liknande agenter där ”användaren bad om den här URL:en”Styr direkta hämtningar när en person hänvisar assistenten till en sida. Leverantörernas regler skiljer sig åt vad gäller om robots.txt följs för dessa agenter – kontrollera leverantörens aktuella dokumentation innan du antar att Disallow fungerar.

OpenAIs egen dokumentation om crawlers tydliggör oberoendet: en webbansvarig kan tillåta OAI-SearchBot att visas i ChatGPTs sökfunktioner samtidigt som GPTBot blockeras, så att hämtat innehåll inte används för att träna generativa grundmodeller. Anthropic beskriver samma tredelning för ClaudeBot (träning), Claude-SearchBot (sökkvalitet) och Claude-User (användarstyrd hämtning).

Policyfrågan är alltså inte ”AI: på eller av?”. Det är tre separata beslut som bör matcha Fernwoods risktolerans och AEO-mål.

Tillåt vanligtvis sök-/svarscrawlers när:

  • Du vill att AI-assistenter ska citera Fernwoods dokumentation, forskning och jämförelsesidor.
  • Konkurrenter redan syns i svaren och du inte gör det.
  • Silktides kontroll av AI-crawler-åtkomst varnar eftersom en mall av misstag blockerade allt.

Blockera eller begränsa ofta träningscrawlers när:

  • Juridiska krav eller varumärkespolicy förbjuder att webbplatsinnehåll bidrar till träning av modeller från tredje part.
  • Du publicerar egen forskning, prismodeller eller material nära innehåll som kräver åtkomst och som måste hållas borta från träningskorpusar även om du fortfarande vill kunna citeras i realtid.

Blockera brett när:

  • Webbplatsen inte är offentlig, är en stagingmiljö eller saknar marknadsföringsmässiga skäl att finnas i AI-assistenters svar (intranät, ren app-UI, partnerportal).
  • Du medvetet har beslutat att helt stå utanför AI-svar – och är beredd att förlora den kanalen.

Så fattar du beslutet (Fernwoods arbetsblad)

Gå igenom punkterna i ordning. Skriv ned svaren; robots.txt-filen är bara en kodifiering av arbetsbladet.

  1. Vill vi överhuvudtaget citeras i AI-svar? Om nej, neka de större sök-/svarsbotarna och godkänn Silktides varning. Om ja, fortsätt.
  2. Vilka assistenter är viktiga? ChatGPT, Claude, Perplexity, Googles AI-funktioner och andra har var och en sina egna agenter. Prioritera dem som era köpare faktiskt använder.
  3. Krävs ett avstående från träning? Om juridikteamet säger ja, neka träningsagenter (GPTBot, ClaudeBot, Google-Extended, CCBot och motsvarande) samtidigt som sökagenter tillåts där leverantören stöder uppdelningen.
  4. Finns det sökvägar som måste förbli privata oavsett vad? /app/, /internal/, URL:er för förhandsvisning av utkast – neka dessa för * (och bekräfta att autentisering fortfarande skyddar dem; robots.txt är inte åtkomstkontroll).
  5. Går HTML faktiskt att hämta? En tillåtande robots.txt tillsammans med ett tomt SPA-skal misslyckas fortfarande med AEO – åtgärda rendering härnäst.

Implementera policyn i robots.txt

Robots.txt finns på https://fernwood.example/robots.txt. Reglerna gäller per user-agent-grupp. Mer specifika grupper åsidosätter allmängruppen för den agenten. Föredra namngivna agenter framför att hoppas att User-agent: * uttrycker din AI-policy – mallar som anger Disallow: / under * hämmar även Googlebot och alla andra.

Mönster A – Synlig i svar, utanför träning (vanligt för AEO-inriktade webbplatser)

# OpenAI: citera i ChatGPT-sökning, använd inte för träning av grundmodeller
User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

# Anthropic: tillåt sökindexering; blockera träningscrawl
User-agent: Claude-SearchBot
Allow: /

User-agent: ClaudeBot
Disallow: /

# Google: Googlebot (Sök) är separat; Google-Extended styr Gemini-träning/AI-funktioner
User-agent: Google-Extended
Disallow: /

# Håll privata appsökvägar stängda för alla
User-agent: *
Disallow: /app/
Disallow: /internal/

OpenAI uppger att ändringar i robots.txt för sökning kan ta omkring 24 timmar att börja gälla. Kontrollera igen efter publicering.

Mönster B – Helt öppen (maximal räckvidd i svarsmotorer)

Utelämna AI-specifika Disallow-regler. Se till att inget under User-agent: * av misstag förbjuder hela webbplatsen. Skydda fortfarande privata sökvägar.

Mönster C – Helt stängd för AI-produkter

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-SearchBot
Disallow: /

User-agent: Claude-User
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

Använd detta endast som ett medvetet val. sedan Silktides AI-crawler-varning så att resultatet slutar räknas mot webbplatsen.

Kontrollera vem som faktiskt besöker dig

User-Agent-strängar är enkla att förfalska. Föredra IP-listor som publicerats av leverantören när du behöver vara säker:

Att blockera enbart via IP-adress utan en robots.txt-signal är bräckligt – Anthropic påpekar att IP-blockering kan störa botens möjlighet att läsa din robots.txt och slutföra ett avstående korrekt.

Vad robots.txt inte löser

  • Falska positiva resultat från brandvägg/bothantering. En brandvägg för webbapplikationer (WAF) – filtreringslagret som tjänster som Cloudflare placerar framför en webbplats – kan kräva extra verifiering av eller returnera 403 för klienter som ”inte är webbläsare”, vilket kan blockera GPTBot även när robots.txt tillåter den. Silktide testar detta separat som AI-crawlers blockerade i praktiken.
  • Tomma JavaScript-skal. Att släppa in crawlern i en <div id="root"></div> hjälper ingen. Kombinera den här tekniken med Innehåll som kan läsas utan JavaScript.
  • En magisk rankningsfördel. Att tillåta crawlers gör citering möjlig. Citerbara sidor, datum, identitet och belägg avgör fortfarande om du väljs – se Svar-först-struktur för sidor och Markup för organisationsidentitet.
  • llms.txt som ersättning. En indexfil kan inte åsidosätta en Disallow. Se llms.txt.

Så hjälper Silktide

  • AI-crawler-åtkomst analyserar robots.txt mot en lista över välkända AI-user-agents och varnar när webbplatsroten inte tillåts – en varning som du kan godkänna när blockeringen är avsiktlig.
  • AI-crawlers blockerade i praktiken hämtar som dessa crawlers för att upptäcka brandväggs- och edge-blockeringar som robots.txt inte kan förklara.
  • Innehåll utan JavaScript upptäcker problemet ”tillåtet men tomt”.

Relaterat

Senast uppdaterad

Var den här sidan hjälpsam?

Policy för åtkomst för AI-crawlers | Silktide Hjälp