Fara í efni
SilktideHjálp

Aðgangsstefna fyrir gervigreindarvefskriðla

Aðgangsstefna fyrir gervigreindarvefskriðla er meðvituð uppsetning á (og stundum eldvegg) sem tilgreinir hvaða gervigreindarkerfi mega sækja opinberar síður þínar – og í hvaða tilgangi. Hún er háð aðstæðum vegna þess að „rétta“ svarið fer eftir því hvort þú leggur meiri áherslu á að vera vitnað í svörum aðstoðarmanna, að halda efni frá þjálfun líkana eða hvort tveggja. Það sem er ekki háð aðstæðum er að líta á límda „loka á alla gervigreind“-sniðmátið sem hlutlausa öryggisstyrkingu. Sú ákvörðun hefur markaðslegar afleiðingar.

Á allri þessari síðu skulum við gera ráð fyrir að Fernwood vilji birtast í svörum ChatGPT og Claude um kostnaðarstjórnun, en lögfræðiteymi fyrirtækisins kjósi að leggja ekki nýjar síður til gagnasafna fyrir grunnlíkanaþjálfun.

Þessi tækni snýst um aðgang. Þegar vefskriðli er hleypt inn þarf hann samt að fá raunverulegt HTML – sjá Efni sem er læsilegt án JavaScript – og sérstakt handvalið yfirlit er fjallað um í llms.txt.

Hvers vegna þetta fer eftir aðstæðum

Gervigreindarvörur nota ekki lengur eitt sameiginlegt „gervigreindarforrit“. Stórir þjónustuveitendur skipta vefskriðlum eftir verkefnum:

VerkefniDæmigerð forritHvað lokun gerir
LíkanaþjálfunOpenAI GPTBot, Anthropic ClaudeBot, Common Crawl CCBot, Google Google-Extended (stýring á Gemini-þjálfun/grunnun – ekki Googlebot)Gefur til kynna að ekki eigi að nota efni til þjálfunar (eða, fyrir Google-Extended, til að þjálfa Gemini eða knýja ákveðna gervigreindareiginleika). Fjarlægir þig ekki sjálfkrafa úr hefðbundinni Google-leit.
Leitar-/svaraskráningOpenAI OAI-SearchBot, Anthropic Claude-SearchBot, PerplexityBotDregur úr eða fjarlægir möguleikann á að birtast og vera vitnað í í leitarlegum svörum viðkomandi vöru.
Sókn að beiðni notandaOpenAI ChatGPT-User, Anthropic Claude-User, sambærilegir „notandi bað um þetta vefslóð“-fulltrúarStýrir lifandi sóknum þegar einstaklingur bendir aðstoðarmanni á síðu. Reglur þjónustuveitenda eru mismunandi um hvort robots.txt sé virt fyrir þessi forrit – kynntu þér núverandi skjöl þjónustuveitandans áður en þú gerir ráð fyrir að Disallow virki.

Í eigin skjölum OpenAI er sjálfstæðið tekið skýrt fram: vefstjóri getur leyft OAI-SearchBot að birtast í ChatGPT-leitareiginleikum en bannað GPTBot, þannig að skriðefni sé ekki notað til að þjálfa skapandi grunnlíkön. Anthropic lýsir sömu þrískiptingu fyrir ClaudeBot (þjálfun), Claude-SearchBot (leitargæði) og Claude-User (sókn að beiðni notanda).

Stefnuspurningin er því ekki „Gervigreind: kveikt eða slökkt?“ Hún er þrjár aðskildar ákvarðanir sem ættu að samræmast áhættuþoli Fernwood og AEO-markmiðum.

Leyfðu yfirleitt leitar-/svaravefskriðlum þegar:

  • Þú vilt að aðstoðarmenn vitni í skjöl, rannsóknir og samanburðarsíður Fernwood.
  • Keppinautar birtast nú þegar í þessum svörum en þú ekki.
  • Prófun Silktide á aðgengi gervigreindarvefskriðla gefur viðvörun vegna þess að sniðmát lokaði óvart á allt.

Lokaðu oft á eða takmarkaðu þjálfunarvefskriðla þegar:

  • Lögfræði- eða vörumerkjastefna bannar að leggja efni vefsins til þjálfunar líkana þriðju aðila.
  • Þú birtir sértækar rannsóknir, verðlagningarrökfræði eða efni sem er næstum lokað og þarf að halda utan við þjálfunargagnasöfn, jafnvel þótt þú viljir áfram fá lifandi tilvísanir.

Lokaðu víða þegar:

  • Vefurinn er ekki opinber, er í uppsetningu eða hefur enga markaðslega ástæðu til að birtast í svörum aðstoðarmanna (innri vefur, hreint forritsviðmót, samstarfsgátt).
  • Þú hefur tekið meðvitaða vöruákvörðun um að vera alfarið utan gervigreindarsvara – og ert tilbúin(n) að missa þá dreifileið.

Hvernig á að taka ákvörðun (vinnublað Fernwood)

Farðu í gegnum þetta í röð. Skrifaðu svörin niður; robots.txt-skráin er aðeins kóðun vinnublaðsins.

  1. Viljum við yfirhöfuð vera nefnd í gervigreindarsvörum? Ef nei, bannaðu helstu leitar-/svaraforritin og samþykktu viðvörun Silktide. Ef já, haltu áfram.
  2. Hvaða aðstoðarmenn skipta máli? ChatGPT, Claude, Perplexity, gervigreindareiginleikar Google og aðrir hafa hvert sína fulltrúa. Forgangsraðaðu þeim sem kaupendur þínir nota í raun.
  3. Er afþökkun þjálfunar nauðsynleg? Ef lögfræðiteymið segir já, bannaðu þjálfunarfulltrúa (GPTBot, ClaudeBot, Google-Extended, CCBot og sambærilega) en leyfðu leitarfulltrúum þar sem þjónustuveitandinn styður aðskilnaðinn.
  4. Eru slóðir sem verða að vera lokaðar hvort sem er? \/app\/, \/internal\/, forskoðunarslóðir draga – bannaðu þær fyrir * (og staðfestu að auðkenning verndi þær enn; robots.txt er ekki aðgangsstýring).
  5. Er HTML í raun hægt að sækja? Leyfileg robots.txt með tómri SPA-skel stenst samt ekki AEO – lagaðu birtingu næst.

Innleiðing stefnunnar í robots.txt

Robots.txt er á https:\/\/fernwood.example\/robots.txt. Reglur gilda fyrir hóp notenda-forrita. Sérstakari hópar hafa forgang fram yfir almenna reglu fyrir viðkomandi forrit. Kjósið nafngreind forrit fremur en að treysta á að User-agent: * lýsi gervigreindarstefnunni – sniðmát sem setja Disallow: \/ undir * lama líka Googlebot og alla aðra.

Mynstur A – Sýnilegt í svörum en utan þjálfunar (algengt fyrir AEO-miðaða vefi)

# OpenAI: vitna í ChatGPT-leit, ekki nota fyrir grunnlíkanaþjálfun
User-agent: OAI-SearchBot
Allow: \/

User-agent: GPTBot
Disallow: \/

# Anthropic: leyfa leitar­skráningu; loka á þjálfunarskrið
User-agent: Claude-SearchBot
Allow: \/

User-agent: ClaudeBot
Disallow: \/

# Google: Googlebot (leit) er aðskilið; Google-Extended stýrir Gemini-þjálfun / gervigreindareiginleikum
User-agent: Google-Extended
Disallow: \/

# Halda einka-slóðum forrits lokuðum öllum
User-agent: *
Disallow: \/app\/
Disallow: \/internal\/

OpenAI bendir á að breytingar á robots.txt fyrir leit geti tekið um það bil ~24 klukkustundir að taka gildi. Prófaðu aftur eftir birtingu.

Mynstur B – Alveg opið (hámarksdreifing í svaravélum)

Slepptu sértækum Disallow-reglum fyrir gervigreind. Gakktu úr skugga um að ekkert undir User-agent: * loki óvart á allan vefinn. Verndaðu samt einka-slóðir.

Mynstur C – Alveg lokað gervigreindarvörum

User-agent: GPTBot
Disallow: \/

User-agent: OAI-SearchBot
Disallow: \/

User-agent: ClaudeBot
Disallow: \/

User-agent: Claude-SearchBot
Disallow: \/

User-agent: Claude-User
Disallow: \/

User-agent: PerplexityBot
Disallow: \/

User-agent: Google-Extended
Disallow: \/

User-agent: CCBot
Disallow: \/

Notaðu þetta aðeins sem meðvitaða ákvörðun. Síðan skaltu viðvörun Silktide um gervigreindarvefskriðla svo niðurstaðan teljist ekki lengur gegn vefnum.

Staðfestu hverjir sækja í raun

Auðkennisstrengir User-Agent eru auðveldir í fölsun. Kjósið IP-lista sem þjónustuveitendur birta þegar þið þurfið fullvissu:

Að loka eingöngu eftir IP-tölu, án merkis í robots.txt, er ótraust – Anthropic bendir á að IP-lokanir geti truflað getu forritsins til að lesa robots.txt og ljúka afþökkun á réttan hátt.

Hvað robots.txt lagar ekki

  • Rangar jákvæðar niðurstöður í eldvegg eða stjórnun vefskriðla. Vefveggur (WAF) – síunarlagið sem þjónustur á borð við Cloudflare setja framan við vef – sem krefst viðbótarstaðfestingar eða skilar 403 fyrir „ekki-vafra“-biðlara getur lokað á GPTBot jafnvel þegar robots.txt leyfir það. Silktide prófar þetta sérstaklega sem Gervigreindarvefskriðlar lokaðir í framkvæmd.
  • Tómar JavaScript-skeljar. Að hleypa vefskriðlinum inn í <div id="root"></div> hjálpar engum. Paraðu þessa tækni við Efni sem er læsilegt án JavaScript.
  • Töfrandi röðunaraukningu. Leyfi fyrir vefskriðla gerir tilvitnun mögulega. Síður sem auðvelt er að vitna í, dagsetningar, auðkenni og gögn ráða enn því hvort þú ert valin(n) – sjá Uppbygging síðu með svarið í fyrirrúmi og Auðkennismerkingu fyrirtækis.
  • llms.txt sem staðgengil. Atriðaskrá getur ekki hnekkt Disallow. Sjá llms.txt.

Hvernig Silktide hjálpar

Tengt efni

Síðast uppfært

Var þessi síða gagnleg?

Aðgangsstefna fyrir gervigreindarvefskriðla | Hjálp Silktide