Policy di accesso dei crawler AI
Una policy di accesso dei crawler AI è una configurazione deliberata di (e talvolta del firewall) che stabilisce quali sistemi AI possono recuperare le tue pagine pubbliche e per quale scopo. È situazionale perché la risposta “giusta” dipende dal fatto che ti interessi maggiormente essere citato nelle risposte degli assistenti, impedire che i contenuti vengano inclusi nell'addestramento dei modelli o entrambe le cose. Ciò che non è situazionale è trattare un modello “blocca tutta l'AI” incollato come se fosse una misura neutrale di rafforzamento della sicurezza. Questa scelta ha conseguenze di marketing.
In questa pagina, supponiamo che Fernwood voglia comparire nelle risposte di ChatGPT e Claude sulla gestione delle spese, ma che il suo ufficio legale preferisca non contribuire con nuove pagine ai corpus di addestramento dei modelli fondamentali.
Questa tecnica riguarda l'accesso. Una volta consentito l'accesso a un crawler, questo deve comunque ricevere HTML reale: consulta Contenuti leggibili senza JavaScript. Una mappa curata facoltativa è trattata separatamente in llms.txt.
Perché è situazionale
I prodotti AI non usano più un unico “bot AI”. I principali fornitori dividono i crawler in base alla loro funzione:
| Funzione | Bot tipici | Cosa comporta il blocco |
|---|---|---|
| Addestramento dei modelli | OpenAI GPTBot, Anthropic ClaudeBot, Common Crawl CCBot, Google Google-Extended (controllo dell'addestramento e del grounding di Gemini, non Googlebot) | Segnala che i contenuti non devono essere utilizzati per l'addestramento (oppure, nel caso di Google-Extended, per addestrare Gemini o alimentare determinate funzionalità AI). Da solo, non rimuove il sito dalla Ricerca Google classica. |
| Indicizzazione per la ricerca e le risposte | OpenAI OAI-SearchBot, Anthropic Claude-SearchBot, PerplexityBot | Riduce o elimina l'idoneità a essere mostrati e citati nelle risposte in stile ricerca di quel prodotto. |
| Recupero attivato dall'utente | OpenAI ChatGPT-User, Anthropic Claude-User, agenti simili che recuperano una pagina quando l'utente ne indica l'URL | Controlla i recuperi in tempo reale quando una persona indica una pagina all'assistente. Le regole dei fornitori differiscono per quanto riguarda il rispetto di robots.txt da parte di questi agenti: consulta la documentazione aggiornata del fornitore prima di presumere che Disallow funzioni. |
La documentazione di OpenAI sui propri crawler dichiara esplicitamente questa indipendenza: un webmaster può consentire a OAI-SearchBot di comparire nelle funzionalità di ricerca di ChatGPT e contemporaneamente vietare GPTBot, così che i contenuti sottoposti a scansione non vengano utilizzati per addestrare modelli generativi fondamentali. Anthropic documenta la stessa suddivisione in tre categorie per ClaudeBot (addestramento), Claude-SearchBot (qualità della ricerca) e Claude-User (recupero richiesto dall'utente).
Pertanto, la domanda sulla policy non è “AI: attiva o disattivata?”. Si tratta di tre decisioni separate, che dovrebbero riflettere la tolleranza al rischio e gli obiettivi AEO di Fernwood.
Di norma, consenti i crawler per la ricerca e le risposte quando:
- Vuoi che gli assistenti citino la documentazione, le ricerche e le pagine comparative di Fernwood.
- I concorrenti compaiono già in quelle risposte e tu no.
- Il controllo Accesso dei crawler AI di Silktide mostra un avviso perché un modello ha bloccato tutto per errore.
Spesso blocca o limita i crawler per l'addestramento quando:
- La policy legale o del marchio vieta di contribuire i contenuti del sito all'addestramento di modelli di terze parti.
- Pubblichi ricerche proprietarie, logiche di determinazione dei prezzi o materiali adiacenti a contenuti riservati che devono rimanere fuori dai corpus di addestramento, anche se vuoi continuare a ottenere citazioni in tempo reale.
Blocca in modo esteso quando:
- Il sito non è pubblico, è un ambiente di staging oppure non hai motivo di marketing per comparire nelle risposte degli assistenti (intranet, pura interfaccia dell'app, portale per partner).
- Hai deciso consapevolmente di rimanere completamente fuori dalle risposte AI e sei disposto a perdere questo canale.
Come decidere (foglio di lavoro di Fernwood)
Segui questi passaggi in ordine. Metti per iscritto le risposte: il file robots.txt è semplicemente la codifica di questo foglio di lavoro.
- Vogliamo essere citati nelle risposte AI? Se no, vieta i principali bot di ricerca e risposta e approva l'avviso di Silktide. Se sì, continua.
- Quali assistenti contano? ChatGPT, Claude, Perplexity, le funzionalità AI di Google e altri hanno ciascuno i propri agenti. Dai priorità a quelli utilizzati effettivamente dai tuoi acquirenti.
- È necessario rinunciare all'addestramento? Se l'ufficio legale dice di sì, vieta gli agenti di addestramento (
GPTBot,ClaudeBot,Google-Extended,CCBote simili), mantenendo consentiti gli agenti di ricerca dove il fornitore supporta questa separazione. - Ci sono percorsi che devono rimanere privati in ogni caso?
\/app\/,\/internal\/, URL di anteprima delle bozze: vietali per*(e verifica che l'autenticazione continui a proteggerli; robots.txt non è un controllo degli accessi). - L'HTML è effettivamente recuperabile? Un robots.txt permissivo con un guscio SPA vuoto non è sufficiente per l'AEO: correggi il rendering come passaggio successivo.
Implementare la policy in robots.txt
Robots.txt si trova all'indirizzo https:\/\/fernwood.example\/robots.txt. Le regole sono organizzate per gruppo di user agent. I gruppi più specifici hanno la precedenza sul gruppo generale per quell'agente. Preferisci indicare gli agenti per nome invece di affidarti a User-agent: * per esprimere la tua policy AI: i modelli che impostano Disallow: \/ sotto * ostacolano anche Googlebot e tutti gli altri.
Modello A: visibile nelle risposte, fuori dall'addestramento (comune per i siti orientati all'AEO)
# OpenAI: citazione nella ricerca di ChatGPT, esclusione dall'addestramento dei modelli fondamentali
User-agent: OAI-SearchBot
Allow: \/
User-agent: GPTBot
Disallow: \/
# Anthropic: consenti l'indicizzazione per la ricerca; blocca la scansione per l'addestramento
User-agent: Claude-SearchBot
Allow: \/
User-agent: ClaudeBot
Disallow: \/
# Google: Googlebot (Ricerca) è separato; Google-Extended controlla l'addestramento di Gemini e le funzionalità AI
User-agent: Google-Extended
Disallow: \/
# Mantieni chiusi a tutti i percorsi privati dell'app
User-agent: *
Disallow: \/app\/
Disallow: \/internal\/
OpenAI segnala che le modifiche a robots.txt per la ricerca possono richiedere circa 24 ore per diventare effettive. Ricontrolla dopo la pubblicazione.
Modello B: completamente aperto (massima copertura nei motori di risposta)
Rimuovi le regole Disallow specifiche per l'AI. Assicurati che nulla sotto User-agent: * vieti accidentalmente l'intero sito. Proteggi comunque i percorsi privati.
Modello C: completamente chiuso ai prodotti AI
User-agent: GPTBot
Disallow: \/
User-agent: OAI-SearchBot
Disallow: \/
User-agent: ClaudeBot
Disallow: \/
User-agent: Claude-SearchBot
Disallow: \/
User-agent: Claude-User
Disallow: \/
User-agent: PerplexityBot
Disallow: \/
User-agent: Google-Extended
Disallow: \/
User-agent: CCBot
Disallow: \/
Usalo solo come scelta consapevole. Quindi l'avviso di Silktide sui crawler AI, in modo che il risultato non venga più conteggiato a sfavore del sito.
Verifica chi ti sta effettivamente visitando
Le stringhe User-Agent sono semplici da falsificare. Quando hai bisogno di certezza, preferisci gli elenchi di IP pubblicati dai fornitori:
- OpenAI pubblica un JSON con gli IP dei crawler (collegato dalla documentazione dei bot di OpenAI).
- Anthropic pubblica gli IP dei crawler all'indirizzo claude.com/crawling/bots.json.
Bloccare solo tramite IP, senza un segnale in robots.txt, è fragile: Anthropic osserva che i blocchi degli IP possono interferire con la capacità del bot di leggere robots.txt e completare correttamente la procedura di rinuncia.
Cosa non risolve robots.txt
- Falsi positivi del firewall e della gestione dei bot. Un web application firewall (WAF), cioè il livello di filtraggio che servizi come Cloudflare collocano davanti a un sito, può sottoporre a verifica o restituire un errore 403 ai client “non browser”, bloccando GPTBot anche quando robots.txt lo consente. Silktide lo verifica separatamente con Crawler AI bloccati nella pratica.
- Gusci JavaScript vuoti. Consentire al crawler di accedere a un
<div id="root"></div>non serve a nessuno. Abbina questa tecnica a Contenuti leggibili senza JavaScript. - Un magico miglioramento del posizionamento. Consentire i crawler rende possibile la citazione. Pagine citabili, date, identità ed elementi di prova determinano comunque se verrai scelto: consulta Struttura della pagina orientata prima di tutto alle risposte e Markup dell'identità dell'organizzazione.
llms.txtcome sostituto. Un file indice non può ignorare unDisallow. Consulta llms.txt.
Come aiuta Silktide
- Accesso dei crawler AI analizza robots.txt rispetto a un elenco di user agent AI noti e mostra un avviso quando la radice del sito è vietata: puoi approvare l'avviso quando il blocco è intenzionale.
- Crawler AI bloccati nella pratica effettua il recupero come quei crawler per individuare i blocchi del firewall e del perimetro che robots.txt non può spiegare.
- Contenuti senza JavaScript individua la modalità di errore “consentito ma vuoto”.
Correlati
- Accesso dei crawler AI: il controllo di Silktide approfondito da questa tecnica
- Contenuti leggibili senza JavaScript
- llms.txt: indice curato facoltativo dopo aver risolto l'accesso
- Documentazione dei crawler di OpenAI
- Documentazione dei crawler di Anthropic
- Panoramica dei crawler di Google (incluso Google-Extended)
- Specifica robots.txt (RFC 9309)