Accesso dei crawler IA
Gli assistenti IA come ChatGPT, Claude e Perplexity leggono il web utilizzando i propri crawler automatizzati. Silktide controlla se il tuo sito web indica a questi crawler di non accedere, il che generalmente significa che gli assistenti IA non possono leggere, citare o consigliare i tuoi contenuti.
I siti web controllano l'accesso dei crawler tramite un file . Una singola regola in quel file può escludere tutti i principali sistemi di IA:
# Blocca il crawler di OpenAI dall'intero sito
User-agent: GPTBot
Disallow: /
Bloccare i può essere una scelta deliberata, ad esempio per non partecipare all'addestramento dei modelli. Poiché a volte è intenzionale, Silktide segnala questa situazione come un avviso che puoi approvare, anziché come un errore confermato.
Perché è importante
Un numero crescente di persone pone domande a un assistente IA invece di utilizzare un motore di ricerca. Questi assistenti possono descrivere, citare e collegare solo i siti web che i loro crawler sono autorizzati a leggere. Se il tuo sito li blocca, nei risultati compariranno invece i contenuti dei concorrenti e perderai visitatori senza mai visualizzare un errore.
Molti file robots.txt bloccano i crawler IA per errore: le regole sono state copiate da un modello o da una guida per il rafforzamento della sicurezza e nessuno si è accorto di ciò che escludevano. Questo controllo lo mette in evidenza, affinché il blocco sia una decisione e non una svista.
Come risolvere il problema
- Apri il file robots.txt del tuo sito (all'indirizzo
https://yoursite.com/robots.txt) e cerca le regole che indicano i crawler bloccati oppure una regolaUser-agent: *conDisallow: /che blocca tutto. - Se il blocco non è intenzionale, rimuovi queste regole o limitale ai percorsi che vuoi davvero mantenere privati, quindi pubblica nuovamente il file:
# Prima: blocca l'intero sito
User-agent: GPTBot
Disallow: /
# Dopo: consente l'accesso al sito e mantiene privata un'area
User-agent: GPTBot
Disallow: /internal/
- Se il blocco è deliberato, ad esempio perché non vuoi che i tuoi contenuti vengano utilizzati per l'addestramento dell'IA, il rilevamento. Tieni presente che alcuni crawler alimentano l'addestramento dei modelli, mentre altri forniscono risposte in tempo reale; puoi quindi bloccarli selettivamente: consentire
OAI-SearchBote bloccareGPTBotti mantiene visibile nella ricerca di ChatGPT senza contribuire all'addestramento.
Come Silktide esegue il controllo
- Recupera il file robots.txt dalla radice del tuo sito web.
- Se il file non esiste o non può essere recuperato, il controllo ha esito positivo: in assenza di robots.txt, nessun crawler viene bloccato.
- Analizza le regole e verifica ciascuno degli user agent di un elenco di circa 20 crawler IA noti (tra cui GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended, Applebot-Extended e CCBot) rispetto alla radice del tuo sito.
- Mostra un avviso quando uno o più di questi crawler vengono bloccati dalla radice, indicando quali crawler sono bloccati.
Risoluzione dei problemi
Il controllo ha esito positivo, ma gli assistenti IA non riescono comunque a leggere il mio sito
Questo controllo legge solo le regole del file robots.txt. Un crawler autorizzato sulla carta può comunque essere bloccato nella pratica da un firewall o da una protezione contro i bot: consulta Crawler IA bloccati nella pratica. Anche i contenuti che compaiono solo dopo l'esecuzione di possono essere invisibili ai crawler IA: consulta Contenuti disponibili senza JavaScript.
Blocco intenzionalmente i crawler IA
È una scelta legittima. Approva il rilevamento e non verrà conteggiato ai fini del punteggio del sito. Valuta se vuoi bloccare tutti i crawler IA o solo quelli utilizzati per l'addestramento dei modelli.
Scopri di più
- Policy sull'accesso dei crawler IA - bot per l'addestramento, la ricerca e il recupero da parte degli utenti, oltre a esempi di configurazioni robots.txt
- Contenuti leggibili senza JavaScript - quando il crawler può accedere, ma non riesce comunque a visualizzare i tuoi contenuti
- llms.txt - indice curato facoltativo per gli strumenti IA (non sostituisce l'autorizzazione ai crawler)
- Crawler IA bloccati nella pratica
- Contenuti disponibili senza JavaScript
- Documentazione sui crawler di OpenAI
- Documentazione su Google-Extended
- Specifica robots.txt (RFC 9309)