Vai al contenuto
SilktideAiuto

Accesso dei crawler IA

Gli assistenti IA come ChatGPT, Claude e Perplexity leggono il web utilizzando i propri crawler automatizzati. Silktide controlla se il tuo sito web indica a questi crawler di non accedere, il che generalmente significa che gli assistenti IA non possono leggere, citare o consigliare i tuoi contenuti.

I siti web controllano l'accesso dei crawler tramite un file . Una singola regola in quel file può escludere tutti i principali sistemi di IA:

# Blocca il crawler di OpenAI dall'intero sito
User-agent: GPTBot
Disallow: /

Bloccare i può essere una scelta deliberata, ad esempio per non partecipare all'addestramento dei modelli. Poiché a volte è intenzionale, Silktide segnala questa situazione come un avviso che puoi approvare, anziché come un errore confermato.

Perché è importante

Un numero crescente di persone pone domande a un assistente IA invece di utilizzare un motore di ricerca. Questi assistenti possono descrivere, citare e collegare solo i siti web che i loro crawler sono autorizzati a leggere. Se il tuo sito li blocca, nei risultati compariranno invece i contenuti dei concorrenti e perderai visitatori senza mai visualizzare un errore.

Molti file robots.txt bloccano i crawler IA per errore: le regole sono state copiate da un modello o da una guida per il rafforzamento della sicurezza e nessuno si è accorto di ciò che escludevano. Questo controllo lo mette in evidenza, affinché il blocco sia una decisione e non una svista.

Come risolvere il problema

  1. Apri il file robots.txt del tuo sito (all'indirizzo https://yoursite.com/robots.txt) e cerca le regole che indicano i crawler bloccati oppure una regola User-agent: * con Disallow: / che blocca tutto.
  2. Se il blocco non è intenzionale, rimuovi queste regole o limitale ai percorsi che vuoi davvero mantenere privati, quindi pubblica nuovamente il file:
# Prima: blocca l'intero sito
User-agent: GPTBot
Disallow: /

# Dopo: consente l'accesso al sito e mantiene privata un'area
User-agent: GPTBot
Disallow: /internal/
  1. Se il blocco è deliberato, ad esempio perché non vuoi che i tuoi contenuti vengano utilizzati per l'addestramento dell'IA, il rilevamento. Tieni presente che alcuni crawler alimentano l'addestramento dei modelli, mentre altri forniscono risposte in tempo reale; puoi quindi bloccarli selettivamente: consentire OAI-SearchBot e bloccare GPTBot ti mantiene visibile nella ricerca di ChatGPT senza contribuire all'addestramento.

Come Silktide esegue il controllo

  1. Recupera il file robots.txt dalla radice del tuo sito web.
  2. Se il file non esiste o non può essere recuperato, il controllo ha esito positivo: in assenza di robots.txt, nessun crawler viene bloccato.
  3. Analizza le regole e verifica ciascuno degli user agent di un elenco di circa 20 crawler IA noti (tra cui GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended, Applebot-Extended e CCBot) rispetto alla radice del tuo sito.
  4. Mostra un avviso quando uno o più di questi crawler vengono bloccati dalla radice, indicando quali crawler sono bloccati.

Risoluzione dei problemi

Il controllo ha esito positivo, ma gli assistenti IA non riescono comunque a leggere il mio sito

Questo controllo legge solo le regole del file robots.txt. Un crawler autorizzato sulla carta può comunque essere bloccato nella pratica da un firewall o da una protezione contro i bot: consulta Crawler IA bloccati nella pratica. Anche i contenuti che compaiono solo dopo l'esecuzione di possono essere invisibili ai crawler IA: consulta Contenuti disponibili senza JavaScript.

Blocco intenzionalmente i crawler IA

È una scelta legittima. Approva il rilevamento e non verrà conteggiato ai fini del punteggio del sito. Valuta se vuoi bloccare tutti i crawler IA o solo quelli utilizzati per l'addestramento dei modelli.

Scopri di più

Ultimo aggiornamento

Questa pagina è stata utile?