Blocco dei crawler IA
Silktide verifica se le richieste che si identificano come provenienti dai principali crawler IA riescono effettivamente a raggiungere il tuo sito web. Un sito può accogliere questi crawler sulla carta, mentre un firewall o un prodotto di sicurezza li respinge all'ingresso.
Il tuo può indicare che i sono benvenuti, mentre il tuo firewall li rifiuta. I prodotti e di sicurezza includono interruttori con un clic per «bloccare i bot IA», alcuni dei quali sono attivati per impostazione predefinita, che rifiutano qualsiasi richiesta identificata come GPTBot, ClaudeBot, PerplexityBot o simili, indipendentemente da ciò che dichiara robots.txt. I proprietari dei siti spesso non sanno che questa funzione è attiva: per te il sito funziona perfettamente, mentre per ogni assistente IA è come se non esistesse.
Perché è importante
Gli assistenti IA possono citare e consigliare solo i contenuti che i loro crawler riescono a recuperare. Un blocco a livello di firewall è invisibile durante il normale utilizzo: il sito si carica correttamente in ogni browser e i tuoi Analytics sembrano in buona salute, ma i motori di risposta non riescono silenziosamente a leggerti e citano invece i concorrenti. Poiché non viene visualizzato alcun errore, questo è uno dei problemi di visibilità più difficili da rilevare senza eseguire un controllo specifico.
Il controllo separato di Silktide accesso dei crawler IA verifica ciò che dichiara il tuo robots.txt. Questo controllo verifica ciò che accade effettivamente sulla rete. I due risultati spesso non coincidono e, quando accade, prevale il firewall.
Come risolvere il problema
- Controlla la dashboard del tuo CDN o del prodotto di sicurezza per verificare il blocco dei bot IA. In Cloudflare, cerca «bot IA» o «Bot Fight Mode» nella sezione Security; altri provider come Akamai, Imperva e DataDome dispongono di interruttori equivalenti. A volte sono attivati per impostazione predefinita.
- Se il blocco non è intenzionale, disattiva l'interruttore oppure aggiungi alla tua lista consentita i crawler specifici che vuoi autorizzare.
- Se utilizzi un firewall o regole del server personalizzati che corrispondono agli user agent dei bot, rimuovi le voci relative ai crawler IA che vuoi ammettere.
- Se blocchi deliberatamente i crawler IA, il risultato: è una scelta legittima.
Come esegue i controlli Silktide
- Richiediamo la tua home page utilizzando l'identità di un browser normale. Se la richiesta viene rifiutata o sottoposta a una verifica, il controllo non è applicabile: non è possibile attribuire nulla alla discriminazione dei crawler.
- Richiediamo nuovamente la home page identificandoci come ciascuno dei principali crawler IA (GPTBot, ClaudeBot, PerplexityBot e CCBot), utilizzando le stringhe User-Agent pubblicate dai rispettivi operatori. Tutte le richieste provengono dallo stesso luogo, quindi qualsiasi differenza nella risposta è dovuta all'identità del crawler.
- Consideriamo un crawler bloccato quando la sua richiesta riceve uno stato di rifiuto esplicito (ad esempio
403 Forbidden,429 Too Many Requestso503), una pagina di verifica o che un crawler non può risolvere, oppure nessuna risposta mentre la richiesta del browser è andata a buon fine. - Mostriamo un avviso quando un crawler viene respinto, indicando quali.
Tutte le richieste hanno come destinazione solo la home page e vengono eseguite una volta per controllo.
Risoluzione dei problemi
Verifichiamo i crawler tramite la loro rete, non solo tramite il loro nome
Alcuni siti accettano solo le richieste provenienti dagli indirizzi di rete verificati dell'operatore di un crawler. La sonda di Silktide invia l'identità pubblicata dal crawler dalla propria rete, quindi un sito di questo tipo potrebbe rifiutare la sonda pur ammettendo il crawler reale. Questa configurazione è molto più rara del blocco generalizzato basato sull'identità; se hai confermato di utilizzarla, approva il risultato.
Il controllo ha esito positivo, ma gli assistenti continuano a non trovare i miei contenuti
Riuscire a superare l'ingresso è necessario, ma non sufficiente. Verifica che il tuo robots.txt consenta l'accesso ai crawler IA (accesso dei crawler IA) e che per visualizzare i tuoi contenuti non sia necessario (Contenuti senza JavaScript).