robots.txt
robots.txt è un file di testo semplice nella radice di un sito web (per esempio https://example.com/robots.txt) che indica ai automatici quali parti del sito possono recuperare.
User-agent: GPTBot
Disallow: /
User-agent: *
Allow: /
Ogni regola indica un crawler (oppure * per tutti) ed elenca i percorsi che è autorizzato o non autorizzato a visitare. I motori di ricerca e i controllano questo file prima di recuperare le pagine, quindi una singola riga Disallow può rendere un intero sito invisibile a un assistente IA - a volte intenzionalmente, spesso per errore. robots.txt controlla la scansione, non l'indicizzazione: bloccare qui una pagina non la rimuove dai risultati di ricerca come fa e può persino ritorcersi contro nascondendo il tag noindex stesso.
Per saperne di più
- Introduzione e guida a robots.txt - la guida pratica di Google
- RFC 9309: Robots Exclusion Protocol - lo standard IETF formale