robots.txt
robots.txt é um ficheiro de texto simples na raiz de um site (por exemplo, https:\/\/example.com\/robots.txt) que informa aos automatizados que partes do site eles podem obter.
User-agent: GPTBot
Disallow: \/
User-agent: *
Allow: \/
Cada regra identifica um rastreador (ou * para todos) e lista os caminhos que ele está autorizado ou não autorizado a visitar. Os motores de pesquisa e os consultam este ficheiro antes de obter páginas, por isso uma única linha Disallow pode tornar um site inteiro invisível para um assistente de IA — por vezes intencionalmente, muitas vezes por acidente. O robots.txt controla o rastreamento, não a indexação: bloquear uma página aqui não a remove dos resultados de pesquisa como faz o , e pode até ter o efeito contrário, ocultando a própria tag noindex.
Saiba mais
- Introdução e guia do Robots.txt — guia prático da Google
- RFC 9309: Robots Exclusion Protocol — a norma formal do IETF