Acesso de crawlers de IA
Assistentes de IA como ChatGPT, Claude e Perplexity leem a Web usando os seus próprios crawlers automatizados. A Silktide verifica se o seu site diz a esses crawlers para não entrarem, o que geralmente significa que os assistentes de IA não conseguem ler, citar nem recomendar o seu conteúdo.
Os sites controlam o acesso dos crawlers através de um ficheiro . Uma única regra nesse ficheiro pode bloquear todos os principais sistemas de IA:
# Bloqueia o crawler da OpenAI em todo o site
User-agent: GPTBot
Disallow: \/
Bloquear pode ser uma escolha deliberada, por exemplo, para recusar a participação no treino de modelos. Como por vezes é intencional, a Silktide comunica isto como um aviso que pode aprovar, e não como um erro confirmado.
Por que isto é importante
Uma parcela crescente das pessoas pergunta a um assistente de IA em vez de usar um motor de pesquisa. Esses assistentes só podem descrever, citar e criar ligações para sites que os seus crawlers têm autorização para ler. Se o seu site os bloquear, o conteúdo dos concorrentes preencherá as respostas, e perderá visitantes sem nunca ver um erro.
Muitos ficheiros robots.txt bloqueiam crawlers de IA por acidente: as regras foram copiadas de um modelo ou de um guia de reforço da segurança, e ninguém percebeu o que estavam a excluir. Esta verificação expõe essa situação para que o bloqueio seja uma decisão, e não um descuido.
Como corrigir
- Abra o ficheiro robots.txt do seu site (em
https:\/\/yoursite.com\/robots.txt) e procure as regras que mencionam os crawlers bloqueados, ou uma regraUser-agent: *comDisallow: \/que bloqueie tudo. - Se o bloqueio não for intencional, remova essas regras ou limite-as aos caminhos que quer realmente manter privados e, em seguida, publique novamente o ficheiro:
# Antes: bloqueia todo o site
User-agent: GPTBot
Disallow: \/
# Depois: permite o site e mantém uma área privada
User-agent: GPTBot
Disallow: \/internal\/
- Se o bloqueio for deliberado — por exemplo, se não quiser que o seu conteúdo seja
usado para treinar IA — o resultado. Tenha
em conta que alguns crawlers alimentam o treino e outros alimentam respostas em tempo
real, pelo que também pode bloquear seletivamente: permitir
OAI-SearchBote bloquearGPTBotmantém a sua visibilidade na pesquisa do ChatGPT sem contribuir para o treino.
Como a Silktide testa isto
- Obtém o ficheiro robots.txt a partir da raiz do seu site.
- Se o ficheiro não existir ou não puder ser obtido, a verificação é aprovada: sem robots.txt, nenhum crawler é bloqueado.
- Analisa as regras e testa cada um de uma lista de cerca de 20 agentes de utilizador de crawlers de IA conhecidos (incluindo GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended, Applebot-Extended e CCBot) em relação à raiz do seu site.
- Emite um aviso quando um ou mais destes crawlers estão bloqueados na raiz, indicando os crawlers bloqueados.
Resolução de problemas
A verificação é aprovada, mas os assistentes de IA continuam sem conseguir ler o meu site
Esta verificação lê apenas as regras do seu robots.txt. Um crawler que é permitido no papel pode continuar bloqueado na prática por uma firewall ou proteção contra bots — consulte Crawlers de IA bloqueados na prática. O conteúdo que só aparece depois da execução de também pode ficar invisível para os crawlers de IA — consulte Conteúdo disponível sem JavaScript.
Bloqueio crawlers de IA de propósito
É uma escolha legítima. Aprove o resultado e ele não será contabilizado contra o seu site. Considere se quer bloquear todos os crawlers de IA ou apenas os usados para treinar modelos.
Saiba mais
- Política de acesso de crawlers de IA - bots de treino, pesquisa e obtenção por utilizadores, e exemplos de padrões robots.txt
- Conteúdo legível sem JavaScript - quando o crawler tem autorização para entrar, mas ainda não consegue ver o seu conteúdo
- llms.txt - índice selecionado opcional para ferramentas de IA (não substitui a autorização para os crawlers)
- Crawlers de IA bloqueados na prática
- Conteúdo disponível sem JavaScript
- Documentação dos crawlers da OpenAI
- Documentação do Google-Extended
- Especificação robots.txt (RFC 9309)