Avançar para o conteúdo
SilktideAjuda

Acesso de crawlers de IA

Assistentes de IA como ChatGPT, Claude e Perplexity leem a Web usando os seus próprios crawlers automatizados. A Silktide verifica se o seu site diz a esses crawlers para não entrarem, o que geralmente significa que os assistentes de IA não conseguem ler, citar nem recomendar o seu conteúdo.

Os sites controlam o acesso dos crawlers através de um ficheiro . Uma única regra nesse ficheiro pode bloquear todos os principais sistemas de IA:

# Bloqueia o crawler da OpenAI em todo o site
User-agent: GPTBot
Disallow: \/

Bloquear pode ser uma escolha deliberada, por exemplo, para recusar a participação no treino de modelos. Como por vezes é intencional, a Silktide comunica isto como um aviso que pode aprovar, e não como um erro confirmado.

Por que isto é importante

Uma parcela crescente das pessoas pergunta a um assistente de IA em vez de usar um motor de pesquisa. Esses assistentes só podem descrever, citar e criar ligações para sites que os seus crawlers têm autorização para ler. Se o seu site os bloquear, o conteúdo dos concorrentes preencherá as respostas, e perderá visitantes sem nunca ver um erro.

Muitos ficheiros robots.txt bloqueiam crawlers de IA por acidente: as regras foram copiadas de um modelo ou de um guia de reforço da segurança, e ninguém percebeu o que estavam a excluir. Esta verificação expõe essa situação para que o bloqueio seja uma decisão, e não um descuido.

Como corrigir

  1. Abra o ficheiro robots.txt do seu site (em https:\/\/yoursite.com\/robots.txt) e procure as regras que mencionam os crawlers bloqueados, ou uma regra User-agent: * com Disallow: \/ que bloqueie tudo.
  2. Se o bloqueio não for intencional, remova essas regras ou limite-as aos caminhos que quer realmente manter privados e, em seguida, publique novamente o ficheiro:
# Antes: bloqueia todo o site
User-agent: GPTBot
Disallow: \/

# Depois: permite o site e mantém uma área privada
User-agent: GPTBot
Disallow: \/internal\/
  1. Se o bloqueio for deliberado — por exemplo, se não quiser que o seu conteúdo seja usado para treinar IA — o resultado. Tenha em conta que alguns crawlers alimentam o treino e outros alimentam respostas em tempo real, pelo que também pode bloquear seletivamente: permitir OAI-SearchBot e bloquear GPTBot mantém a sua visibilidade na pesquisa do ChatGPT sem contribuir para o treino.

Como a Silktide testa isto

  1. Obtém o ficheiro robots.txt a partir da raiz do seu site.
  2. Se o ficheiro não existir ou não puder ser obtido, a verificação é aprovada: sem robots.txt, nenhum crawler é bloqueado.
  3. Analisa as regras e testa cada um de uma lista de cerca de 20 agentes de utilizador de crawlers de IA conhecidos (incluindo GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended, Applebot-Extended e CCBot) em relação à raiz do seu site.
  4. Emite um aviso quando um ou mais destes crawlers estão bloqueados na raiz, indicando os crawlers bloqueados.

Resolução de problemas

A verificação é aprovada, mas os assistentes de IA continuam sem conseguir ler o meu site

Esta verificação lê apenas as regras do seu robots.txt. Um crawler que é permitido no papel pode continuar bloqueado na prática por uma firewall ou proteção contra bots — consulte Crawlers de IA bloqueados na prática. O conteúdo que só aparece depois da execução de também pode ficar invisível para os crawlers de IA — consulte Conteúdo disponível sem JavaScript.

Bloqueio crawlers de IA de propósito

É uma escolha legítima. Aprove o resultado e ele não será contabilizado contra o seu site. Considere se quer bloquear todos os crawlers de IA ou apenas os usados para treinar modelos.

Saiba mais

Última atualização

Esta página foi útil?