Bloqueio de crawlers de IA
A Silktide testa se os pedidos que se identificam como sendo dos principais crawlers de IA conseguem realmente chegar ao seu site. Um site pode permitir estes crawlers em teoria, enquanto uma firewall ou um produto de segurança os impede de entrar.
O seu pode indicar que os são permitidos, enquanto a sua firewall os recusa. Produtos de e de segurança incluem opções de um clique para "bloquear bots de IA" — algumas ativadas por predefinição — que recusam qualquer pedido que se identifique como GPTBot, ClaudeBot, PerplexityBot ou semelhante, independentemente do que o robots.txt declarar. Os proprietários de sites muitas vezes não fazem ideia de que esta opção está ativada: para si, o site funciona perfeitamente, mas, para todos os assistentes de IA, ele não existe.
Porque é importante
Os assistentes de IA só podem citar e recomendar conteúdo que os seus crawlers consigam obter. Um bloqueio ao nível da firewall é invisível durante a utilização normal — o seu site carrega corretamente em todos os browsers e os seus Analytics parecem saudáveis —, mas os motores de respostas não conseguem ler o seu conteúdo e citam silenciosamente os concorrentes. Como nada apresenta um erro visível, este é um dos problemas de visibilidade mais difíceis de detetar sem o testar diretamente.
A verificação separada da Silktide, acesso de crawlers de IA, avalia o que o seu robots.txt declara. Esta verificação avalia o que realmente acontece na rede. As duas situações frequentemente não coincidem e, quando isso acontece, a firewall prevalece.
Como corrigir
- Consulte o painel da sua CDN ou do seu produto de segurança para verificar se existe um bloqueio de bots de IA. No Cloudflare, procure em Security por "AI bots" ou "Bot Fight Mode"; outros fornecedores, como a Akamai, a Imperva e a DataDome, têm opções equivalentes. Por vezes, estas opções estão ativadas por predefinição.
- Se o bloqueio não for intencional, desative a opção ou adicione à sua lista de permissões os crawlers específicos que pretende permitir.
- Se tiver regras próprias de firewall ou de servidor que correspondam a user agents de bots, remova as entradas dos crawlers de IA que pretende admitir.
- Se bloquear crawlers de IA deliberadamente, o resultado — é uma escolha legítima.
Como a Silktide testa isto
- Solicita a sua página inicial com a identidade de um browser normal. Se esse pedido for recusado ou sujeito a um desafio, a verificação não é aplicável — nada pode ser atribuído a uma discriminação contra crawlers.
- Solicita novamente a página inicial, identificando-se como cada um dos principais crawlers de IA (GPTBot, ClaudeBot, PerplexityBot e CCBot), utilizando as strings de User-Agent publicadas pelos respetivos operadores. Todos os pedidos provêm do mesmo local, pelo que qualquer diferença na resposta se deve à identidade do crawler.
- Considera um crawler bloqueado quando o seu pedido recebe um estado de recusa direta (por exemplo,
403 Forbidden,429 Too Many Requestsou503), uma página de desafio ou que um crawler não consegue resolver, ou nenhuma resposta, enquanto o pedido do browser foi bem-sucedido. - Emite um aviso quando qualquer crawler é recusado, indicando quais.
Todos os pedidos têm como destino apenas a página inicial e são executados uma vez por teste.
Resolução de problemas
Verificamos os crawlers pela rede de origem, não apenas pelo nome
Alguns sites só permitem pedidos provenientes de endereços de rede verificados do operador de um crawler. A sonda da Silktide envia a identidade publicada do crawler a partir da sua própria rede, pelo que um site deste tipo pode recusar a sonda enquanto permite o crawler real. Esta configuração é muito menos comum do que o bloqueio geral por identidade; se tiver confirmado que a utiliza, aprove o resultado.
A verificação é aprovada, mas os assistentes continuam a não encontrar o meu conteúdo
Conseguir entrar é necessário, mas não é suficiente. Verifique se o seu robots.txt permite crawlers de IA (acesso de crawlers de IA) e se o seu conteúdo não requer para aparecer (Conteúdo sem JavaScript).