Política de acesso de crawlers de IA
Uma política de acesso de crawlers de IA é uma configuração deliberada de (e, por vezes, de firewall) que indica quais sistemas de IA podem aceder às suas páginas públicas — e para que finalidade. É situacional porque a resposta “certa” depende de dar mais importância a ser citado nas respostas de assistentes, a manter o conteúdo fora do treino de modelos, ou a ambos. O que não é situacional é tratar um modelo copiado de “bloquear toda a IA” como se fosse uma medida neutra de reforço da segurança. Essa escolha tem consequências de marketing.
Ao longo desta página, suponha que a Fernwood quer aparecer nas respostas do ChatGPT e do Claude sobre gestão de despesas, mas a sua equipa jurídica prefere não contribuir com novas páginas para os conjuntos de dados de treino de modelos fundacionais.
Esta técnica diz respeito ao acesso. Quando um crawler obtém acesso, ainda tem de receber HTML real — consulte Conteúdo legível sem JavaScript — e um mapa opcional e selecionado é abordado separadamente em llms.txt.
Por que isto é situacional
Os produtos de IA já não utilizam um único “bot de IA”. Os principais fornecedores dividem os crawlers por função:
| Função | Bots típicos | O que o bloqueio faz |
|---|---|---|
| Treino de modelos | OpenAI GPTBot, Anthropic ClaudeBot, Common Crawl CCBot, Google Google-Extended (controlo do treino/grounding do Gemini — não é o Googlebot) | Indica que o conteúdo não deve ser utilizado para treino (ou, no caso do Google-Extended, para treinar o Gemini ou alimentar determinadas funcionalidades de IA). Por si só, não remove o seu site da Pesquisa Google clássica. |
| Indexação para pesquisa/respostas | OpenAI OAI-SearchBot, Anthropic Claude-SearchBot, PerplexityBot | Reduz ou elimina a elegibilidade para o seu conteúdo ser apresentado e citado nas respostas de pesquisa desse produto. |
| Acesso acionado pelo utilizador | OpenAI ChatGPT-User, Anthropic Claude-User, agentes semelhantes de “o utilizador pediu este URL” | Controla os acessos em tempo real quando uma pessoa indica uma página ao assistente. As regras dos fornecedores diferem quanto a estes agentes respeitarem o robots.txt — consulte a documentação atual do fornecedor antes de presumir que um Disallow funciona. |
A própria documentação dos crawlers da OpenAI afirma explicitamente a independência: um webmaster pode permitir que o OAI-SearchBot apareça nas funcionalidades de pesquisa do ChatGPT e, ao mesmo tempo, impedir o GPTBot, para que o conteúdo rastreado não seja utilizado no treino de modelos generativos fundacionais. A Anthropic documenta a mesma divisão em três para o ClaudeBot (treino), o Claude-SearchBot (qualidade da pesquisa) e o Claude-User (obtenção de conteúdo dirigida pelo utilizador).
Por isso, a questão da política não é “IA: ligada ou desligada?”. São três decisões separadas que devem corresponder à tolerância ao risco e aos objetivos de AEO da Fernwood.
Normalmente permita crawlers de pesquisa/respostas quando:
- Quer que os assistentes citem a documentação, a investigação e as páginas de comparação da Fernwood.
- Os concorrentes já aparecem nessas respostas e a sua empresa não.
- A verificação de acesso de crawlers de IA da Silktide apresenta um aviso porque um modelo bloqueou tudo por acidente.
Bloqueie ou limite frequentemente os crawlers de treino quando:
- A política jurídica ou da marca proíbe contribuir com conteúdo do site para o treino de modelos de terceiros.
- Publica investigação própria, lógica de preços ou material adjacente a conteúdo protegido que deve permanecer fora dos conjuntos de dados de treino, mesmo que ainda queira citações em tempo real.
Bloqueie de forma abrangente quando:
- O site não é público, está em ambiente de testes ou não tem qualquer razão de marketing para aparecer nas respostas de assistentes (intranet, interface de uma aplicação ou portal de parceiros).
- Tomou uma decisão consciente de produto de ficar totalmente fora das respostas de IA — e está disposto a perder esse canal.
Como decidir (folha de trabalho da Fernwood)
Siga estes passos pela ordem indicada. Registe as respostas; o ficheiro robots.txt é apenas a codificação da folha de trabalho.
- Queremos ser citados em respostas de IA? Se não, não permita os principais bots de pesquisa/respostas e aprove o aviso da Silktide. Se sim, continue.
- Quais são os assistentes relevantes? O ChatGPT, o Claude, o Perplexity, as funcionalidades de IA da Google e outros têm os seus próprios agentes. Dê prioridade aos que os seus compradores realmente utilizam.
- É necessário optar por não participar no treino? Se a resposta da equipa jurídica for sim, não permita os agentes de treino (
GPTBot,ClaudeBot,Google-Extended,CCBote equivalentes), mantendo os agentes de pesquisa permitidos quando o fornecedor suporta essa separação. - Existem caminhos que têm de permanecer privados em qualquer caso?
/app/,/internal/, URLs de pré-visualização de rascunhos — não os permita para*(e confirme que a autenticação continua a protegê-los; o robots.txt não é um mecanismo de controlo de acesso). - O HTML pode realmente ser obtido? Um robots.txt permissivo com uma shell SPA vazia continua a falhar no AEO — corrija a renderização em seguida.
Implementar a política no robots.txt
O robots.txt está em https://fernwood.example/robots.txt. As regras aplicam-se por grupo de user-agent. Os grupos mais específicos substituem o grupo abrangente para esse agente. Prefira agentes identificados pelo nome em vez de esperar que User-agent: * exprima a sua política de IA — os modelos que definem Disallow: / em * também prejudicam o Googlebot e todos os outros.
Padrão A — Visível nas respostas, fora do treino (comum em sites orientados para AEO)
# OpenAI: citar na pesquisa do ChatGPT, não utilizar para o treino de modelos fundacionais
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
# Anthropic: permitir a indexação para pesquisa; bloquear o rastreio para treino
User-agent: Claude-SearchBot
Allow: /
User-agent: ClaudeBot
Disallow: /
# Google: o Googlebot (Pesquisa) é separado; o Google-Extended controla o treino do Gemini/as funcionalidades de IA
User-agent: Google-Extended
Disallow: /
# Manter os caminhos privados da aplicação fechados para todos
User-agent: *
Disallow: /app/
Disallow: /internal/
A OpenAI indica que as alterações ao robots.txt para a pesquisa podem demorar cerca de 24 horas a produzir efeitos. Verifique novamente depois de publicar.
Padrão B — Totalmente aberto (alcance máximo nos motores de resposta)
Omita as regras Disallow específicas para IA. Certifique-se de que nada em User-agent: * bloqueia acidentalmente todo o site. Proteja, ainda assim, os caminhos privados.
Padrão C — Totalmente fechado aos produtos de IA
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-SearchBot
Disallow: /
User-agent: Claude-User
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Utilize esta opção apenas como uma escolha consciente. Em seguida, o aviso de crawlers de IA da Silktide para que a ocorrência deixe de contar contra o site.
Verifique quem está realmente a aceder ao site
As strings de User-Agent são fáceis de falsificar. Quando precisar de certeza, prefira as listas de IP publicadas pelos fornecedores:
- A OpenAI publica um JSON com os IPs dos crawlers (associado à documentação dos bots da OpenAI).
- A Anthropic publica os IPs dos crawlers em claude.com/crawling/bots.json.
Bloquear apenas por IP, sem um sinal no robots.txt, é frágil — a Anthropic observa que os bloqueios por IP podem interferir com a capacidade do bot de ler o robots.txt e concluir corretamente a exclusão.
O que o robots.txt não resolve
- Falsos positivos de firewall/gestão de bots. Um firewall de aplicações web (WAF) — a camada de filtragem que serviços como o Cloudflare colocam à frente de um site — que desafia ou devolve 403 a clientes “que não são navegadores” pode bloquear o GPTBot mesmo quando o robots.txt o permite. A Silktide testa isso separadamente em crawlers de IA bloqueados na prática.
- Shells JavaScript vazias. Permitir que o crawler aceda a um
<div id="root"></div>não ajuda ninguém. Combine esta técnica com Conteúdo legível sem JavaScript. - Um aumento mágico de classificação. Permitir crawlers torna a citação possível. Páginas citáveis, datas, identidade e evidências continuam a decidir se será escolhido — consulte Estrutura de página orientada para respostas e Marcação da identidade da organização.
llms.txtcomo substituto. Um ficheiro de índice não pode substituir umDisallow. Consulte llms.txt.
Como a Silktide ajuda
- Acesso de crawlers de IA analisa o robots.txt em relação a uma lista de user agents de IA conhecidos e avisa quando a raiz do site não é permitida — como um aviso que pode aprovar quando o bloqueio é intencional.
- Crawlers de IA bloqueados na prática faz pedidos como esses crawlers para detetar bloqueios de firewall e de edge que o robots.txt não consegue explicar.
- Conteúdo sem JavaScript deteta o modo de falha “permitido, mas vazio”.
Relacionado
- Acesso de crawlers de IA — a verificação da Silktide que esta técnica desenvolve
- Conteúdo legível sem JavaScript
- llms.txt — índice selecionado opcional depois de resolver o acesso
- Documentação dos crawlers da OpenAI
- Documentação dos crawlers da Anthropic
- Visão geral dos crawlers da Google (incluindo o Google-Extended)
- Especificação do robots.txt (RFC 9309)