Avançar para o conteúdo
SilktideAjuda

Robots.txt

Os sítios Web devem disponibilizar um ficheiro robots.txt, que indica aos rastreadores dos motores de pesquisa quais as partes do sítio que podem visitar. A Silktide verifica se o seu sítio Web disponibiliza um.

Um ficheiro encontra-se na raiz do sítio — para example.com, tem de estar em example.com\/robots.txt. Para permitir o acesso de todos os rastreadores a todo o conteúdo, o ficheiro pode ser tão simples como:

# Permitir que todos os rastreadores acedam a tudo
User-agent: *
Disallow:

Porque é importante

Os rastreadores solicitam o robots.txt antes de qualquer outra coisa e a sua ausência deixa-o sem a forma padrão de os orientar — afastando-os de páginas de resultados de pesquisa, filtros facetados ou outros URLs que desperdiçam o orçamento de rastreio. É também aqui que declara a localização do seu através de uma linha Sitemap:.

Mesmo para um sítio que pretenda que todo o conteúdo seja rastreado, um robots.txt explícito deixa essa intenção clara, em vez de obrigar os rastreadores a inferi-la a partir de uma resposta de erro.

Como corrigir

  1. Crie um ficheiro de texto simples chamado robots.txt e coloque-o na pasta raiz do seu sítio Web, para que seja disponibilizado em https:\/\/example.com\/robots.txt.
  2. Comece com uma configuração permissiva (como no exemplo acima) e adicione regras Disallow apenas para as áreas que os rastreadores devem ignorar.
  3. Adicione uma linha Sitemap: que aponte para o seu mapa do sítio XML:
User-agent: *
Disallow: \/search\/

Sitemap: https:\/\/example.com\/sitemap.xml
  1. Confirme que o ficheiro é carregado num navegador e que é devolvido normalmente, e não como uma página de erro. Muitos sistemas de gestão de conteúdos podem gerá-lo e disponibilizá-lo por si.

Como a Silktide testa isto

  1. Utilize o URL inicial de cada do seu sítio Web.
  2. Solicite \/robots.txt na raiz desse host.
  3. A verificação passa se a solicitação devolver o estado HTTP 200 (OK); a secção é assinalada se o ficheiro estiver em falta, devolver um erro ou não puder ser transferido.

Resolução de problemas

Tenho um robots.txt, mas a verificação falha

O ficheiro tem de ser disponibilizado com o estado HTTP 200. Alguns servidores devolvem uma página de erro «suave» — uma página que parece ser um erro, mas que inclui um redirecionamento ou um estado de erro — ou bloqueiam completamente as solicitações automatizadas. Teste o URL diretamente e verifique o código de estado, idealmente através das ferramentas de programador do seu navegador ou a partir de uma rede diferente.

O robots.txt impede que as páginas apareçam nos resultados de pesquisa?

Não de forma fiável. Disallow impede o rastreio, mas uma página pode continuar a ser indexada através de ligações existentes noutros locais. Para impedir que uma página apareça nos resultados, utilize — consulte Página definida como noindex.

Saiba mais

Última atualização

Esta página foi útil?