Robots.txt
Os sítios Web devem disponibilizar um ficheiro robots.txt, que indica aos rastreadores dos motores de pesquisa quais as partes do sítio que podem visitar. A Silktide verifica se o seu sítio Web disponibiliza um.
Um ficheiro encontra-se na raiz do sítio — para example.com, tem de estar em example.com\/robots.txt. Para permitir o acesso de todos os rastreadores a todo o conteúdo, o ficheiro pode ser tão simples como:
# Permitir que todos os rastreadores acedam a tudo
User-agent: *
Disallow:
Porque é importante
Os rastreadores solicitam o robots.txt antes de qualquer outra coisa e a sua ausência deixa-o sem a forma padrão de os orientar — afastando-os de páginas de resultados de pesquisa, filtros facetados ou outros URLs que desperdiçam o orçamento de rastreio. É também aqui que declara a localização do seu através de uma linha Sitemap:.
Mesmo para um sítio que pretenda que todo o conteúdo seja rastreado, um robots.txt explícito deixa essa intenção clara, em vez de obrigar os rastreadores a inferi-la a partir de uma resposta de erro.
Como corrigir
- Crie um ficheiro de texto simples chamado
robots.txte coloque-o na pasta raiz do seu sítio Web, para que seja disponibilizado emhttps:\/\/example.com\/robots.txt. - Comece com uma configuração permissiva (como no exemplo acima) e adicione regras
Disallowapenas para as áreas que os rastreadores devem ignorar. - Adicione uma linha
Sitemap:que aponte para o seu mapa do sítio XML:
User-agent: *
Disallow: \/search\/
Sitemap: https:\/\/example.com\/sitemap.xml
- Confirme que o ficheiro é carregado num navegador e que é devolvido normalmente, e não como uma página de erro. Muitos sistemas de gestão de conteúdos podem gerá-lo e disponibilizá-lo por si.
Como a Silktide testa isto
- Utilize o URL inicial de cada do seu sítio Web.
- Solicite
\/robots.txtna raiz desse host. - A verificação passa se a solicitação devolver o estado HTTP 200 (OK); a secção é assinalada se o ficheiro estiver em falta, devolver um erro ou não puder ser transferido.
Resolução de problemas
Tenho um robots.txt, mas a verificação falha
O ficheiro tem de ser disponibilizado com o estado HTTP 200. Alguns servidores devolvem uma página de erro «suave» — uma página que parece ser um erro, mas que inclui um redirecionamento ou um estado de erro — ou bloqueiam completamente as solicitações automatizadas. Teste o URL diretamente e verifique o código de estado, idealmente através das ferramentas de programador do seu navegador ou a partir de uma rede diferente.
O robots.txt impede que as páginas apareçam nos resultados de pesquisa?
Não de forma fiável. Disallow impede o rastreio, mas uma página pode continuar a ser indexada através de ligações existentes noutros locais. Para impedir que uma página apareça nos resultados, utilize — consulte Página definida como noindex.