Naar inhoud springen
SilktideHelp

Robots.txt

Websites moeten een robots.txt-bestand aanbieden. Dit bestand vertelt crawlers van zoekmachines welke delen van de website ze mogen bezoeken. Silktide controleert of je website zo'n bestand aanbiedt.

Een -bestand staat in de hoofdmap van de website. Voor example.com moet het bijvoorbeeld beschikbaar zijn op example.com/robots.txt. Om crawlers overal toegang toe te staan, kan het bestand zo eenvoudig zijn als:

# Alle crawlers toegang geven tot alles
User-agent: *
Disallow:

Waarom dit belangrijk is

Crawlers vragen robots.txt op voordat ze iets anders doen. Als het bestand ontbreekt, heb je geen standaardmanier om crawlers weg te sturen van pagina's met zoekresultaten, filters met meerdere facetten of andere URL's die crawlbudget verspillen. Hier geef je ook de locatie van je op met een regel Sitemap:.

Zelfs voor een website waarvan alles gecrawld mag worden, maakt een expliciet robots.txt-bestand die bedoeling duidelijk, in plaats van crawlers dit te laten afleiden uit een foutmelding.

Zo los je dit op

  1. Maak een tekstbestand met de naam robots.txt en plaats het in de hoofdmap van je website, zodat het beschikbaar is op https://example.com/robots.txt.
  2. Begin met een permissieve configuratie (zoals in het bovenstaande voorbeeld) en voeg alleen Disallow-regels toe voor delen die crawlers moeten overslaan.
  3. Voeg een regel Sitemap: toe die naar je XML-sitemap verwijst:
User-agent: *
Disallow: /search/

Sitemap: https://example.com/sitemap.xml
  1. Controleer of het bestand in een browser wordt geladen en normaal wordt teruggegeven in plaats van een foutpagina. Veel contentmanagementsystemen kunnen het bestand voor je genereren en aanbieden.

Zo test Silktide dit

  1. Neem de homepage-URL van elke van je website.
  2. Vraag /robots.txt op in de hoofdmap van die host.
  3. De test slaagt als het verzoek HTTP-status 200 (OK) retourneert. De sectie wordt gemarkeerd als het bestand ontbreekt, een fout retourneert of niet kan worden gedownload.

Problemen oplossen

Ik heb een robots.txt-bestand, maar de controle mislukt

Het bestand moet worden aangeboden met HTTP-status 200. Sommige servers retourneren een 'soft error'-pagina: een pagina die eruitziet als een foutmelding, maar een omleidings- of foutstatus heeft. Andere servers blokkeren geautomatiseerde verzoeken volledig. Test de URL rechtstreeks en controleer de statuscode, bij voorkeur met de ontwikkelaarstools van je browser of vanaf een ander netwerk.

Houdt robots.txt pagina's uit de zoekresultaten?

Niet betrouwbaar. Disallow voorkomt dat een pagina wordt gecrawld, maar de pagina kan nog steeds worden geïndexeerd via links elders. Gebruik in plaats daarvan om een pagina uit de resultaten te houden. Zie Pagina ingesteld op noindex.

Meer informatie

Laatst bijgewerkt

Was deze pagina nuttig?

Robots.txt | Silktide Help