Robots.txt
Websites sollten eine robots.txt-Datei bereitstellen, die Suchmaschinen-Crawlern mitteilt, welche Teile der Website sie besuchen dürfen. Silktide prüft, ob Ihre Website eine solche Datei ausliefert.
Eine -Datei befindet sich im Stammverzeichnis der Website – für example.com muss sie unter example.com/robots.txt liegen. Um Crawler überall zuzulassen, kann die Datei so einfach sein wie:
# Allen Crawlern Zugriff auf alles erlauben
User-agent: *
Disallow:
Warum das wichtig ist
Crawler rufen robots.txt vor allem anderen ab, und ihr Fehlen nimmt Ihnen die standardisierte Möglichkeit, sie zu steuern – weg von Suchergebnisseiten, Facettenfiltern oder anderen URLs, die Crawl-Budget verschwenden. Außerdem geben Sie hier mit einer Sitemap:-Zeile den Speicherort Ihrer an.
Selbst für eine Website, die alles crawlen lassen möchte, macht eine explizite robots.txt diese Absicht deutlich, statt Crawler sie aus einer Fehlermeldung ableiten zu lassen.
So beheben Sie das
- Erstellen Sie eine einfache Textdatei mit dem Namen
robots.txtund legen Sie sie im Stammordner Ihrer Website ab, sodass sie unterhttps://example.com/robots.txtausgeliefert wird. - Beginnen Sie großzügig (wie im obigen Beispiel) und fügen Sie
Disallow-Regeln nur für Bereiche hinzu, die Crawler überspringen sollen. - Fügen Sie eine
Sitemap:-Zeile hinzu, die auf Ihre XML-Sitemap verweist:
User-agent: *
Disallow: /search/
Sitemap: https://example.com/sitemap.xml
- Prüfen Sie, dass die Datei im Browser geladen wird und eine normale Antwort zurückgibt, nicht eine Fehlerseite. Viele Content-Management-Systeme können sie für Sie erzeugen und ausliefern.
So testet Silktide das
- Silktide nimmt die Start-URL jedes Ihrer Website.
- Ruft im Root-Verzeichnis dieses Hosts
/robots.txtab. - Bestanden, wenn die Anfrage den HTTP-Status 200 (OK) zurückgibt; der Bereich wird gekennzeichnet, wenn die Datei fehlt, einen Fehler zurückgibt oder nicht heruntergeladen werden kann.
Fehlerbehebung
Ich habe eine robots.txt, aber der Check schlägt fehl
Die Datei muss mit dem HTTP-Status 200 ausgeliefert werden. Manche Server liefern eine „weiche“ Fehlerseite – eine Seite, die wie ein Fehler aussieht, aber eine Weiterleitung oder einen Fehlerstatus mitführt – oder blockieren automatisierte Anfragen vollständig. Testen Sie die URL direkt und prüfen Sie den Statuscode, idealerweise mit den Entwicklertools Ihres Browsers oder aus einem anderen Netzwerk.
Hält robots.txt Seiten aus den Suchergebnissen heraus?
Nicht zuverlässig. Disallow stoppt das Crawlen, aber eine Seite kann über Verweise anderswo dennoch indexiert werden. Um eine Seite zuverlässig aus den Ergebnissen fernzuhalten, verwenden Sie stattdessen – siehe Seite auf noindex gesetzt.