robots.txt
robots.txt ist eine einfache Textdatei im Stammverzeichnis einer Website (zum Beispiel https:\/\/example.com\/robots.txt), die automatisierten mitteilt, welche Bereiche der Website sie abrufen dürfen.
User-agent: GPTBot
Disallow: \/
User-agent: *
Allow: \/
Jede Regel benennt einen Crawler (oder * für alle) und führt die Pfade auf, die er besuchen darf bzw. die ihm untersagt sind. Suchmaschinen und prüfen diese Datei, bevor sie Seiten abrufen; daher kann bereits eine einzige Disallow-Zeile eine gesamte Website für einen KI-Assistenten unsichtbar machen – manchmal beabsichtigt, oft jedoch versehentlich. robots.txt steuert das Crawling, nicht die Indexierung: Das Blockieren einer Seite hier entfernt sie nicht aus den Suchergebnissen, so wie es tut, und kann sogar nach hinten losgehen, weil dabei das noindex-Tag selbst verborgen wird.
Weiterführende Informationen
- Einführung und Leitfaden zu robots.txt - praktischer Leitfaden von Google
- RFC 9309: Robots Exclusion Protocol - der formale IETF-Standard