Zugriff von KI-Crawlern
KI-Assistenten wie ChatGPT, Claude und Perplexity lesen das Web mit ihren eigenen automatisierten Crawlern. Silktide prüft, ob Ihre Website diesen Crawlern den Zugang untersagt – was in der Regel bedeutet, dass KI-Assistenten Ihre Inhalte nicht lesen, zitieren oder empfehlen können.
Websites steuern den Zugriff von Crawlern über eine -Datei. Eine einzige Regel in dieser Datei kann alle großen KI-Systeme aussperren:
# Sperrt den Crawler von OpenAI für die gesamte Website
User-agent: GPTBot
Disallow: \/
Das Blockieren von kann eine bewusste Entscheidung sein, etwa um sich vom Modelltraining abzumelden. Weil dies mitunter beabsichtigt ist, meldet Silktide dies als Warnung, die Sie genehmigen können, statt als bestätigten Fehler.
Warum das wichtig ist
Immer mehr Menschen fragen einen KI-Assistenten statt einer Suchmaschine. Diese Assistenten können nur Websites beschreiben, zitieren und verlinken, die ihre Crawler lesen dürfen. Wenn Ihre Website sie blockiert, erscheinen stattdessen Inhalte der Konkurrenz in den Antworten – und Sie verlieren Besucher, ohne jemals einen Fehler zu sehen.
Viele robots.txt-Dateien blockieren KI-Crawler versehentlich: Die Regeln wurden aus einer Vorlage oder einem Security-Hardening-Leitfaden übernommen, ohne dass jemand bemerkte, was dadurch ausgeschlossen wird. Diese Prüfung macht das sichtbar, damit die Sperre eine Entscheidung ist und kein Versehen.
So beheben Sie das
- Öffnen Sie die robots.txt Ihrer Website (unter
https:\/\/yoursite.com\/robots.txt) und suchen Sie nach Regeln, die die blockierten Crawler namentlich nennen, oder nach einerUser-agent: *-Regel mitDisallow: \/, die alles sperrt. - Ist die Sperre unbeabsichtigt, entfernen Sie diese Regeln oder beschränken Sie sie auf die Pfade, die wirklich privat bleiben sollen, und veröffentlichen Sie die Datei anschließend erneut:
# Vorher: sperrt die gesamte Website
User-agent: GPTBot
Disallow: \/
# Nachher: erlaubt die Website, behält einen Bereich privat
User-agent: GPTBot
Disallow: \/internal\/
- Ist die Sperre beabsichtigt – z. B. weil Sie nicht möchten, dass Ihre Inhalte
für das KI-Training verwendet werden –, Sie den
Fund. Beachten Sie, dass manche Crawler Trainingsdaten liefern und andere
Live-Antworten, sodass Sie auch selektiv sperren können: Wenn Sie
OAI-SearchBoterlauben, aberGPTBotblockieren, bleiben Sie in der ChatGPT-Suche sichtbar, ohne zum Training beizutragen.
So testet Silktide dies
- Ruft die robots.txt aus dem Root Ihrer Website ab.
- Existiert die Datei nicht oder kann sie nicht abgerufen werden, besteht die Prüfung: Keine robots.txt bedeutet, dass kein Crawler blockiert ist.
- Parst die Regeln und testet jeden aus einer Liste von rund 20 bekannten KI-Crawler-User-Agents (darunter GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended, Applebot-Extended und CCBot) gegen das Site-Root.
- Warnt, wenn einer oder mehrere dieser Crawler am Root blockiert sind, und listet die blockierten Crawler auf.
Fehlerbehebung
Die Prüfung besteht, aber KI-Assistenten können meine Website trotzdem nicht lesen
Diese Prüfung liest nur Ihre robots.txt-Regeln. Ein Crawler, der auf dem Papier erlaubt ist, kann in der Praxis dennoch durch eine Firewall oder Bot-Schutz blockiert werden – siehe KI-Crawler in der Praxis blockiert. Inhalte, die erst nach Ausführung von erscheinen, können für KI-Crawler ebenfalls unsichtbar sein – siehe Inhalte ohne JavaScript verfügbar.
Ich blockiere KI-Crawler absichtlich
Das ist eine legitime Entscheidung. Genehmigen Sie den Fund, dann wird er Ihrer Website nicht negativ angerechnet. Überlegen Sie, ob Sie alle KI-Crawler sperren möchten oder nur diejenigen, die fürs Modelltraining verwendet werden.
Mehr erfahren
- Richtlinie zum Zugriff von KI-Crawlern - Trainings- vs. Such- vs. User-Fetch-Bots sowie Beispielmuster für robots.txt
- Inhalte ohne JavaScript lesbar - wenn der Crawler zwar zugelassen ist, Ihre Inhalte aber trotzdem nicht sehen kann
- llms.txt - optionaler kuratierter Index für KI-Tools (kein Ersatz dafür, Crawler zuzulassen)
- KI-Crawler in der Praxis blockiert
- Inhalte ohne JavaScript verfügbar
- OpenAI-Crawler-Dokumentation
- Google-Extended-Dokumentation
- robots.txt-Spezifikation (RFC 9309)