Richtlinie für den Zugriff von KI-Crawlern
Eine Richtlinie für den Zugriff von KI-Crawlern ist eine bewusst konfigurierte - (und manchmal Firewall-)Einstellung, die festlegt, welche KI-Systeme Ihre öffentlichen Seiten abrufen dürfen – und zu welchem Zweck. Sie ist situationsabhängig, weil die „richtige“ Entscheidung davon abhängt, ob Ihnen Sichtbarkeit in Antworten von KI-Assistenten, ein Opt-out aus dem Training von Modellen oder beides wichtiger ist. Nicht situationsabhängig ist es jedoch, eine eingefügte „Blockiere alle KI“-Vorlage als neutrale Sicherheits-Härtung zu behandeln. Diese Entscheidung hat Marketingauswirkungen.
Im Folgenden nehmen wir an, dass Fernwood in Antworten von ChatGPT und Claude zum Thema Spesenmanagement erscheinen möchte, das Rechtsteam aber lieber keine neuen Seiten in Trainingskorpora für Foundation‑Modelle beitragen will.
Diese Technik betrifft den Zugriff. Selbst wenn ein Crawler zugelassen ist, muss er noch echtes HTML erhalten – siehe Ohne JavaScript lesbare Inhalte. Eine optionale kuratierte Karte wird separat in llms.txt behandelt.
Warum dies situationsabhängig ist
KI‑Produkte verwenden nicht mehr einen einzigen „KI‑Bot“. Große Anbieter trennen Crawler nach Aufgabe:
| Aufgabe | Typische Bots | Wirkung einer Sperre |
|---|---|---|
| Training von Modellen | OpenAI GPTBot, Anthropic ClaudeBot, Common Crawl CCBot, Google Google-Extended (Steuerung für Gemini-Training/Grounding – nicht Googlebot) | Signalisiert, dass Inhalte nicht zum Training verwendet werden sollen (bzw. bei Google-Extended, nicht zum Training von Gemini/zur Bereitstellung bestimmter KI-Funktionen). Entfernt Sie allein dadurch nicht aus der klassischen Google-Suche. |
| Suche / Antwortindexierung | OpenAI OAI-SearchBot, Anthropic Claude-SearchBot, PerplexityBot | Reduziert oder entfernt die Eignung, in den suchähnlichen Antworten dieses Produkts angezeigt und zitiert zu werden. |
| Nutzergesteuerter Abruf | OpenAI ChatGPT-User, Anthropic Claude-User, ähnliche „Nutzer hat diese URL angefordert“-KI-Agenten | Steuert Live-Abrufe, wenn eine Person den KI-Assistenten auf eine Seite lenkt. Die Regeln der Anbieter unterscheiden sich, ob robots.txt für diese KI-Agenten beachtet wird – prüfen Sie die aktuellen Anbieter-Dokumente, bevor Sie annehmen, dass ein Disallow wirkt. |
OpenAIs eigene Crawler-Dokumentation macht diese Unabhängigkeit explizit: Ein Webmaster kann OAI-SearchBot für ChatGPT-Suchfunktionen zulassen und gleichzeitig GPTBot untersagen, sodass gecrawlte Inhalte nicht für das Training generativer Foundation‑Modelle genutzt werden. Anthropic dokumentiert die gleiche Dreiteilung für ClaudeBot (Training), Claude-SearchBot (Suche) und Claude-User (nutzergesteuerte Abholung).
Die Richtlinienfrage lautet also nicht „KI: an oder aus?“. Es sind drei getrennte Entscheidungen, die zu Fernwoods Risikotoleranz und AEO‑Zielen passen sollten.
Such-/Antwort‑Crawler in der Regel zulassen, wenn:
- Sie möchten, dass KI‑Assistenten Fernwoods Doku, Forschung und Vergleichsseiten zitieren.
- Wettbewerber bereits in solchen Antworten erscheinen, Sie jedoch nicht.
- Die Silktide‑Prüfung Zugriff für KI‑Crawler warnt, weil eine Vorlage versehentlich alles blockiert hat.
Trainings‑Crawler oft blockieren oder einschränken, wenn:
- Rechtliche Vorgaben oder Markenrichtlinien untersagen, Inhalte der Website zum Training fremder Modelle beizutragen.
- Sie proprietäre Forschung, Preislogik oder nahezu geschützte Inhalte veröffentlichen, die nicht in Trainingskorpora landen dürfen – selbst wenn Sie weiterhin Live‑Zitate wünschen.
Breit blockieren, wenn:
- Die Website nicht öffentlich ist, sich im Staging befindet oder keinen Marketinggrund hat, in Antworten von KI‑Assistenten aufzutauchen (Intranet, reine App‑UI, Partnerportal).
- Sie bewusst entschieden haben, vollständig aus KI‑Antworten herauszubleiben – und bereit sind, diesen Kanal zu verlieren.
Entscheidungshilfe (Fernwoods Arbeitsblatt)
Arbeiten Sie diese Punkte der Reihe nach ab. Schreiben Sie die Antworten auf; die robots.txt ist nur die technische Kodierung des Arbeitsblatts.
- Wollen wir überhaupt in KI‑Antworten zitiert werden? Wenn nein, untersagen Sie die wichtigsten Such-/Antwort‑Bots und genehmigen Sie die Silktide‑Warnung. Wenn ja, weiter.
- Welche KI‑Assistenten sind relevant? ChatGPT, Claude, Perplexity, Google‑KI‑Funktionen u. a. haben jeweils eigene KI‑Agenten. Priorisieren Sie die, die Ihre Käufer tatsächlich nutzen.
- Ist ein Opt‑out fürs Training vorgeschrieben? Wenn die Rechtsabteilung ja sagt, untersagen Sie Trainings‑KI‑Agenten (
GPTBot,ClaudeBot,Google-Extended,CCBotu. a.), während Such‑KI‑Agenten erlaubt bleiben, wo der Anbieter die Trennung unterstützt. - Gibt es Pfade, die auf jeden Fall privat bleiben müssen?
\/app\/,\/internal\/, Entwurfs‑Preview‑URLs – für*untersagen (und sicherstellen, dass Authentifizierung sie weiterhin schützt; robots.txt ist keine Zugriffskontrolle). - Ist das HTML tatsächlich abrufbar? Eine großzügige robots.txt mit einer leeren SPA‑Hülle scheitert trotzdem an AEO – als Nächstes das Rendering beheben.
Umsetzung der Richtlinie in robots.txt
Robots.txt liegt unter https:\/\/fernwood.example\/robots.txt. Regeln gelten pro User‑Agent‑Gruppe. Spezifischere Gruppen überschreiben den Catch‑all für diesen Agent. Bevorzugen Sie benannte User‑Agents, statt zu hoffen, dass User-agent: * Ihre KI‑Richtlinie ausdrückt – Vorlagen, die Disallow: \/ unter * setzen, bremsen auch Googlebot und alle anderen aus.
Muster A – In Antworten sichtbar, aber nicht fürs Training (häufig bei AEO‑orientierten Websites)
# OpenAI: in der ChatGPT-Suche zitieren, aber nicht für Foundation-Model-Training nutzen
User-agent: OAI-SearchBot
Allow: \/
User-agent: GPTBot
Disallow: \/
# Anthropic: Suchindexierung erlauben; Trainingscrawl blockieren
User-agent: Claude-SearchBot
Allow: \/
User-agent: ClaudeBot
Disallow: \/
# Google: Googlebot (Suche) ist separat; Google-Extended steuert Gemini-Training \/ KI-Funktionen
User-agent: Google-Extended
Disallow: \/
# Private App-Pfade für alle sperren
User-agent: *
Disallow: \/app\/
Disallow: \/internal\/
OpenAI weist darauf hin, dass Änderungen an robots.txt für die Suche in der Größenordnung von etwa 24 Stunden wirksam werden. Prüfen Sie nach der Veröffentlichung erneut.
Muster B – Vollständig offen (maximale Reichweite in Antwortmaschinen)
Lassen Sie KI‑spezifische Disallow‑Regeln weg. Stellen Sie sicher, dass nichts unter User-agent: * versehentlich die gesamte Site sperrt. Private Pfade dennoch schützen.
Muster C – Vollständig für KI‑Produkte geschlossen
User-agent: GPTBot
Disallow: \/
User-agent: OAI-SearchBot
Disallow: \/
User-agent: ClaudeBot
Disallow: \/
User-agent: Claude-SearchBot
Disallow: \/
User-agent: Claude-User
Disallow: \/
User-agent: PerplexityBot
Disallow: \/
User-agent: Google-Extended
Disallow: \/
User-agent: CCBot
Disallow: \/
Verwenden Sie dies nur als bewusste Entscheidung. Sie anschließend Silktides Warnung zu KI‑Crawlern, damit der Befund nicht länger gegen die Website zählt.
Prüfen, wer Sie tatsächlich aufruft
User‑Agent‑Strings sind trivial zu fälschen. Bevorzugen Sie von Anbietern veröffentlichte IP‑Listen, wenn Sie Gewissheit brauchen:
- OpenAI veröffentlicht Crawler‑IP‑JSON (verlinkt in den OpenAI‑Bot‑Docs).
- Anthropic veröffentlicht Crawler‑IPs unter claude.com/crawling/bots.json.
Allein nach IP zu blockieren – ohne ein robots.txt‑Signal – ist unzuverlässig. Anthropic weist darauf hin, dass IP‑Sperren die Fähigkeit des Bots beeinträchtigen können, Ihre robots.txt zu lesen und ein Opt‑out sauber abzuschließen.
Was robots.txt nicht behebt
- Firewall-/Bot‑Management‑Fehlalarme. Eine Web Application Firewall (WAF) – die Filterscheibe, die Dienste wie Cloudflare vor eine Site schalten – kann GPTBot blockieren, obwohl robots.txt ihn erlaubt. Silktide prüft dies separat als KI‑Crawler in der Praxis blockiert.
- Leere JavaScript‑Hüllen. Einen Crawler in ein
<div id="root"></div>zu lassen, hilft niemandem. Kombinieren Sie diese Technik mit Ohne JavaScript lesbare Inhalte. - Einen magischen Ranking‑Schub. Das Zulassen von Crawlern macht Zitate möglich. Zitierfähige Seiten, Daten, Identität und Belege entscheiden weiterhin, ob Sie ausgewählt werden – siehe Antwort‑orientierte Seitenstruktur und Auszeichnung der Organisationsidentität.
llms.txtals Ersatz. Eine Indexdatei kann einDisallownicht außer Kraft setzen. Siehe llms.txt.
Wie Silktide hilft
- Zugriff für KI‑Crawler – die Silktide‑Prüfung, die robots.txt gegen eine Liste bekannter KI‑User‑Agents auswertet und warnt, wenn das Site‑Root gesperrt ist – als Hinweis, den Sie genehmigen können, wenn die Sperre beabsichtigt ist.
- KI‑Crawler in der Praxis blockiert – die Silktide‑Prüfung, die als diese Crawler abruft, um Firewall‑ und Edge‑Sperren zu erkennen, die robots.txt nicht erklären kann.
- Inhalte ohne JavaScript – die Silktide‑Prüfung, die den Fehlerfall „erlaubt, aber leer“ erkennt.
Verwandte Inhalte
- Zugriff für KI‑Crawler – die Silktide‑Prüfung, die diese Technik vertieft
- Ohne JavaScript lesbare Inhalte
- llms.txt – optionale kuratierte Indexdatei, nachdem der Zugriff gelöst ist
- OpenAI‑Crawler‑Dokumentation
- Anthropic‑Crawler‑Dokumentation
- Übersicht der Google‑Crawler (inklusive Google‑Extended)
- robots.txt‑Spezifikation (RFC 9309)