Politique d’accès des robots IA
Une politique d’accès des robots IA est une configuration réfléchie de (et parfois du pare-feu) qui précise quels systèmes d’IA peuvent récupérer vos pages publiques — et dans quel but. Elle est contextuelle, car la « bonne » réponse dépend de l’importance que vous accordez au fait d’être cité dans les réponses d’un assistant IA, d’empêcher l’utilisation de votre contenu pour l’entraînement des modèles, ou des deux. Ce qui n’est pas contextuel, c’est de traiter un modèle « bloquer toute l’IA » collé tel quel comme s’il s’agissait d’un durcissement de sécurité neutre. Ce choix a des conséquences marketing.
Dans toute cette page, supposons que Fernwood souhaite apparaître dans les réponses de ChatGPT et Claude au sujet de la gestion des notes de frais, mais que son service juridique préfère ne pas contribuer de nouvelles pages aux corpus d’entraînement de modèles de fondation.
Cette technique traite de l’accès. Une fois qu’un robot est autorisé à entrer, il doit quand même recevoir du véritable HTML — voir Contenu lisible sans JavaScript — et une carte facultative et organisée est traitée séparément dans llms.txt.
Pourquoi c’est contextuel
Les produits d’IA n’utilisent plus un seul « bot d’IA ». Les grands éditeurs séparent leurs robots selon la tâche :
| Tâche | Bots typiques | Effet du blocage |
|---|---|---|
| Entraînement de modèles | OpenAI GPTBot, Anthropic ClaudeBot, Common Crawl CCBot, Google Google-Extended (contrôle de l’entraînement/de l’ancrage de Gemini — pas Googlebot) | Indique que le contenu ne doit pas être utilisé pour l’entraînement (ou, pour Google-Extended, pour entraîner Gemini / alimenter certaines fonctionnalités d’IA). N’implique pas, à lui seul, votre suppression de la recherche Google classique. |
| Indexation pour la recherche / les réponses | OpenAI OAI-SearchBot, Anthropic Claude-SearchBot, PerplexityBot | Réduit ou supprime l’éligibilité à apparaître et à être cité dans les réponses de type recherche de ce produit. |
| Récupération déclenchée par l’utilisateur | OpenAI ChatGPT-User, Anthropic Claude-User, « l’utilisateur a demandé cette URL » agents similaires | Contrôle les récupérations en direct lorsqu’une personne pointe l’assistant IA vers une page. Les règles des éditeurs diffèrent quant au respect de robots.txt par ces agents — vérifiez la documentation à jour du fournisseur avant de supposer qu’un Disallow fonctionne. |
La documentation d’OpenAI sur ses robots précise explicitement leur indépendance : un webmaster peut autoriser OAI-SearchBot à apparaître dans les fonctionnalités de recherche de ChatGPT tout en interdisant GPTBot afin que le contenu exploré ne soit pas utilisé pour entraîner des modèles génératifs de fondation. Anthropic documente la même séparation en trois pour ClaudeBot (entraînement), Claude-SearchBot (qualité de recherche) et Claude-User (récupération dirigée par l’utilisateur).
La question de politique n’est donc pas « IA : activée ou désactivée ? ». Ce sont trois décisions distinctes qui doivent correspondre à la tolérance au risque de Fernwood et à ses objectifs AEO.
Autorisez généralement les robots de recherche/de réponse lorsque :
- Vous voulez que les assistants IA citent les pages de documentation, de recherche et de comparaison de Fernwood.
- Les concurrents apparaissent déjà dans ces réponses et vous non.
- La vérification Accès des robots IA de Silktide affiche un avertissement parce qu’un modèle a tout bloqué par accident.
Bloquez ou limitez souvent les robots d’entraînement lorsque :
- La politique juridique ou de marque interdit de contribuer le contenu du site à l’entraînement de modèles tiers.
- Vous publiez de la recherche propriétaire, une logique tarifaire, ou du contenu quasi-protégé qui doit rester hors des corpus d’entraînement même si vous souhaitez encore des citations en direct.
Bloquez largement lorsque :
- Le site est non public, en préproduction (staging), ou n’a aucune raison marketing d’apparaître dans les réponses d’assistants IA (intranet, pure interface d’application, portail partenaire).
- Vous avez pris une décision produit consciente de rester totalement en dehors des réponses d’IA — et vous acceptez de perdre ce canal.
Comment décider (feuille de travail de Fernwood)
Passez par ces étapes dans l’ordre. Notez vos réponses ; le fichier robots.txt n’est que la traduction technique de cette feuille.
- Souhaitons-nous être cités dans des réponses d’IA, tout court ? Si non, interdisez les principaux bots de recherche/de réponse et approuvez l’avertissement de Silktide. Si oui, continuez.
- Quels assistants IA comptent ? ChatGPT, Claude, Perplexity, les fonctionnalités d’IA de Google, et d’autres ont chacun leurs propres agents. Donnez la priorité à ceux que vos acheteurs utilisent réellement.
- Faut-il se désinscrire de l’entraînement (opt-out) ? Si le service juridique dit oui, interdisez les agents d’entraînement (
GPTBot,ClaudeBot,Google-Extended,CCBotet équivalents) tout en laissant les agents de recherche autorisés là où l’éditeur permet cette séparation. - Existe-t-il des chemins qui doivent rester privés quoi qu’il arrive ?
/app/,/internal/, des URL d’aperçu de brouillon — interdisez-les pour*(et confirmez que l’authentification les protège toujours ; robots.txt n’est pas un contrôle d’accès). - Le HTML est-il réellement récupérable ? Un robots.txt permissif avec une coquille SPA vide échoue quand même en AEO — corrigez d’abord le rendu.
Mise en œuvre de la politique dans robots.txt
Le fichier robots.txt se trouve à https://fernwood.example/robots.txt. Les règles sont regroupées par user-agent. Des groupes plus spécifiques priment sur le générique pour cet agent. Préférez des agents nommés plutôt que d’espérer que User-agent: * exprime votre politique IA — les modèles qui placent Disallow: / sous * paralysent aussi Googlebot et tous les autres.
Modèle A — Visible dans les réponses, exclu de l’entraînement (fréquent pour les sites orientés AEO)
# OpenAI : être cité dans la recherche de ChatGPT, ne pas utiliser pour l’entraînement des modèles de fondation
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
# Anthropic : autoriser l’indexation de recherche ; bloquer l’exploration d’entraînement
User-agent: Claude-SearchBot
Allow: /
User-agent: ClaudeBot
Disallow: /
# Google : Googlebot (Recherche) est séparé ; Google-Extended contrôle l’entraînement de Gemini / certaines fonctionnalités d’IA
User-agent: Google-Extended
Disallow: /
# Conserver des chemins d’app privés fermés pour tout le monde
User-agent: *
Disallow: /app/
Disallow: /internal/
OpenAI indique que les changements de robots.txt pour la recherche peuvent prendre environ ~24 heures pour prendre effet. Revérifiez après la publication.
Modèle B — Entièrement ouvert (portée maximale pour les moteurs de réponse)
Omettez les règles Disallow spécifiques à l’IA. Assurez-vous que rien sous User-agent: * n’interdit accidentellement tout le site. Protégez quand même les chemins privés.
Modèle C — Entièrement fermé aux produits d’IA
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-SearchBot
Disallow: /
User-agent: Claude-User
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Utilisez ceci uniquement de manière consciente. Ensuite, l’avertissement de Silktide sur les robots IA pour que le constat cesse d’être comptabilisé contre le site.
Vérifier qui vous sollicite réellement
Les chaînes User-Agent sont triviales à usurper. Préférez les listes d’IP publiées par les éditeurs lorsque vous avez besoin de certitude :
- OpenAI publie un JSON des IP de ses robots (lien depuis la documentation des bots d’OpenAI).
- Anthropic publie les IP de ses robots à claude.com/crawling/bots.json.
Bloquer uniquement par IP, sans signal robots.txt, est fragile — Anthropic note que des blocages IP peuvent empêcher le bot de lire votre robots.txt et de compléter proprement une désinscription.
Ce que robots.txt ne corrige pas
- Faux positifs de pare-feu / gestion des bots. Un pare-feu applicatif Web (WAF) — la couche de filtrage que des services comme Cloudflare placent devant un site — qui soumet à un défi ou renvoie des 403 aux clients « non-navigateurs » peut bloquer GPTBot même quand robots.txt l’autorise. Silktide le teste séparément via Robots IA bloqués en pratique.
- Coquilles JavaScript vides. Autoriser le robot à entrer dans un
<div id=\"root\"></div>ne sert à personne. Associez cette technique à Contenu lisible sans JavaScript. - Un coup de pouce magique au classement. Autoriser les robots rend la citation possible. Des pages citables, des dates, l’identité et des preuves déterminent encore si vous êtes choisi — voir Structure de page orientée réponse et Balisage d’identité de l’organisation.
llms.txtn’est pas un substitut. Un fichier d’index ne peut pas outrepasser unDisallow. Voir llms.txt.
Comment Silktide aide
- Accès des robots IA analyse robots.txt contre une liste d’agents IA bien connus et avertit lorsque la racine du site est interdite — un avertissement que vous pouvez approuver lorsque le blocage est intentionnel.
- Robots IA bloqués en pratique effectue des récupérations en se faisant passer pour ces robots afin de détecter les blocages pare-feu et en périphérie que robots.txt ne peut pas expliquer.
- Contenu sans JavaScript détecte le mode d’échec « autorisé mais vide ».
Voir aussi
- Accès des robots IA — la vérification Silktide que cette technique développe
- Contenu lisible sans JavaScript
- llms.txt — index organisé facultatif après résolution de l’accès
- Documentation des robots d’OpenAI
- Documentation des robots d’Anthropic
- Aperçu des robots de Google (dont Google-Extended)
- Spécification robots.txt (RFC 9309)