Passer au contenu
SilktideAide

Politique d’accès des robots d’IA

Une politique d’accès des robots d’IA est une configuration réfléchie de (et parfois du pare-feu) qui précise quels systèmes d’IA peuvent récupérer vos pages publiques — et dans quel but. Elle est contextuelle, car la « bonne » réponse dépend de l’importance que vous accordez au fait d’être cité dans les réponses d’un assistant IA, d’empêcher l’utilisation de votre contenu pour l’entraînement de modèles, ou les deux. Ce qui n’est pas contextuel, c’est de traiter un modèle « bloquer toute l’IA » collé tel quel comme s’il s’agissait d’un durcissement de sécurité neutre. Ce choix a des conséquences marketing.

Dans toute cette page, supposons que Fernwood veuille apparaître dans les réponses de ChatGPT et Claude à propos de la gestion des dépenses, mais que son équipe juridique préfère ne pas contribuer de nouvelles pages aux corpus d’entraînement des modèles de base.

Cette technique porte sur l’accès. Une fois qu’un robot est autorisé, il doit quand même recevoir du vrai HTML — voir Contenu lisible sans JavaScript — et une carte facultative et organisée est traitée séparément dans llms.txt.

Pourquoi c’est contextuel

Les produits d’IA n’utilisent plus un unique « bot d’IA ». Les principaux fournisseurs distinguent plusieurs robots selon leur rôle :

RôleRobots typiquesEffet d’un blocage
Entraînement de modèlesOpenAI GPTBot, Anthropic ClaudeBot, Common Crawl CCBot, Google Google-Extended (contrôle de l’entraînement / de l’ancrage de Gemini — pas Googlebot)Indique que le contenu ne doit pas être utilisé pour l’entraînement (ou, pour Google-Extended, pour entraîner Gemini / alimenter certaines fonctionnalités d’IA). Cela ne vous retire pas, en soi, de la Recherche Google classique.
Recherche / indexation pour réponsesOpenAI OAI-SearchBot, Anthropic Claude-SearchBot, PerplexityBotRéduit ou supprime l’éligibilité à être affiché et cité dans les réponses de type recherche de ce produit.
Récupération déclenchée par l’utilisateurOpenAI ChatGPT-User, Anthropic Claude-User, agents similaires « l’utilisateur a demandé cette URL »Contrôle les récupérations en direct lorsqu’une personne pointe l’assistant IA vers une page. Les règles des fournisseurs diffèrent quant au respect de robots.txt par ces agents — vérifiez la documentation actuelle du fournisseur avant de supposer qu’un Disallow fonctionne.

La documentation d’OpenAI sur ses robots précise explicitement cette indépendance : un webmestre peut autoriser OAI-SearchBot pour apparaître dans les fonctionnalités de recherche de ChatGPT tout en interdisant GPTBot afin que le contenu exploré ne serve pas à entraîner des modèles génératifs de base. Anthropic documente la même division en trois pour ClaudeBot (entraînement), Claude-SearchBot (qualité de recherche) et Claude-User (récupération dirigée par l’utilisateur).

La question de politique n’est donc pas « IA : activée ou désactivée ? ». Ce sont trois décisions distinctes qui doivent correspondre à la tolérance au risque et aux objectifs AEO de Fernwood.

Autorisez généralement les robots de recherche/réponse lorsque :

  • Vous voulez que les assistants IA citent les documents, recherches et pages de comparaison de Fernwood.
  • Les concurrents apparaissent déjà dans ces réponses et pas vous.
  • La vérification Accès des robots d’IA de Silktide affiche un avertissement parce qu’un modèle a tout bloqué par accident.

Bloquez souvent ou limitez les robots d’entraînement lorsque :

  • La politique juridique ou de marque interdit de contribuer le contenu du site à l’entraînement de modèles tiers.
  • Vous publiez de la recherche propriétaire, une logique de tarification ou du contenu proche de l’accès restreint qui doit rester hors des corpus d’entraînement, même si vous souhaitez encore des citations en direct.

Bloquez largement lorsque :

  • Le site n’est pas public, est en préproduction, ou n’a aucune raison marketing d’apparaître dans les réponses d’un assistant IA (intranet, interface d’application pure, portail partenaire).
  • Vous avez pris une décision produit consciente de rester totalement absent des réponses d’IA — et vous êtes prêt à perdre ce canal.

Comment décider (feuille de travail de Fernwood)

Suivez ces étapes dans l’ordre. Notez vos réponses; le fichier robots.txt n’est que l’encodage de cette feuille de travail.

  1. Souhaitons-nous être cités dans des réponses d’IA, tout court ? Si non, interdisez les principaux robots de recherche/réponse et approuvez l’avertissement de Silktide. Si oui, continuez.
  2. Quels assistants IA comptent ? ChatGPT, Claude, Perplexity, les fonctionnalités d’IA de Google, et d’autres ont chacun leurs propres agents. Priorisez ceux que vos acheteurs utilisent réellement.
  3. L’exclusion de l’entraînement est-elle requise ? Si le service juridique dit oui, interdisez les agents d’entraînement (GPTBot, ClaudeBot, Google-Extended, CCBot et consorts) tout en gardant les agents de recherche autorisés lorsque le fournisseur permet cette séparation.
  4. Y a-t-il des chemins qui doivent rester privés de toute façon ? \/app\/, \/internal\/, des URL d’aperçu de brouillons — interdisez-les pour * (et confirmez que l’auth protège toujours; robots.txt n’est pas un mécanisme de contrôle d’accès).
  5. Le HTML est-il réellement récupérable ? Un robots.txt permissif avec une coquille d’application monopage (SPA) vide échoue quand même pour l’AEO — corrigez le rendu ensuite.

Mise en œuvre de la politique dans robots.txt

Robots.txt se trouve à https:\/\/fernwood.example\/robots.txt. Les règles s’appliquent par groupe d’agent utilisateur. Des groupes plus spécifiques remplacent la règle générale pour cet agent. Privilégiez des agents nommés plutôt que d’espérer que « User-agent: * » exprime votre politique IA — les modèles qui définissent Disallow: \/ sous * handicapent aussi Googlebot et tous les autres.

Modèle A — Visible dans les réponses, exclu de l’entraînement (courant pour les sites axés AEO)

# OpenAI : être cité dans la recherche de ChatGPT, ne pas utiliser pour l’entraînement des modèles de base
User-agent: OAI-SearchBot
Allow: \/

User-agent: GPTBot
Disallow: \/

# Anthropic : autoriser l’indexation pour la recherche; bloquer l’exploration pour l’entraînement
User-agent: Claude-SearchBot
Allow: \/

User-agent: ClaudeBot
Disallow: \/

# Google : Googlebot (Search) est distinct; Google-Extended contrôle l’entraînement de Gemini \/ certaines fonctions d’IA
User-agent: Google-Extended
Disallow: \/

# Garder les chemins d’appli privés fermés à tout le monde
User-agent: *
Disallow: \/app\/
Disallow: \/internal\/

OpenAI indique que les changements à robots.txt pour la recherche peuvent prendre environ 24 heures à entrer en vigueur. Revérifiez après la publication.

Modèle B — Entièrement ouvert (portée maximale dans les moteurs de réponse)

Omettez les règles Disallow spécifiques à l’IA. Assurez-vous que rien sous « User-agent: * » n’interdit accidentellement tout le site. Protégez quand même les chemins privés.

Modèle C — Entièrement fermé aux produits d’IA

User-agent: GPTBot
Disallow: \/

User-agent: OAI-SearchBot
Disallow: \/

User-agent: ClaudeBot
Disallow: \/

User-agent: Claude-SearchBot
Disallow: \/

User-agent: Claude-User
Disallow: \/

User-agent: PerplexityBot
Disallow: \/

User-agent: Google-Extended
Disallow: \/

User-agent: CCBot
Disallow: \/

N’utilisez ceci que par choix conscient. Ensuite, l’avertissement de Silktide sur les robots d’IA afin que le constat cesse de pénaliser le site.

Vérifier qui vous contacte réellement

Les chaînes User-Agent sont faciles à usurper. Privilégiez les listes d’IP publiées par les fournisseurs lorsque vous avez besoin de certitude :

Bloquer uniquement par IP, sans signal dans robots.txt, est fragile — Anthropic note que les blocages par IP peuvent empêcher le robot de lire votre robots.txt et d’appliquer correctement le retrait.

Ce que robots.txt ne règle pas

  • Faux positifs du pare-feu / de la gestion des robots. Un pare-feu d’application Web (WAF) — la couche de filtrage que des services comme Cloudflare placent devant un site — qui impose un défi ou renvoie un 403 aux clients « non‑navigateur » peut bloquer GPTBot même lorsque robots.txt l’autorise. Silktide teste cela séparément via Robots d’IA bloqués en pratique.
  • Coquilles JavaScript vides. Laisser entrer le robot dans un <div id=\"root\"></div> n’aide personne. Associez cette technique à Contenu lisible sans JavaScript.
  • Un gain de classement « magique ». Autoriser les robots rend la citation possible. Ce sont encore la qualité des pages citables, les dates, l’identité et les preuves qui déterminent si vous êtes choisi — voir Structure de page axée sur la réponse et Balisage de l’identité de l’organisation.
  • llms.txt comme substitut. Un fichier d’index ne peut pas outrepasser un Disallow. Voir llms.txt.

Comment Silktide vous aide

  • Accès des robots d’IA analyse robots.txt selon une liste d’utilisateurs‑agents d’IA bien connus et avertit lorsque la racine du site est interdite — un avertissement que vous pouvez approuver lorsque le blocage est intentionnel.
  • Robots d’IA bloqués en pratique effectue des récupérations en se faisant passer pour ces robots afin de détecter les blocages au pare-feu ou en périphérie que robots.txt ne peut pas expliquer.
  • Contenu sans JavaScript détecte le cas d’échec « autorisé mais vide ».

Connexe

Dernière mise à jour

Cette page vous a-t-elle été utile?

Politique d’accès des robots d’IA | Aide de Silktide