robots.txt
robots.txt est un fichier texte brut à la racine d'un site web (par exemple https://example.com/robots.txt) qui indique aux automatisés quelles parties du site ils sont autorisés à explorer.
User-agent: GPTBot
Disallow: /
User-agent: *
Allow: /
Chaque règle désigne un robot (ou * pour tous) et énumère les chemins qu'il est autorisé ou non à visiter. Les moteurs de recherche et les consultent ce fichier avant de récupérer des pages, si bien qu'une simple ligne Disallow peut rendre un site entier invisible pour un assistant IA — parfois intentionnellement, souvent par accident. robots.txt contrôle l'exploration, pas l'indexation : bloquer une page ici ne la retire pas des résultats de recherche comme le fait , et cela peut même se retourner contre vous en masquant la balise noindex elle-même.
Pour en savoir plus
- Introduction et guide sur robots.txt - le guide pratique de Google
- RFC 9309 : Robots Exclusion Protocol - la norme officielle de l'IETF