robots.txt
robots.txt is een tekstbestand in platte tekst in de root van een website (bijvoorbeeld https://example.com/robots.txt) dat geautomatiseerde vertelt welke delen van de site ze mogen ophalen.
User-agent: GPTBot
Disallow: /
User-agent: *
Allow: /
Elke regel noemt een crawler (of * voor allemaal) en somt de paden op die wel of niet mogen worden bezocht. Zoekmachines en controleren dit bestand voordat ze pagina's ophalen, waardoor een enkele Disallow-regel een hele site onzichtbaar kan maken voor een AI-assistent - soms met opzet, vaak per ongeluk. robots.txt regelt crawlen, niet indexeren: een pagina hier blokkeren verwijdert die niet uit de zoekresultaten zoals dat doet, en kan zelfs averechts werken door de noindex-tag zelf te verbergen.
Meer informatie
- Robots.txt-introductie en handleiding - Google's praktische gids
- RFC 9309: Robots Exclusion Protocol - de formele IETF-standaard