robots.txt
robots.txt är en textfil i klartext i webbplatsens rot (till exempel https://example.com/robots.txt) som talar om för automatiska vilka delar av webbplatsen de får hämta.
User-agent: GPTBot
Disallow: /
User-agent: *
Allow: /
Varje regel namnger en crawler (eller * för alla) och listar de sökvägar som den får respektive inte får besöka. Sökmotorer och kontrollerar den här filen innan de hämtar sidor, så en enda Disallow-rad kan göra en hel webbplats osynlig för en AI-assistent - ibland avsiktligt, ofta av misstag. robots.txt styr genomsökning, inte indexering: att blockera en sida här tar inte bort den från sökresultaten på samma sätt som gör, och kan till och med slå tillbaka genom att dölja själva noindex-taggen.
Läs mer
- Introduktion och guide till robots.txt - Googles praktiska guide
- RFC 9309: Robots Exclusion Protocol - den formella IETF-standarden