robots.txt
robots.txt er en ren tekstfil i roten av et nettsted (for eksempel https://example.com/robots.txt) som forteller automatiserte hvilke deler av nettstedet de har lov til å hente.
User-agent: GPTBot
Disallow: /
User-agent: *
Allow: /
Hver regel navngir en crawler (eller * for alle) og lister opp stiene den har tillatelse til eller ikke har tillatelse til å besøke. Søkemotorer og sjekker denne filen før de henter sider, så én enkelt Disallow-linje kan gjøre et helt nettsted usynlig for en AI-assistent – noen ganger med hensikt, ofte ved et uhell. robots.txt styrer gjennomsøking, ikke indeksering: å blokkere en side her fjerner den ikke fra søkeresultatene slik gjør, og kan til og med slå tilbake ved å skjule selve noindex-taggen.
Les mer
- Introduksjon og veiledning til robots.txt - Googles praktiske veiledning
- RFC 9309: Robots Exclusion Protocol - den formelle IETF-standarden