robots.txt
robots.txt er en ren tekstfil i roden af et websted (for eksempel https://example.com/robots.txt), der fortæller automatiserede , hvilke dele af webstedet de må hente.
User-agent: GPTBot
Disallow: /
User-agent: *
Allow: /
Hver regel navngiver en crawler (eller * for dem alle) og angiver de stier, den må eller ikke må besøge. Søgemaskiner og tjekker denne fil, før de henter sider, så en enkelt Disallow-linje kan gøre et helt websted usynligt for en AI-assistent - nogle gange med vilje, ofte ved en fejl. robots.txt styrer crawling, ikke indeksering: at blokere en side her fjerner den ikke fra søgeresultater, som gør, og kan endda give bagslag ved at skjule selve noindex-tagget.
Læs mere
- Robots.txt: introduktion og guide - Googles praktiske vejledning
- RFC 9309: Robots Exclusion Protocol - den formelle IETF-standard