robots.txt
robots.txt はウェブサイトのルート(例: https://example.com/robots.txt)に置かれるプレーンテキストファイルで、自動化されたにサイトのどの部分を取得してよいかを伝えます。
User-agent: GPTBot
Disallow: /
User-agent: *
Allow: /
各ルールはクローラー名(すべてに適用する場合は *)を指定し、アクセスを許可または禁止するパスを列挙します。検索エンジンやはページを取得する前にこのファイルを確認するため、Disallow の1行だけでサイト全体が AI アシスタントから見えなくなることがあります—意図的な場合もあれば、しばしば偶発的でもあります。robots.txt が制御するのはクロールであり、インデックス登録ではありません。ここでページをブロックしても、 のように検索結果から削除されるわけではなく、noindex タグ自体を見えなくしてしまい逆効果になることさえあります。
参考情報
- Robots.txt の概要とガイド - Google による実践的なガイド
- RFC 9309: Robots Exclusion Protocol - 正式な IETF 標準