robots.txtとは?

一言でいうと 対応するクローラーに、サイト内のどのURLを取得してよいかというルールを伝えるテキストファイル。

robots.txtが伝えるもの

robots.txtは、ウェブ上の情報を取得するクローラーへ巡回のルールを伝えるためのファイルです。一般にサイトのルートに置き、対象のクローラーを示すUser-agentと、取得を許可するAllow、許可しないDisallowなどを記述します。検索結果への表示を直接切り替える設定とは役割が異なります。

このルールは、クローラーが読み取って従うことで機能します。記載しただけで、すべての自動アクセスをサーバー側で遮断できるわけではありません。Googleも、従わないクローラーがあり得ることや、解釈がクローラーごとに異なる場合があることを説明しています。

メディアにとっては記事の入口の管理

メディアでは、公開記事を検索エンジンに発見してもらう一方で、重要でないURLへの大量の巡回を減らしたい場合があります。robots.txtは、どのページを取得してほしいかを技術担当と共有するための手段になります。設定対象を広げすぎると、読者へ届けたい記事や、記事の理解に必要なファイルまで取得されなくなるおそれがあります。

AIによる記事取得を考える際も、まず対象となるクローラーと、その運営者が公表する仕様を確認します。アクセスへの意思表示、技術的な遮断、コンテンツ利用の契約条件は分けて検討する論点です。robots.txtの記述だけで、利用目的や対価の問題まで解決したとは判断できません。

取得を止めることと検索から外すこと

たとえば、公開サイトの特定のURL群に巡回が集中し、サーバー負荷を抑えたい場合、その範囲の取得を制限する設計が考えられます。これは運用上の仮定であり、実際には必要な記事まで対象に入らないか確認してから設定します。

一方、検索結果からページを外したいなら、robots.txtだけに頼るのは適切ではありません。Googleは、他のページからのリンクなどによって、取得を拒否したURLを検索結果に表示する場合があります。noindexを使う場合にも、クローラーがページを取得してその指定を読めることが必要です。

未公開情報を守る仕組みにはならない

robots.txtはログイン認証や閲覧制限の代わりにはなりません。未公開原稿や会員向けの情報を保護したい場合は、誰がアクセスできるかを別の仕組みで管理します。編集部は「検索で見せない」「機械に取得させない」「閲覧自体を制限する」のどれを求めているのかを整理して、技術担当に伝えることが大切です。

関連用語

  • クローラー
  • noindex

参照情報

*このコンテンツは生成AIを用いて作成し運営者の確認を経て配信しています。*

メディア天文台 編集部
タイトルとURLをコピーしました