AIクローラーとは?GPTBotを止めてもChatGPT検索に出る理由

公開 更新 9 分で読了
AIクローラーとは?GPTBotを止めてもChatGPT検索に出る理由

AIクローラーは、AI企業が公開ページを読むためのプログラムです。GPTBotとOAI-SearchBotの違い、Google-Extendedの扱い、robots.txtで断っても訪問が続く理由、目的別の設定の決め方を説明します。

AIクローラーとは、AI企業が公開されているWebページを自動で読みに来るプログラムです。 学習のため、検索で紹介するため、利用者に頼まれてその場で読むため、と目的ごとに別の名前が付いています。そのため、GPTBotを止めても、ChatGPTの検索用のプログラムは別に設定できます。[1]

「記事をAIの学習には使われたくない。でも、商品を探す人にはAIから紹介してほしい」。この記事では、そんな方針を決めたいサイト担当者向けに、AIクローラーの種類と、目的に合う設定の決め方を説明します。確認日は2026年9月23日です。

AIクローラーとは:AI企業が公開ページを読むプログラム

AIクローラーは目的によって、学習用・検索用・利用者の依頼による取得の3種類に分かれます。 同じ会社でも、目的ごとに名前が違います。

クローラーとは、Webページを自動で巡回して読むプログラムのことです。サイト側は、robots.txt というサイトの直下に置く設定ファイルで、名前ごとに「読んでよい」「読まないでほしい」を伝えます。

一つのWebサイトへ3種類のAIクローラーが向かう図。学習用はGPTBot・ClaudeBot、検索用はOAI-SearchBot・Claude-SearchBot・PerplexityBot、利用者の依頼による取得はChatGPT-User・Claude-User・Perplexity-User。入口のrobots.txtの看板で、名前ごとに読んでよいかを伝えることを示す。

目的 主な名前(提供元) 止めたときの主な影響
学習用 GPTBot(OpenAI)、ClaudeBot(Anthropic) 今後の内容を学習に使わないでほしいという意思表示になる
検索用 OAI-SearchBot(OpenAI)、Claude-SearchBot(Anthropic)、PerplexityBot(Perplexity) そのAIの検索で紹介されにくくなる
利用者の依頼による取得 ChatGPT-User(OpenAI)、Claude-User(Anthropic)、Perplexity-User(Perplexity) 利用者に頼まれた読み取りに影響する。ChatGPT-UserとPerplexity-Userはrobots.txtが効かない場合がある(Claude-Userは従うと説明)

出典:[1][2][3]を当社が表に整理

PerplexityBotは検索結果での表示用で、AIの学習には使わないと説明されています。[3] Anthropicの3種類はrobots.txtに従い、読み込み間隔を指定する Crawl-delay にも対応しています。[2]

「許可」は訪問を受け入れることで、紹介される約束ではありません。「拒否」も、過去に集められた情報まで消すものではありません。

GPTBotとOAI-SearchBotは別設定:ChatGPT検索への影響

GPTBotは学習用、OAI-SearchBotはChatGPTの検索用で、OpenAIは両者の設定を独立して扱っています。 GPTBotを拒否しても、OAI-SearchBotを許可していれば、ChatGPTの検索の対象から外れるわけではありません。[1]

OpenAIは例として、「OAI-SearchBotを許可して検索結果に出しつつ、GPTBotを拒否して学習には使わないよう示す」設定を挙げています。[1]

独立した2本のレバーの図。GPTBotのレバーは「拒否」で「学習に使わない」へ、OAI-SearchBotのレバーは「許可」で「ChatGPT検索の対象」へつながる。別の線で、ChatGPT-Userは利用者に頼まれたその場の読み取りで、検索掲載の判定には使わないと示す。反映には約24時間かかることがあるという注記付き。

反対に、OAI-SearchBotを拒否したサイトは、ChatGPTの検索の回答には表示されません。ただし、サイトへの案内用のリンクとしては出ることがあります。[1]

ChatGPTの検索に出したい場合、OpenAIはOAI-SearchBotをrobots.txtで許可し、公開しているIPアドレスの範囲からのアクセスも許可するよう勧めています。IPアドレスは、アクセス元のコンピューターを表す番号です。[1]

robots.txtを書き換えてから、OpenAIの検索のシステムに反映されるまで、約24時間かかることがあります。[1] 変更した直後の結果だけで判断しないようにします。

ChatGPT-Userは検索掲載の判定に使われない

ChatGPT-Userは、利用者がChatGPTに質問したときなどに、その場でページを読むためのアクセスです。 検索に表示するかどうかの判定には使われません。[1]

利用者の操作で始まるアクセスのため、robots.txtのルールが適用されない場合があるとOpenAIは説明しています。検索への表示と自動の巡回を管理するには、OAI-SearchBotの設定を使うよう案内しています。[1]

そのため、「ChatGPT-Userを止めればChatGPT検索から消える」「ChatGPT-Userを許可すれば検索に出る」とは考えません。

Google-ExtendedとGoogle検索のAI機能は別の設定

Google-Extendedを拒否しても、Google検索やAIによる概要への掲載には影響しません。 Google-Extendedは、Geminiの学習と、Geminiアプリなどで回答の根拠として内容を使うことを管理する設定です。[4]

Googleは、Google-ExtendedはGoogle検索への掲載に影響せず、順位の判断材料にも使わないと明記しています。[4]

配線の分かれた2つの操作盤の図。Google-ExtendedのスイッチはGeminiの学習とGeminiアプリでの回答根拠だけにつながり、Google検索へは線がない。GooglebotのスイッチはGoogle検索・AIによる概要・AIモードにつながり、表示する文章の制限にはnosnippetやmax-snippetを使うと示す。

また、Google-Extendedという名前の訪問は、アクセス記録に現れません。ページの取得には既存のGoogleのプログラムが使われ、robots.txtの中で制御用の名前として働くだけです。[4]

一方、Google検索のAIによる概要やAIモードでの扱いは、通常の検索と同じGooglebotへのrobots.txtで管理します。表示する文章を制限したい場合は、nosnippet や max-snippet などの設定を使います。[5] これらは通常の検索結果の説明文にも影響します。

robots.txtで断ってもAIクローラーが来るときの確認

拒否した後もアクセスが続くときは、反映の時間差、利用者の依頼による取得、名前の偽装の3つを確かめます。

robots.txtで拒否した後も訪問が続くときの点検ルート。①反映の時間差:OpenAIは約24時間、Perplexityは最大24時間。②利用者の依頼による取得:robots.txtが効かない場合があり、WAFなど配信側で対応。③名前の偽装:公開されているIPアドレス範囲と照合。robots.txtは強制ではなくお願いという注記付き。

  1. 反映の時間差。 OpenAIは約24時間、Perplexityは最大24時間かかることがあると説明しています。[1][3] 変更した日時と、その後の訪問の日時を並べて見ます。
  2. 利用者の依頼による取得。 Perplexity-Userは、利用者に頼まれた取得のため、一般にrobots.txtを無視すると説明されています。[3] ChatGPT-Userも適用されない場合があります。[1] 止めたい場合は、WAF(不正なアクセスを止めるサービス)など配信側の設定が必要です。
  3. 名前の偽装。 訪問時に名乗る名前は偽装できます。[4] OpenAIやPerplexityが公開しているIPアドレスの範囲と照合して、本物かを確かめます。[1][3]

なお、robots.txtは「読まないでほしい」というお願いで、従うかどうかはクローラー次第です。Googleも、robots.txtは検索結果に出さないための仕組みではなく、非公開にしたい情報はパスワードなどで守るよう説明しています。[6]

Anthropicは、IPアドレスでのブロックでは確実に拒否できない場合があるとし、robots.txtでの設定を案内しています。[2] 会社ごとに推奨する方法が違う点にも注意します。

名乗りの真偽を確かめる仕組みはWeb Bot Authの解説で詳しく紹介しています。

AIクローラーの設定を決めて制作会社に依頼する

まず目的別に許可・拒否を決めた表を作り、対象サイト・対象ボット・変更前後の記録を含めて依頼します。

「AI対策をお願いします」だけでは、学習を断りたいのか、検索に出したいのかが伝わりません。次のように方針を一行ずつ書きます。

説明用の例。あいまいな「AI対策をお願いします」のメモから、学習用は拒否・検索用は許可・利用者の依頼は許可と書いた方針シートを作り、対象サイト、対象の名前、変更箇所と通常検索への影響、変更前の設定と変更日時を入れた依頼封筒を制作会社へ渡す流れ。設定しても紹介は保証されないという注記付き。

方針(説明用の例) 学習用 検索用 利用者の依頼
学習は断り、検索での紹介は受け入れる 拒否 許可 許可
学習も検索も受け入れる 許可 許可 許可
負荷が高いので読み込み間隔を空ける 間隔を指定 間隔を指定 状況を確認

一行目の方針なら、robots.txtは例えば次のようになります。これは相談用の例で、自社の既存の設定と合わせて制作会社に確かめてもらいます。

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: *
Allow: /
Disallow: /admin/

名前ごとの設定と、* で書く共通の設定は、そのまま足し合わされるとは限りません。管理画面を除外する指定を各名前にも入れるかは、公開前に確かめてもらいます。Anthropicの設定はサブドメインごとに必要です。[2]

依頼文の例です。

対象サイトのAI向けアクセス設定を見直したいです。学習用の取得は拒否し、公開している商品ページが検索で紹介されるための取得は受け入れたいと考えています。現在のrobots.txtと、CDNやWAFでの制限を確認してください。変更前に、対象の名前、変更する箇所、通常の検索への影響を教えてください。変更前の設定は保存し、変更日時を記録してください。

設定を変えても、AIの回答に紹介されるとは限りません。紹介されるかは、実際の質問への回答で別に確かめます。AI向けのリンク集であるllms.txtとrobots.txtの違いはllms.txtは必要?で説明しています。

よくある質問

Q. GPTBotをブロックするとChatGPTの検索に出なくなりますか?
GPTBotは学習用で、ChatGPTの検索に使われるOAI-SearchBotとは別の設定です。GPTBotを拒否しても、OAI-SearchBotを許可していれば検索の対象から外れるわけではありません。許可しても表示は保証されません。
Q. Google-Extendedを拒否するとAIによる概要に出なくなりますか?
出なくなりません。Google-ExtendedはGeminiの学習などを管理する設定で、Google検索への掲載に影響しないとGoogleは説明しています。
Q. GPTBotと名乗るアクセスは本物ですか?
名乗る名前は偽装できます。OpenAIが公開しているIPアドレスの範囲と照合して確かめます。

出典・参考データ

  1. [1] Overview of OpenAI crawlers (OpenAI) — 取得 2026-09-23
  2. [2] Does Anthropic crawl data from the web, and how can site owners block the crawler? (Anthropic) — 取得 2026-09-23
  3. [3] Perplexity Crawlers (Perplexity) — 取得 2026-09-23
  4. [4] List of Google's common crawlers (Google Search Central) — 取得 2026-09-23
  5. [5] AI features and your website (Google Search Central) — 取得 2026-09-23
  6. [6] Introduction to robots.txt (Google Search Central) — 取得 2026-09-23

この記事を書いた人

水島 翔吾

株式会社kairos 代表取締役 / AgentSignal 開発者

AI クローラー・AI 流入計測と AIO 診断ツール AgentSignal を開発。実測データを元に AI 検索時代の計測と対策を書いています。

関連記事