GPTBotの許可・拒否設定|robots.txtでの制御方法
三橋竜彰・
GPTBotの許可・拒否は、サイトのrobots.txtに数行を書くだけで設定できます。結論から言うと、AI検索に引用されたいなら「許可」が基本で、拒否するとその引用機会も失われます。
GPTBotはOpenAIがChatGPTの学習・検索のために使うクローラーです。この記事では、GPTBotをはじめとする主要なAIクローラーをrobots.txtで許可・拒否する具体的な書き方と、LLMO(AI検索での引用対策)の観点からどちらを選ぶべきかの判断基準を解説します。LLMOの全体像はLLMOとは?AI時代の検索最適化 完全ガイドで扱っています。
運営者はSEO検定1級・ウェブマスター検定1級・ウェブ解析士として、AIでサイト設計から記事作成・公開までを自動化する仕組みを自作し、複数の自社サイトで運用しています。その実装のなかで、AIクローラーの許可設定は最初に決める項目のひとつです。
GPTBotとは何ですか?
GPTBotは、OpenAIがWeb上のページを取得するために使うクローラー(自動巡回プログラム)です。取得した内容は、ChatGPTの回答生成や、ChatGPTの検索機能が情報源を選ぶ際に使われます。
OpenAIは用途ごとに複数のクローラーを分けています。robots.txtでは、この名前(ユーザーエージェント)を指定して許可・拒否を制御します。
| クローラー名 | 主な用途 |
|---|---|
| GPTBot | モデルの学習・検索インデックス用の巡回 |
| OAI-SearchBot | ChatGPTの検索機能が参照するための取得 |
| ChatGPT-User | ユーザーの操作でChatGPTがページを開くときの取得 |
robots.txtでGPTBotを許可・拒否する書き方
robots.txtは、サイトの最上位(https://example.com/robots.txt)に置くテキストファイルです。ユーザーエージェント名と許可・不許可を記述します。
許可する場合(推奨)
明示的に何も書かなければ、標準では許可(クロール可能)です。あえて明示するなら次のように書きます。
User-agent: GPTBot
Allow: /
拒否する場合
サイト全体を拒否するには、Disallow: / を指定します。
User-agent: GPTBot
Disallow: /
特定のディレクトリだけ拒否することもできます。
User-agent: GPTBot
Disallow: /members/
robots.txtはあくまで「取得を控えてほしい」という宣言です。準拠するかはクローラー側の運用に依存し、非公開にしたい情報の保護手段にはなりません。会員限定ページなどはアクセス制御で守ります。
主要なAIクローラーの一覧と記述例
GPTBot以外にも、AI検索・生成AIが使うクローラーは複数あります。robots.txtでまとめて制御できます。
| クローラー名 | 運営 | 用途 |
|---|---|---|
| GPTBot / OAI-SearchBot | OpenAI | ChatGPT・その検索 |
| Google-Extended | Gemini等の生成AIの学習利用の制御(※AI OverviewsはGoogle検索の一部でGooglebot管轄・本設定の対象外) | |
| PerplexityBot | Perplexity | Perplexityの回答・引用 |
| ClaudeBot | Anthropic | Claudeの学習 |
| CCBot | Common Crawl | 各種AIの学習データの元 |
主要なAIクローラーをまとめて許可する例は次のとおりです(許可が目的なら記述自体を省略しても同じです)。
User-agent: GPTBot
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: PerplexityBot
Allow: /
なお Google-Extended は、Gemini などGoogleの生成AIによる学習利用を制御する設定です。Google検索(Googlebot)や、その一部であるAI Overviewsのクロールとは別枠で、Google-Extended を拒否してもGoogle検索・AI Overviewsのクロール自体は止まりません。この用語関係はAIO対策とは?LLMOとの違いと実践方法でも整理しています。
許可と拒否、どちらを選ぶべきですか?
判断の軸は「AI検索・生成AIに引用されたいか」です。
:::point
- 引用されたい(LLMOを狙う)→ 許可:AIがページを取得できて初めて、回答の情報源として選ばれる候補になります。
- 学習・引用のどちらも避けたい → 拒否:ただしAI検索での露出機会は失われます。会員制・有料コンテンツなど、そもそもAIに出したくない領域が明確な場合に選びます。 :::
多くの情報発信サイトでは、AI検索経由の到達を増やすために許可が基本です。実際に引用されるための文章構造や一次情報の作り方はChatGPT・Perplexityに引用される方法で解説しています。クローラーを許可することは、その前提となる第一歩です。
設定が反映されているかの確認方法
robots.txtを設置したら、ブラウザで https://(あなたのドメイン)/robots.txt を開き、記述がそのまま表示されるか確認します。表示されない・古い内容のままの場合は、設置場所(最上位ディレクトリ)とキャッシュを見直します。
記述ミスで意図せず全体を拒否していないか、Disallow: / が想定外のクローラーに掛かっていないかは、公開前に必ず目視で確認します。
よくある質問
GPTBotは許可と拒否のどちらがいいですか?
AI検索や生成AIに引用されたいなら許可が基本です。GPTBotがページを取得できて初めて、ChatGPTの回答であなたのサイトが情報源として選ばれる候補になります。拒否すると学習も引用も避けられますが、AI経由の露出機会は失われます。会員制・有料コンテンツなどAIに出したくない領域が明確な場合に拒否を選びます。
GPTBotを拒否するとどうなりますか?
OpenAIのクローラーがページを取得しなくなり、ChatGPTの学習や検索での参照対象から外れます。その結果、AIの回答であなたのサイトが引用・言及される機会も減ります。robots.txtでの拒否は「取得を控えてほしい」という宣言で、非公開情報の保護手段ではない点にも注意が必要です。
robots.txtでGPTBotを拒否する書き方は?
サイト最上位のrobots.txtに、User-agent: GPTBot と Disallow: / を記述するとサイト全体を対象に拒否できます。特定のディレクトリだけ拒否したい場合は Disallow: /対象パス/ と書きます。記述後は robots.txt をブラウザで開き、内容が反映されているか確認しましょう。
GPTBot以外にどんなAIクローラーがありますか?
OpenAIのOAI-SearchBotやChatGPT-User、GoogleのGoogle-Extended、PerplexityのPerplexityBot、AnthropicのClaudeBot、Common CrawlのCCBotなどがあります。robots.txtで名前ごとに許可・拒否を指定できます。Google-Extendedは生成AI(Gemini等)の学習利用を制御する設定です。
GPTBotを許可してもGoogle検索には影響しませんか?
影響しません。GPTBotはOpenAI、Google検索のクロールはGooglebotで、別々のクローラーです。GPTBotの許可・拒否は通常のGoogle検索順位とは独立しています。Googleの生成AI向けクロールを制御したい場合は、Googlebotではなく Google-Extended を指定します。
まとめ
GPTBotの許可・拒否は、robots.txtにユーザーエージェント名とAllow/Disallowを書くだけで設定できます。AI検索・生成AIに引用されたいなら許可が基本で、GPTBot・Google-Extended・PerplexityBotなど主要クローラーをまとめて許可しておくのが実務的です。拒否はAIに出したくない領域が明確なときの選択肢で、露出機会とのトレードオフになります。許可を前提に、実際に引用されるための中身づくりはChatGPT・Perplexityに引用される方法へ、全体像はLLMOとはへ進んでください。
AIクローラー対応を含むサイト運用を任せたい方へ:本サイトを運営する自動システム〈ヒトリデニ〉は、サイト設計から記事作成・公開・LLMO対応までをAIで自動化する仕組みです。サービスとしての提供は準備中で、現在は事前登録を受け付けています。詳しくはヒトリデニのトップページをご覧ください。