メインコンテンツへスキップ
ブログ

更新日 2026-08-21

AIクローラーをブロックしているサイトはどこか?主要28ドメインのアクセス制御ベンチマーク調査

要約

2026年8月21日、著名な28ドメインのrobots.txtとllms.txtを取得し、AEO Mantisのグループ対応パーサーで5つの引用・検索クローラー(OAI-SearchBot、PerplexityBot、Claude-SearchBot、Googlebot、Bingbot)を検証しました。28ドメイン中7ドメインが少なくとも1つをブロックし、Redditは5つすべてを遮断しています。llms.txtを公開していたのは11ドメインでした。GPTBotとGoogle-Extendedは、ChatGPT SearchやGoogle Searchの引用対象可否ではなく別のAI利用を制御するため、スコア対象から除外しています。無料のAI検索可視性チェッカーで同じ検査を実行できます。

AI検索での可視性は、まず「対象の検索・取得システムがページへアクセスできるか」という適格性の確認から始まります。プラットフォームの検索クローラーをブロックすると、その取得経路の候補から外れる可能性がありますが、許可しても引用は保証されません。ChatGPT Searchで確認すべきなのはGPTBotではなくOAI-SearchBotです。GoogleのAI OverviewsとAI ModeはGoogleの中核検索システムを利用するため、重要なのはGooglebotであり、Google-ExtendedはGoogle Searchへの掲載を制御しません。

ベンチマーク調査の概要

調査実施日:2026年8月21日。対象はAI企業、大手SaaS、メディア、Eコマース、SNS・コミュニティ、レファレンスサイトの6カテゴリ、計28ドメインです。再検証できるよう、全ドメインを後述の表に掲載しています。

各ドメインからHTTPSで/robots.txtと/llms.txtを取得しました。robots.txtは文字列検索ではなく、ユーザーエージェントごとのグループとして解析しています。専用グループ、または専用グループがない場合のワイルドカード(*)グループがルートパス(/)を拒否し、同じルートを許可するルールがない場合に「ブロック」と判定します。AEO Mantisのサイト監査と同じルールです。

スコア対象の5つは、検索または引用取得に直接関係するクローラーです。

  • OAI-SearchBot — ChatGPT Searchでの発見・表示を可能にするクローラー
  • PerplexityBot — Perplexityの検索インデックスを構築するクローラー
  • Claude-SearchBot — Anthropicの検索体験向けにWebコンテンツへアクセスするクローラー
  • Googlebot — AI OverviewsとAI Modeでも使われるGoogle Searchインデックスを構築するクローラー
  • Bingbot — Bingの検索インデックスを構築するクローラー

調査結果:ドメイン別のクローラーブロック状況

以下の表は、調査対象となった全ドメインの結果です。「✓」はクローラーのアクセスが許可されている状態、「✗」はrobots.txtによってサイト全体へのアクセスがブロックされている状態を示します。また「llms.txt」列は、該当ファイルが設置・公開されているかどうかを表しています。

ドメインOAI-SearchBotPerplexityBotClaude-SearchBotGooglebotBingbotllms.txt
reddit.com✗✗✗✗✗なし
amazon.com✗✗✗✓✓なし
nytimes.com✗✗✗✓✓なし
x.com✗✗✗✓✓あり
figma.com✗✗✗✓✓なし
techcrunch.com✓✓✓✓✓なし
wired.com✓✗✗✓✓なし
theguardian.com✓✗✗✓✓なし
medium.com✓✓✓✓✓なし
openai.com✓✓✓✓✓なし
anthropic.com✓✓✓✓✓なし
perplexity.ai✓✓✓✓✓なし
huggingface.co✓✓✓✓✓なし
stripe.com✓✓✓✓✓あり
shopify.com✓✓✓✓✓あり
vercel.com✓✓✓✓✓あり
cloudflare.com✓✓✓✓✓あり
notion.so✓✓✓✓✓あり
github.com✓✓✓✓✓あり
linear.app✓✓✓✓✓あり
supabase.com✓✓✓✓✓あり
linkedin.com✓✓✓✓✓あり
wikipedia.org✓✓✓✓✓なし
airtable.com✓✓✓✓✓なし
stability.ai✓✓✓✓✓なし
midjourney.com✓✓✓✓✓なし
stackoverflow.com✓✓✓✓✓なし
aeomantis.com✓✓✓✓✓あり

最もブロックされているAIクローラーはどれか

GooglebotとBingbotをブロックしていたのは、どちらもRedditだけでした。一方、回答エンジン専用クローラーのブロック率は高くなっています。

クローラー許可ブロックブロック率
PerplexityBot21725%
Claude-SearchBot21725%
OAI-SearchBot23518%
Googlebot2714%
Bingbot2714%

Amazon、The New York Times、X、Figma、Redditの5ドメインは、今回対象とした3つの回答エンジン専用クローラーをすべてブロックしています。WiredとThe GuardianはOAI-SearchBotを許可する一方、PerplexityBotとClaude-SearchBotをブロックしています。この違いは、ひとまとめの「AIクローラー」設定では不十分であり、各プラットフォームが実際に使う取得経路を個別に確認する必要があることを示しています。

GPTBotとGoogle-Extendedは、パブリッシャーのコンテンツ利用方針では今も重要ですが、目的が異なります。GPTBotをブロックするとOpenAIの潜在的なモデル学習への利用を拒否でき、OAI-SearchBotは別に設定できます。Google-ExtendedはGoogle Search、AI Overviews、AI Modeへの掲載可否を決めないため、どちらも引用準備度スコアには含めません。

llms.txtの普及率は依然として低い水準

llms.txt仕様は、AIシステムに対して優先的に引用・参照すべき重要ページを伝えるための提案されているプレーンテキスト形式の慣習です。今回の調査対象では、28ドメイン中11ドメイン(約39%)のみがllms.txtを設置していました。導入しているのは主に開発者向けツールやテック企業(Stripe、Shopify、Vercel、Cloudflare、Notion、GitHub、Linear、Supabaseなど)であり、メディアパブリッシャーでの導入は皆無でした。

まだ普及初期の慣習であることを考えれば不自然ではありません。llms.txtがないこと自体は引用の阻害要因ではなく、主要な検索・回答プラットフォームは適格性の必須条件としていません。対応ツールにとって任意の索引として役立つ可能性はあるため、チェッカーではファイルが存在する場合のみ表示し、未設置を採点しません。

AI検索での可視性に与える影響

実践上の要点は「すべてのAIボットを許可する」ことではなく、狙う可視性の接点を実際の取得クローラーへ対応づけることです。ChatGPT Searchの適格性にはOAI-SearchBot、GoogleのAI検索機能には通常のGooglebotを確認します。モデル学習の制御は分けて扱います。アクセスが作るのは候補資格だけで、引用されるかどうかは関連性、権威性、品質、インデックス、回答選択にも左右されます。

今回のデータから明らかになった、自社サイトで確認すべき3つの注意点は以下の通りです。

  • 意図しないワイルドカードでのブロック:robots.txtでUser-agent: *に対してDisallow: /を設定していると、専用の個別指定グループを持たないすべてのクローラーが遮断されます。特定のクローラー対策として記述したつもりが、想定外のAIエージェントまでブロックしてしまっていないか確認が必要です。
  • クローラーごとの設定の不整合:調査対象の複数のドメインで、一部のAIクローラーのみを許可し、他をブロックする事象が見られました。特定のクローラーのみを許可したままrobots.txtを更新していない場合、後から登場したクローラーが制限的なワイルドカードルールに引っかかっている可能性があります。
  • 任意の発見ファイルを必須要件として扱う:llms.txtは対応ツールの助けになる可能性がありますが、未設置を理由に引用準備度スコアを下げたり、一律の修正を求めたりすべきではありません。

自社サイトの診断方法

無料のAI検索可視性チェッカーは、任意のURLに同じパーサーを適用します。5つの取得クローラーを検査し、任意のllms.txtが存在する場合は表示し、情報抽出のしやすさとOrganizationマークアップも確認します。登録は不要で、URLを入力するだけで優先度順の修正項目を確認できます。

クローラーの巡回可否にとどまらず、実際のAIプラットフォーム上で自社ブランドが言及・引用されているかを包括的に把握するには、AEO Mantisのモニタリング機能が有効です。6つのAIプラットフォーム上で実際のプロンプトを定期実行し、ブランド言及、引用、競合状況、参照された出典の推移を継続的に追跡できます。

本ベンチマークの制限事項

本ベンチマークが検証するのは、robots.txtに対象クローラーへの全サイトブロックがあるかという1点です。クローラーIP、CDNやWAFの挙動、実際の訪問、インデックス、レンダリング後の抽出、引用獲得までは検証していません。5つすべてを許可していても回答に出ない可能性があります。全体像には実際のAI回答のモニタリングが必要です。

対象はカテゴリの多様性を考慮した28ドメインで、統計的な母集団を代表しません。ルールは2026年8月21日に一度取得したもので、今後変わる可能性があります。midjourney.comのrobots.txtはHTTP 403、stackoverflow.comはHTTP 418でした。解析できるルールがなかったため表ではブロック未検出としていますが、インフラが各クローラーを許可していることの確認とは異なります。

本ベンチマークの重要ポイント
  • 調査対象28ドメイン中7ドメインが少なくとも1つの引用・検索クローラーをブロックし、Redditは5つすべてを遮断している。
  • PerplexityBotとClaude-SearchBotは各7ドメイン、OAI-SearchBotは5ドメイン、GooglebotとBingbotは各1ドメインでブロックされている。
  • llms.txtを公開しているのは11ドメインだが、未設置は引用ブロッカーとして採点しない。
  • GPTBotとGoogle-Extendedはコンテンツ利用制御であり、OAI-SearchBotやGooglebotの引用チェックの代わりにはならない。
  • クローラーアクセスが作るのは取得候補の資格であり、インデックス、回答選択、引用を保証しない。

よくある質問

いいえ。1つの直接取得経路は失われますが、他のインデックス済みページや情報源からブランドが知られる可能性はあります。影響はクローラーと回答システムによって異なり、許可しても引用は保証されません。

robots.txtのルールはユーザーエージェントごとに個別設定できるためです。各社との提携交渉、ライセンス契約の有無、特定のAI企業に対する運営方針の違いなどにより、サイトごとに個別の判断が下されています。すべてのAIクローラーを一律に扱う義務はありません。

必須ではありません。Google Search、ChatGPT Search、引用対象の必須条件ではない任意の新しい慣習です。対応ツールには役立つ可能性がありますが、このスコアには影響しません。

頻繁に変更されます。本調査は2026年8月21日時点のスナップショットであり、恒久的な状態ではなく特定時点の観測として扱う必要があります。

はい、可能です。aeomantis.com/tools/ai-visibility-checker の無料AI検索可視性チェッカーでは、任意のURLを入力するだけで同じ解析ロジックによる診断を即座に実行できます(アカウント登録不要)。クローラーのアクセス許可だけでなく、情報抽出の容易性やアイデンティティシグナルも併せて確認できます。