跳到主要內容
部落格

更新於 2026-08-21

哪些網站封鎖 AI 爬蟲?28 個網域的存取基準測試

重點摘要

我們在 2026-08-21 抓取 28 個知名網域的 robots.txt 與 llms.txt,使用 AEO Mantis 的群組感知解析器測試五個引用檢索爬蟲:OAI-SearchBot、PerplexityBot、Claude-SearchBot、Googlebot、Bingbot。28 個網域中有 7 個至少封鎖一個;Reddit 封鎖全部五個。11 個網域發布了 llms.txt。GPTBot 與 Google-Extended 不納入評分,因為它們控制的是其他 AI 用途,而非 ChatGPT Search 或 Google Search 的引用資格。你可以用免費 AI 能見度檢測工具執行同一項檢查。

AI 能見度先要回答一個資格問題:相關的檢索系統能否存取頁面?封鎖平台的搜尋爬蟲,可能令頁面失去該檢索路徑的資格;允許爬蟲則不代表一定會獲得引用。ChatGPT Search 對應的是 OAI-SearchBot,而不是 GPTBot。Google AI Overviews 與 AI Mode 使用 Google 的核心搜尋系統,因此要看 Googlebot;Google-Extended 不控制 Google Search 的收錄資格。

這份測試測了什麼

觀測日期:2026-08-21。樣本為 28 個網域,涵蓋 AI 公司、大型 SaaS、媒體出版商、電商、社群平台與參考網站六個類別。完整網域清單見下方結果表,任何人都可以重新執行測試。

每個網域都透過 HTTPS 抓取 /robots.txt/llms.txt。robots.txt 會按 user-agent 群組解析,而不是只做字串搜尋。當具名群組,或沒有具名群組時適用的萬用群組(*),禁止根路徑(/)且沒有對應的根路徑允許規則,該爬蟲才算被封鎖。這與 AEO Mantis 的網站稽核使用相同規則。

五個計分爬蟲都與搜尋或引用檢索有直接關係:

  • OAI-SearchBot — 讓內容可被 ChatGPT Search 發現與納入
  • PerplexityBot — 建立 Perplexity 的搜尋索引
  • Claude-SearchBot — 為 Anthropic 的搜尋體驗存取網頁內容
  • Googlebot — 建立 Google Search 索引,供 AI Overviews 與 AI Mode 使用
  • Bingbot — 建立 Bing 搜尋索引

結果:哪些網域封鎖了哪些爬蟲

下表列出樣本中的每個網域。✓ 表示爬蟲被允許;✗ 表示 robots.txt 封鎖了整個網站。llms.txt 欄顯示該網域是否發布了此檔案。

網域OAI-SearchBotPerplexityBotClaude-SearchBotGooglebotBingbotllms.txt
reddit.com
amazon.com
nytimes.com
x.com
figma.com
techcrunch.com
wired.com
theguardian.com
medium.com
openai.com
anthropic.com
perplexity.ai
huggingface.co
stripe.com
shopify.com
vercel.com
cloudflare.com
notion.so
github.com
linear.app
supabase.com
linkedin.com
wikipedia.org
airtable.com
stability.ai
midjourney.com
stackoverflow.com
aeomantis.com

哪些爬蟲最常被封鎖

Googlebot 與 Bingbot 幾乎被所有網域允許——兩者都只有 Reddit 封鎖。答案引擎專用爬蟲的封鎖率較高:

爬蟲允許封鎖封鎖率
PerplexityBot21725%
Claude-SearchBot21725%
OAI-SearchBot23518%
Googlebot2714%
Bingbot2714%

Amazon、The New York Times、X、Figma 與 Reddit 這五個網域封鎖樣本中的全部三個答案引擎專用爬蟲。Wired 與 The Guardian 允許 OAI-SearchBot,但封鎖 PerplexityBot 和 Claude-SearchBot。這些差異說明,單一的「AI 爬蟲」規則並不足夠;必須針對平台實際使用的檢索路徑逐一檢查。

GPTBot 與 Google-Extended 仍可能是發布者內容使用政策的一部分,但它們回答的是不同問題。封鎖 GPTBot 可拒絕內容被用於 OpenAI 的潛在模型訓練,同時仍可獨立設定 OAI-SearchBot。Google-Extended 不決定 Google Search、AI Overviews 或 AI Mode 的收錄資格,因此兩者都不應計入引用準備度分數。

llms.txt 採用率仍然偏低

llms.txt 慣例是一個新興標準,網站透過發布一個純文字檔案,將 AI 系統指向它們最容易被引用的頁面。在這個樣本中,只有 11 個網域(約 39%)提供了此檔案——採用者偏向開發者工具公司(Stripe、Shopify、Vercel、Cloudflare、Notion、GitHub、Linear、Supabase),而非媒體出版商,後者沒有任何一家發布。

這是仍在早期階段的慣例,因此並不意外。缺少 llms.txt 並不是引用阻礙;主要搜尋與答案平台都沒有把它列為資格要求。若某些工具選擇讀取它,它仍可作為可選索引,因此檢測工具只在檔案存在時顯示,缺少時不計分。

這對 AI 能見度意味著什麼

實際結論不是「允許所有 AI 機械人」,而是把每個目標能見度介面對應到真正的檢索爬蟲。想取得 ChatGPT Search 資格,就檢查 OAI-SearchBot;Google 的 AI 搜尋功能則要維持一般 Googlebot 可抓取。模型訓練控制應分開處理。存取只建立資格,是否獲得引用仍取決於相關性、權威性、品質、索引與答案選擇。

數據中出現了三個值得對照自己網站檢查的模式:

  • 無意的萬用封鎖。 robots.txt 中對 User-agent: * 設定 Disallow: / 會封鎖每一隻沒有自己具名群組的爬蟲。如果你為了某隻特定爬蟲加了這條規則、卻忘了它也適用於萬用群組,你可能封鎖了比預期更多的代理。
  • 不一致的逐隻政策。 樣本中有幾個網域允許某些 AI 爬蟲但封鎖其他。如果你的團隊只允許某個具名爬蟲,卻沒有在較新的爬蟲出現時更新 robots.txt,它們可能落入限制性的萬用規則。
  • 把可選發現檔案當成必要條件。 llms.txt 可能幫助選擇讀取它的工具,但缺少它不應降低引用準備度分數,也不應觸發一律修復。

如何檢查你自己的網站

免費 AI 能見度檢測工具會對任何輸入網址執行相同解析器。它測試五個檢索爬蟲、在可選 llms.txt 存在時加以標示,並檢查可擷取性與 Organization 標記。不需註冊——輸入一個網址,即可取得優先修復清單。

要了解 AI 平台是否真的提及和引用你的品牌——而不僅是它們能否爬取你的網站——AEO Mantis 監測會按排程在六個 AI 平台上執行真實提示詞,並長期追蹤提及、引用、競爭對手和來源。

限制說明

這份基準測試只檢驗一個二元維度:robots.txt 是否對具名爬蟲設定全站封鎖。它不驗證爬蟲 IP、CDN 或 WAF 行為、實際造訪、索引、渲染後擷取,或內容是否獲得引用。允許全部五個爬蟲的網域仍可能不出現在答案中。完整評估需要監測實際 AI 答案,而不只是檢查 robots.txt。

樣本是為類別多樣性而挑選的 28 個網域,不具統計代表性。規則於 2026-08-21 抓取一次,之後可能改變。midjourney.com 的 robots.txt 回傳 HTTP 403,stackoverflow.com 回傳 HTTP 418;因為沒有可解析規則,表格顯示未偵測到封鎖,但這不等於確認其基礎設施允許這些爬蟲。

基準測試重點
  • 28 個受測網域中有 7 個至少封鎖一個引用檢索爬蟲;Reddit 封鎖全部五個。
  • PerplexityBot 與 Claude-SearchBot 各被 7 個網域封鎖,OAI-SearchBot 被 5 個封鎖,Googlebot 與 Bingbot 各被 1 個封鎖。
  • 只有 11 個網域發布 llms.txt,但缺少它不會被計為引用阻礙。
  • GPTBot 與 Google-Extended 是內容使用控制,不能取代 OAI-SearchBot 或 Googlebot 的引用檢查。
  • 爬蟲存取只建立檢索資格,不保證收錄、答案選擇或引用。

常見問題

不是。它會移除一條直接檢索路徑,但平台仍可能從其他已索引頁面或來源得知品牌。實際影響取決於具體爬蟲與答案系統;允許爬蟲也不保證獲得引用。

robots.txt 規則是按使用者代理個別設定的。網站根據談判、授權條款或對特定 AI 公司的政策立場,做出個別決定。並沒有要求必須對所有 AI 爬蟲一視同仁。

不是。它是可選的新興慣例,不是 Google Search、ChatGPT Search 或引用資格的必要條件。部分工具可能讀取它,因此發布仍可能有用,但不會影響這項分數。

經常改變。這份快照反映 2026-08-21 的觀測狀態,應視為一個時間點,而非永久不變的結論。

可以。aeomantis.com/tools/ai-visibility-checker 的免費 AI 能見度檢測工具會在你輸入的任何網址上執行相同的解析器,不需註冊。它還會檢查爬蟲存取之外的可擷取性和身分標記。