更新於 2026-08-21
哪些網站封鎖 AI 爬蟲?28 個網域的存取基準測試
我們在 2026-08-21 抓取 28 個知名網域的 robots.txt 與 llms.txt,使用 AEO Mantis 的群組感知解析器測試五個引用檢索爬蟲:OAI-SearchBot、PerplexityBot、Claude-SearchBot、Googlebot、Bingbot。28 個網域中有 7 個至少封鎖一個;Reddit 封鎖全部五個。11 個網域發布了 llms.txt。GPTBot 與 Google-Extended 不納入評分,因為它們控制的是其他 AI 用途,而非 ChatGPT Search 或 Google Search 的引用資格。你可以用免費 AI 能見度檢測工具執行同一項檢查。
AI 能見度先要回答一個資格問題:相關的檢索系統能否存取頁面?封鎖平台的搜尋爬蟲,可能令頁面失去該檢索路徑的資格;允許爬蟲則不代表一定會獲得引用。ChatGPT Search 對應的是 OAI-SearchBot,而不是 GPTBot。Google AI Overviews 與 AI Mode 使用 Google 的核心搜尋系統,因此要看 Googlebot;Google-Extended 不控制 Google Search 的收錄資格。
這份測試測了什麼
觀測日期:2026-08-21。樣本為 28 個網域,涵蓋 AI 公司、大型 SaaS、媒體出版商、電商、社群平台與參考網站六個類別。完整網域清單見下方結果表,任何人都可以重新執行測試。
每個網域都透過 HTTPS 抓取 /robots.txt 與 /llms.txt。robots.txt 會按 user-agent 群組解析,而不是只做字串搜尋。當具名群組,或沒有具名群組時適用的萬用群組(*),禁止根路徑(/)且沒有對應的根路徑允許規則,該爬蟲才算被封鎖。這與 AEO Mantis 的網站稽核使用相同規則。
五個計分爬蟲都與搜尋或引用檢索有直接關係:
- OAI-SearchBot — 讓內容可被 ChatGPT Search 發現與納入
- PerplexityBot — 建立 Perplexity 的搜尋索引
- Claude-SearchBot — 為 Anthropic 的搜尋體驗存取網頁內容
- Googlebot — 建立 Google Search 索引,供 AI Overviews 與 AI Mode 使用
- Bingbot — 建立 Bing 搜尋索引
結果:哪些網域封鎖了哪些爬蟲
下表列出樣本中的每個網域。✓ 表示爬蟲被允許;✗ 表示 robots.txt 封鎖了整個網站。llms.txt 欄顯示該網域是否發布了此檔案。
| 網域 | OAI-SearchBot | PerplexityBot | Claude-SearchBot | Googlebot | Bingbot | llms.txt |
|---|---|---|---|---|---|---|
| reddit.com | ✗ | ✗ | ✗ | ✗ | ✗ | 否 |
| amazon.com | ✗ | ✗ | ✗ | ✓ | ✓ | 否 |
| nytimes.com | ✗ | ✗ | ✗ | ✓ | ✓ | 否 |
| x.com | ✗ | ✗ | ✗ | ✓ | ✓ | 是 |
| figma.com | ✗ | ✗ | ✗ | ✓ | ✓ | 否 |
| techcrunch.com | ✓ | ✓ | ✓ | ✓ | ✓ | 否 |
| wired.com | ✓ | ✗ | ✗ | ✓ | ✓ | 否 |
| theguardian.com | ✓ | ✗ | ✗ | ✓ | ✓ | 否 |
| medium.com | ✓ | ✓ | ✓ | ✓ | ✓ | 否 |
| openai.com | ✓ | ✓ | ✓ | ✓ | ✓ | 否 |
| anthropic.com | ✓ | ✓ | ✓ | ✓ | ✓ | 否 |
| perplexity.ai | ✓ | ✓ | ✓ | ✓ | ✓ | 否 |
| huggingface.co | ✓ | ✓ | ✓ | ✓ | ✓ | 否 |
| stripe.com | ✓ | ✓ | ✓ | ✓ | ✓ | 是 |
| shopify.com | ✓ | ✓ | ✓ | ✓ | ✓ | 是 |
| vercel.com | ✓ | ✓ | ✓ | ✓ | ✓ | 是 |
| cloudflare.com | ✓ | ✓ | ✓ | ✓ | ✓ | 是 |
| notion.so | ✓ | ✓ | ✓ | ✓ | ✓ | 是 |
| github.com | ✓ | ✓ | ✓ | ✓ | ✓ | 是 |
| linear.app | ✓ | ✓ | ✓ | ✓ | ✓ | 是 |
| supabase.com | ✓ | ✓ | ✓ | ✓ | ✓ | 是 |
| linkedin.com | ✓ | ✓ | ✓ | ✓ | ✓ | 是 |
| wikipedia.org | ✓ | ✓ | ✓ | ✓ | ✓ | 否 |
| airtable.com | ✓ | ✓ | ✓ | ✓ | ✓ | 否 |
| stability.ai | ✓ | ✓ | ✓ | ✓ | ✓ | 否 |
| midjourney.com | ✓ | ✓ | ✓ | ✓ | ✓ | 否 |
| stackoverflow.com | ✓ | ✓ | ✓ | ✓ | ✓ | 否 |
| aeomantis.com | ✓ | ✓ | ✓ | ✓ | ✓ | 是 |
哪些爬蟲最常被封鎖
Googlebot 與 Bingbot 幾乎被所有網域允許——兩者都只有 Reddit 封鎖。答案引擎專用爬蟲的封鎖率較高:
| 爬蟲 | 允許 | 封鎖 | 封鎖率 |
|---|---|---|---|
| PerplexityBot | 21 | 7 | 25% |
| Claude-SearchBot | 21 | 7 | 25% |
| OAI-SearchBot | 23 | 5 | 18% |
| Googlebot | 27 | 1 | 4% |
| Bingbot | 27 | 1 | 4% |
Amazon、The New York Times、X、Figma 與 Reddit 這五個網域封鎖樣本中的全部三個答案引擎專用爬蟲。Wired 與 The Guardian 允許 OAI-SearchBot,但封鎖 PerplexityBot 和 Claude-SearchBot。這些差異說明,單一的「AI 爬蟲」規則並不足夠;必須針對平台實際使用的檢索路徑逐一檢查。
GPTBot 與 Google-Extended 仍可能是發布者內容使用政策的一部分,但它們回答的是不同問題。封鎖 GPTBot 可拒絕內容被用於 OpenAI 的潛在模型訓練,同時仍可獨立設定 OAI-SearchBot。Google-Extended 不決定 Google Search、AI Overviews 或 AI Mode 的收錄資格,因此兩者都不應計入引用準備度分數。
llms.txt 採用率仍然偏低
llms.txt 慣例是一個新興標準,網站透過發布一個純文字檔案,將 AI 系統指向它們最容易被引用的頁面。在這個樣本中,只有 11 個網域(約 39%)提供了此檔案——採用者偏向開發者工具公司(Stripe、Shopify、Vercel、Cloudflare、Notion、GitHub、Linear、Supabase),而非媒體出版商,後者沒有任何一家發布。
這是仍在早期階段的慣例,因此並不意外。缺少 llms.txt 並不是引用阻礙;主要搜尋與答案平台都沒有把它列為資格要求。若某些工具選擇讀取它,它仍可作為可選索引,因此檢測工具只在檔案存在時顯示,缺少時不計分。
這對 AI 能見度意味著什麼
實際結論不是「允許所有 AI 機械人」,而是把每個目標能見度介面對應到真正的檢索爬蟲。想取得 ChatGPT Search 資格,就檢查 OAI-SearchBot;Google 的 AI 搜尋功能則要維持一般 Googlebot 可抓取。模型訓練控制應分開處理。存取只建立資格,是否獲得引用仍取決於相關性、權威性、品質、索引與答案選擇。
數據中出現了三個值得對照自己網站檢查的模式:
- 無意的萬用封鎖。 robots.txt 中對
User-agent: *設定Disallow: /會封鎖每一隻沒有自己具名群組的爬蟲。如果你為了某隻特定爬蟲加了這條規則、卻忘了它也適用於萬用群組,你可能封鎖了比預期更多的代理。 - 不一致的逐隻政策。 樣本中有幾個網域允許某些 AI 爬蟲但封鎖其他。如果你的團隊只允許某個具名爬蟲,卻沒有在較新的爬蟲出現時更新 robots.txt,它們可能落入限制性的萬用規則。
- 把可選發現檔案當成必要條件。 llms.txt 可能幫助選擇讀取它的工具,但缺少它不應降低引用準備度分數,也不應觸發一律修復。
如何檢查你自己的網站
免費 AI 能見度檢測工具會對任何輸入網址執行相同解析器。它測試五個檢索爬蟲、在可選 llms.txt 存在時加以標示,並檢查可擷取性與 Organization 標記。不需註冊——輸入一個網址,即可取得優先修復清單。
要了解 AI 平台是否真的提及和引用你的品牌——而不僅是它們能否爬取你的網站——AEO Mantis 監測會按排程在六個 AI 平台上執行真實提示詞,並長期追蹤提及、引用、競爭對手和來源。
限制說明
這份基準測試只檢驗一個二元維度:robots.txt 是否對具名爬蟲設定全站封鎖。它不驗證爬蟲 IP、CDN 或 WAF 行為、實際造訪、索引、渲染後擷取,或內容是否獲得引用。允許全部五個爬蟲的網域仍可能不出現在答案中。完整評估需要監測實際 AI 答案,而不只是檢查 robots.txt。
樣本是為類別多樣性而挑選的 28 個網域,不具統計代表性。規則於 2026-08-21 抓取一次,之後可能改變。midjourney.com 的 robots.txt 回傳 HTTP 403,stackoverflow.com 回傳 HTTP 418;因為沒有可解析規則,表格顯示未偵測到封鎖,但這不等於確認其基礎設施允許這些爬蟲。
- 28 個受測網域中有 7 個至少封鎖一個引用檢索爬蟲;Reddit 封鎖全部五個。
- PerplexityBot 與 Claude-SearchBot 各被 7 個網域封鎖,OAI-SearchBot 被 5 個封鎖,Googlebot 與 Bingbot 各被 1 個封鎖。
- 只有 11 個網域發布 llms.txt,但缺少它不會被計為引用阻礙。
- GPTBot 與 Google-Extended 是內容使用控制,不能取代 OAI-SearchBot 或 Googlebot 的引用檢查。
- 爬蟲存取只建立檢索資格,不保證收錄、答案選擇或引用。
常見問題
不是。它會移除一條直接檢索路徑,但平台仍可能從其他已索引頁面或來源得知品牌。實際影響取決於具體爬蟲與答案系統;允許爬蟲也不保證獲得引用。
robots.txt 規則是按使用者代理個別設定的。網站根據談判、授權條款或對特定 AI 公司的政策立場,做出個別決定。並沒有要求必須對所有 AI 爬蟲一視同仁。
不是。它是可選的新興慣例,不是 Google Search、ChatGPT Search 或引用資格的必要條件。部分工具可能讀取它,因此發布仍可能有用,但不會影響這項分數。
經常改變。這份快照反映 2026-08-21 的觀測狀態,應視為一個時間點,而非永久不變的結論。
可以。aeomantis.com/tools/ai-visibility-checker 的免費 AI 能見度檢測工具會在你輸入的任何網址上執行相同的解析器,不需註冊。它還會檢查爬蟲存取之外的可擷取性和身分標記。