AI 可見度詞彙表
更新於 2026-07-06
什麼是 AI 爬蟲?
重點摘要
AI 爬蟲(AI crawlers) 是為 AI 答案引擎和模型訓練擷取網頁的機械人。它們的行為和目的與 Googlebot 不同:許多不會執行 JavaScript、抓取頻率較低,主要用於即時搜尋和訓練,而非建立搜尋索引。是否允許它們抓取網站,需要在獲得引用和控制內容用途之間作出取捨。
定義
AI 爬蟲是生成式答案引擎背後的資料擷取工具。有些用於即時檢索,讓 Perplexity 或具備網絡搜尋功能的 ChatGPT 在回答時抓取和引用頁面;有些則用於模型訓練,建立模型日後憑既有知識回答時所依賴的資料。兩者用途不同:封鎖檢索爬蟲會令頁面無法獲得即時引用;封鎖訓練爬蟲則會限制內容進入模型的累積知識。
AI 爬蟲 vs Googlebot
Googlebot 主要建立搜尋索引,讓頁面參與排名並帶來流量。AI 爬蟲則擷取頁面供引擎引用、摘要或學習,通常不會帶來點擊。許多 AI 爬蟲不會執行 JavaScript,因此依賴客戶端呈現的內容可能完全不可見;它們的抓取頻率較低、逾時時間較短,而且各自使用不同的 user agent,需要相應的 robots 規則。
允許、封鎖,或選擇性處理
這是商業決策,不是技術決策。封鎖所有 AI 爬蟲可保護內容,但也讓你完全退出 AI 答案——沒有引用、沒有來自檢索的提及。許多團隊折衷:允許檢索爬蟲(以便被引用),封鎖訓練爬蟲(以免內容被用來改進競爭對手模型)。
如何檢查 AI 爬蟲能否讀到你
伺服器端呈現且可供爬蟲抓取的頁面是基本要求。網站審核會模擬 AI 爬蟲擷取頁面,並列出阻礙引用的因素,包括依賴 JavaScript 的內容、被封鎖的爬蟲、回應緩慢和缺少結構。
重要資訊
- AI 爬蟲分別服務檢索(引用)與訓練(模型知識)。
- 許多 AI 爬蟲不執行 JavaScript——客戶端渲染內容對它們不可見。
- 封鎖檢索爬蟲會讓你退出引用;封鎖訓練爬蟲會讓你退出模型知識。
- 選擇性允許/封鎖很常見:允許引用爬蟲,封鎖訓練爬蟲。