為什麼需要在 robots.txt 中明確允許 AI 爬蟲
大多數網站的 robots.txt 要麼是空白,要麼只有通用的規則。這種做法對一般搜尋引擎爬蟲沒問題,但對 AI 爬蟲來說,明確的允許指令才能確保內容被正確爬取。
目前 ChatGPT、Claude、Perplexity、Google AI Overview 等服務都推出了各自的爬蟲識別符。如果你的 robots.txt 沒有明確允許這些爬蟲,它們可能會因為預設行為而跳過你的網站,導致內容無法被引用。
主要 AI 爬蟲清單
目前活躍的 AI 爬蟲已有多種,分別隸屬於不同平台。以下是完整的爬蟲名稱與所屬平台對應表。
| AI 爬蟲名稱 | 所屬平台 |
|---|---|
| GPTBot | OpenAI/ChatGPT |
| ChatGPT-User | OpenAI/ChatGPT |
| ClaudeBot | Anthropic/Claude |
| Claude-Web | Anthropic/Claude |
| PerplexityBot | Perplexity |
| Perplexity-User | Perplexity |
| Google-Extended | Google AI Overview |
| Applebot | Apple Intelligence |
| Applebot-Extended | Apple Intelligence |
如何在 robots.txt 中設定允許
在 robots.txt 檔案中為每個 AI 爬蟲新增一個區段。最簡單的做法是在檔案末尾加入規則:每個爬蟲單獨一行 User-agent,後面跟允許存取的規則即可。
檔案更新後無須重新提交,爬蟲會自動讀取最新規則。如果需要禁止某些路徑,可在同一爬蟲區段加上對應的限制規則。robots.txt 檔案必須放在網站根目錄。
- 每個 AI 爬蟲需要獨立的 User-agent 區段
- 可視需要為特定爬蟲禁止某些路徑
- 修改後無須提交或等待審核
Venture AI Agency 的實踐經驗
我們已在多個上線網站中驗證過這份 AI 爬蟲允許清單。通過明確設定 robots.txt,這些網站開始陸續獲得來自 ChatGPT、Claude、Perplexity 和 Google AI Overview 的引用。
關鍵觀察是,許多企業網站因為沒有主動在 robots.txt 中明確允許 AI 爬蟲,無形中錯失了被 AI 服務引用的機會。這是一個簡單但容易被忽視的 GEO 策略步驟。