AI 爬蟲負責三種不同工作(訓練、搜尋索引、按需即時抓取),把三者混為一談是最常見、代價也最高的 robots.txt 錯誤。封鎖訓練爬蟲不會令你在即時答案中有任何損失;封鎖搜尋爬蟲則令你無法被引用。兩項大部分參考資料忽略的事實:DeepSeek 根本沒有公開任何 user-agent,因此 robots.txt 無法管理它;而對任何服務香港的企業而言,中國模型的爬蟲比 OpenAI 的更重要——因為 ChatGPT 與 Claude 在香港被地區限制。
三種工作,不是一種 #
一個 AI 爬蟲在做三種工作的其中一種,而這個分別決定了封鎖它的代價是甚麼。
- 訓練爬蟲收集會成為模型基礎知識一部分的內容。影響緩慢、分散,並在下一個模型版本才出現。包括
GPTBot、ClaudeBot、Google-Extended、Applebot-Extended、Meta-ExternalAgent、CCBot及TongyiBot。 - 搜尋爬蟲建立助理在回答時查詢的索引——這一組決定你今天能否出現在即時、有依據的答案中。包括
OAI-SearchBot、Claude-SearchBot、PerplexityBot、Amazonbot、QwenBot。 - 即時抓取代理因為某段對話需要而抓取特定頁面。包括
ChatGPT-User、Claude-User、Perplexity-User、Qwen-User。
由此可見:封鎖 GPTBot 但允許 OAI-SearchBot,可讓你不進入訓練資料,同時在 ChatGPT Search 中完全可被引用。而一個籠統的萬用字元封鎖,會令你在即時答案中完全消失——通常並非有意為之。
各個爬蟲 #
資料截至 2026 年 8 月 24 日。「香港可達」一欄標示該爬蟲背後的助理,香港消費者是否毋須 VPN 即可使用。
| User-agent | 營運商 | 工作 | 遵守 robots.txt | 香港可達 |
|---|---|---|---|---|
GPTBot | OpenAI | 訓練 | 已聲明 | 否 |
OAI-SearchBot | OpenAI | 搜尋索引 | 已聲明 | 否 |
ChatGPT-User | OpenAI | 即時抓取 | 已聲明 | 否 |
ClaudeBot | Anthropic | 訓練 | 已聲明 | 否 |
Claude-SearchBot | Anthropic | 搜尋索引 | 已聲明 | 否 |
Claude-User | Anthropic | 即時抓取 | 已聲明 | 否 |
Google-Extended | 訓練(Gemini、Vertex) | 已聲明 | 是 | |
PerplexityBot | Perplexity | 搜尋索引 | 已聲明 | 是 |
Perplexity-User | Perplexity | 即時抓取 | 已聲明 | 是 |
QwenBot | 阿里巴巴 | 搜尋索引 | 已聲明 | 是 |
TongyiBot | 阿里巴巴 | 訓練 | 已聲明 | 是 |
Qwen-User | 阿里巴巴 | 即時抓取 | 已聲明 | 是 |
AliyunBot | 阿里雲 | 混合 | 已聲明 | 是 |
Bytespider | 字節跳動 | 訓練 | 有爭議 | 是 |
PetalBot | 華為 | 搜尋索引 | 已聲明 | 是 |
| 並無公開 | DeepSeek | 即時抓取 | 不適用 | 是 |
Applebot-Extended | Apple | 訓練 | 已聲明 | 部分 |
Amazonbot | Amazon | 搜尋索引 | 已聲明 | 部分 |
Meta-ExternalAgent | Meta | 訓練 | 已聲明 | 部分 |
CCBot | Common Crawl | 訓練(供多個模型使用) | 已聲明 | 是 |
cohere-ai | Cohere | 訓練 | 已聲明 | 部分 |
DeepSeek 並無公開 user-agent #
DeepSeek 並無公開爬蟲 user-agent,其網頁抓取在伺服器紀錄中呈現為一般瀏覽器流量。由於 robots.txt 以比對 user-agent 字串運作,因此沒有任何指令可以針對 DeepSeek——無論是允許還是封鎖。DeepSeekBot 之類的字串在社群封鎖清單中流傳,但並非官方公開的 token,寫進規則亦不會比對到任何東西。
對於向香港或更廣泛的中文市場銷售的企業而言——DeepSeek 在這些市場承載相當可觀的消費者使用量——這代表 DeepSeek 的能見度完全無法透過爬蟲權限管理。它取決於模型檢索到甚麼,以及第三方來源怎樣描述你,因此重心落在名錄收錄、評價平台,以及一致的公開事實之上,而不是 robots 檔案裡的任何一行。
為何在香港,中國爬蟲比 OpenAI 的更重要 #
大部分 AI 爬蟲參考資料是為美國企業而寫,並把 GPTBot 當作清單上最重要的一項。對於服務香港的企業,這個排序是倒轉的。ChatGPT 與 Claude 被地區限制,因此 GPTBot 與 ClaudeBot 管理的是本地客戶根本打不開的助理;而 QwenBot、Qwen-User、Bytespider 及 PetalBot 管理的,才是他們能打開的那些。一間香港診所若有一套一絲不苟的 OpenAI robots 政策、卻沒有任何阿里巴巴相關規則,等於為錯誤的受眾做了優化。
一份歡迎全部爬蟲的 robots.txt #
對大部分企業而言,正確答案是全部允許:一間希望 AI 推薦自己的執業機構,封鎖那些令推薦成為可能的爬蟲並無好處。真正的例外是授權內容的出版商,他們應該有意識地作出這個決定。
值得避免的錯誤,比「封鎖」更隱蔽:在萬用 User-agent: * 之下的一句 Disallow,或是一個未關掉的 Cloudflare AI 機械人開關,都會不聲不響地排除上表所有爬蟲,無論檔案其餘部分寫了甚麼。除了檢查檔案,也要檢查平台設定——通常是設定說了算。
核實爬蟲是否名副其實 #
User-agent 字串可以輕易偽造,因此一筆自稱 GPTBot 的紀錄,也可能只是一個冒名的抓取程式。真正重視此事的供應商會公開 IP 範圍,而對請求來源 IP 做反向 DNS 是標準的核實方法。如果你要根據爬蟲流量作決策,這件事很重要;但如果只是要「被允許」,偽造並不是需要擔心的問題。
SimplyAI(2026)。AI 爬蟲完整參考。更新於 2026 年 8 月 24 日。https://simplyai.work/zh-Hant/learn/ai-crawler-reference/