重點摘要

AI 爬蟲負責三種不同工作(訓練、搜尋索引、按需即時抓取),把三者混為一談是最常見、代價也最高的 robots.txt 錯誤。封鎖訓練爬蟲不會令你在即時答案中有任何損失;封鎖搜尋爬蟲則令你無法被引用。兩項大部分參考資料忽略的事實:DeepSeek 根本沒有公開任何 user-agent,因此 robots.txt 無法管理它;而對任何服務香港的企業而言,中國模型的爬蟲比 OpenAI 的更重要——因為 ChatGPT 與 Claude 在香港被地區限制。

三種工作,不是一種 #

一個 AI 爬蟲在做三種工作的其中一種,而這個分別決定了封鎖它的代價是甚麼。

由此可見:封鎖 GPTBot 但允許 OAI-SearchBot,可讓你不進入訓練資料,同時在 ChatGPT Search 中完全可被引用。而一個籠統的萬用字元封鎖,會令你在即時答案中完全消失——通常並非有意為之。

各個爬蟲 #

資料截至 2026 年 8 月 24 日。「香港可達」一欄標示該爬蟲背後的助理,香港消費者是否毋須 VPN 即可使用。

User-agent營運商工作遵守 robots.txt香港可達
GPTBotOpenAI訓練已聲明
OAI-SearchBotOpenAI搜尋索引已聲明
ChatGPT-UserOpenAI即時抓取已聲明
ClaudeBotAnthropic訓練已聲明
Claude-SearchBotAnthropic搜尋索引已聲明
Claude-UserAnthropic即時抓取已聲明
Google-ExtendedGoogle訓練(Gemini、Vertex)已聲明
PerplexityBotPerplexity搜尋索引已聲明
Perplexity-UserPerplexity即時抓取已聲明
QwenBot阿里巴巴搜尋索引已聲明
TongyiBot阿里巴巴訓練已聲明
Qwen-User阿里巴巴即時抓取已聲明
AliyunBot阿里雲混合已聲明
Bytespider字節跳動訓練有爭議
PetalBot華為搜尋索引已聲明
並無公開DeepSeek即時抓取不適用
Applebot-ExtendedApple訓練已聲明部分
AmazonbotAmazon搜尋索引已聲明部分
Meta-ExternalAgentMeta訓練已聲明部分
CCBotCommon Crawl訓練(供多個模型使用)已聲明
cohere-aiCohere訓練已聲明部分

DeepSeek 並無公開 user-agent #

DeepSeek 並無公開爬蟲 user-agent,其網頁抓取在伺服器紀錄中呈現為一般瀏覽器流量。由於 robots.txt 以比對 user-agent 字串運作,因此沒有任何指令可以針對 DeepSeek——無論是允許還是封鎖。DeepSeekBot 之類的字串在社群封鎖清單中流傳,但並非官方公開的 token,寫進規則亦不會比對到任何東西。

對於向香港或更廣泛的中文市場銷售的企業而言——DeepSeek 在這些市場承載相當可觀的消費者使用量——這代表 DeepSeek 的能見度完全無法透過爬蟲權限管理。它取決於模型檢索到甚麼,以及第三方來源怎樣描述你,因此重心落在名錄收錄、評價平台,以及一致的公開事實之上,而不是 robots 檔案裡的任何一行。

為何在香港,中國爬蟲比 OpenAI 的更重要 #

大部分 AI 爬蟲參考資料是為美國企業而寫,並把 GPTBot 當作清單上最重要的一項。對於服務香港的企業,這個排序是倒轉的。ChatGPT 與 Claude 被地區限制,因此 GPTBotClaudeBot 管理的是本地客戶根本打不開的助理;而 QwenBotQwen-UserBytespiderPetalBot 管理的,才是他們能打開的那些。一間香港診所若有一套一絲不苟的 OpenAI robots 政策、卻沒有任何阿里巴巴相關規則,等於為錯誤的受眾做了優化。

一份歡迎全部爬蟲的 robots.txt #

對大部分企業而言,正確答案是全部允許:一間希望 AI 推薦自己的執業機構,封鎖那些令推薦成為可能的爬蟲並無好處。真正的例外是授權內容的出版商,他們應該有意識地作出這個決定。

值得避免的錯誤,比「封鎖」更隱蔽:在萬用 User-agent: * 之下的一句 Disallow,或是一個未關掉的 Cloudflare AI 機械人開關,都會不聲不響地排除上表所有爬蟲,無論檔案其餘部分寫了甚麼。除了檢查檔案,也要檢查平台設定——通常是設定說了算。

核實爬蟲是否名副其實 #

User-agent 字串可以輕易偽造,因此一筆自稱 GPTBot 的紀錄,也可能只是一個冒名的抓取程式。真正重視此事的供應商會公開 IP 範圍,而對請求來源 IP 做反向 DNS 是標準的核實方法。如果你要根據爬蟲流量作決策,這件事很重要;但如果只是要「被允許」,偽造並不是需要擔心的問題。

引用本頁

SimplyAI(2026)。AI 爬蟲完整參考。更新於 2026 年 8 月 24 日。https://simplyai.work/zh-Hant/learn/ai-crawler-reference/