# AI 爬蟲完整參考

**來源：** https://simplyai.work/zh-Hant/learn/ai-crawler-reference/
**發佈者：** SimplyAI (https://simplyai.work/) · **語言：** zh-Hant · **更新：** 2026-08-24
**English edition:** https://simplyai.work/learn/ai-crawler-reference/

> **重點摘要** — AI 爬蟲負責三種不同工作（訓練、搜尋索引、按需即時抓取），把三者混為一談是最常見、
> 代價也最高的 robots.txt 錯誤。封鎖訓練爬蟲不會令你在即時答案中有任何損失；封鎖搜尋爬蟲則令你無法
> 被引用。兩項大部分參考資料忽略的事實：DeepSeek 根本沒有公開任何 user-agent，因此 robots.txt 無法
> 管理它；而對任何服務香港的企業而言，中國模型的爬蟲比 OpenAI 的更重要——因為 ChatGPT 與 Claude
> 在香港被地區限制。

## 三種工作，不是一種

一個 AI 爬蟲在做三種工作的其中一種，而這個分別決定了封鎖它的代價是甚麼。

- **訓練爬蟲**收集會成為模型基礎知識一部分的內容。影響緩慢、分散，並在下一個模型版本才出現。
  包括 `GPTBot`、`ClaudeBot`、`Google-Extended`、`Applebot-Extended`、`Meta-ExternalAgent`、
  `CCBot` 及 `TongyiBot`。
- **搜尋爬蟲**建立助理在回答時查詢的索引——這一組決定你今天能否出現在即時、有依據的答案中。
  包括 `OAI-SearchBot`、`Claude-SearchBot`、`PerplexityBot`、`Amazonbot`、`QwenBot`。
- **即時抓取代理**因為某段對話需要而抓取特定頁面。包括 `ChatGPT-User`、`Claude-User`、
  `Perplexity-User`、`Qwen-User`。

由此可見：封鎖 `GPTBot` 但允許 `OAI-SearchBot`，可讓你不進入訓練資料，同時在 ChatGPT Search 中
完全可被引用。而一個籠統的萬用字元封鎖，會令你在即時答案中完全消失——通常並非有意為之。

## 各個爬蟲

資料截至 2026 年 8 月 24 日。「香港可達」一欄標示該爬蟲背後的助理，香港消費者是否毋須 VPN 即可使用。

| User-agent | 營運商 | 工作 | 遵守 robots.txt | 香港可達 |
|---|---|---|---|---|
| `GPTBot` | OpenAI | 訓練 | 已聲明 | 否 |
| `OAI-SearchBot` | OpenAI | 搜尋索引 | 已聲明 | 否 |
| `ChatGPT-User` | OpenAI | 即時抓取 | 已聲明 | 否 |
| `ClaudeBot` | Anthropic | 訓練 | 已聲明 | 否 |
| `Claude-SearchBot` | Anthropic | 搜尋索引 | 已聲明 | 否 |
| `Claude-User` | Anthropic | 即時抓取 | 已聲明 | 否 |
| `Google-Extended` | Google | 訓練（Gemini、Vertex） | 已聲明 | 是 |
| `PerplexityBot` | Perplexity | 搜尋索引 | 已聲明 | 是 |
| `Perplexity-User` | Perplexity | 即時抓取 | 已聲明 | 是 |
| `QwenBot` | 阿里巴巴 | 搜尋索引 | 已聲明 | 是 |
| `TongyiBot` | 阿里巴巴 | 訓練 | 已聲明 | 是 |
| `Qwen-User` | 阿里巴巴 | 即時抓取 | 已聲明 | 是 |
| `AliyunBot` | 阿里雲 | 混合 | 已聲明 | 是 |
| `Bytespider` | 字節跳動 | 訓練 | 有爭議 | 是 |
| `PetalBot` | 華為 | 搜尋索引 | 已聲明 | 是 |
| *並無公開* | DeepSeek | 即時抓取 | 不適用 | 是 |
| `Applebot-Extended` | Apple | 訓練 | 已聲明 | 部分 |
| `Amazonbot` | Amazon | 搜尋索引 | 已聲明 | 部分 |
| `Meta-ExternalAgent` | Meta | 訓練 | 已聲明 | 部分 |
| `CCBot` | Common Crawl | 訓練（供多個模型使用） | 已聲明 | 是 |
| `cohere-ai` | Cohere | 訓練 | 已聲明 | 部分 |

## DeepSeek 並無公開 user-agent

DeepSeek 並無公開爬蟲 user-agent，其網頁抓取在伺服器紀錄中呈現為一般瀏覽器流量。由於 robots.txt
以比對 user-agent 字串運作，因此沒有任何指令可以針對 DeepSeek——無論是允許還是封鎖。`DeepSeekBot`
之類的字串在社群封鎖清單中流傳，但並非官方公開的 token，寫進規則亦不會比對到任何東西。

對於向香港或更廣泛的中文市場銷售的企業而言——DeepSeek 在這些市場承載相當可觀的消費者使用量——這
代表 DeepSeek 的能見度完全無法透過爬蟲權限管理。它取決於模型檢索到甚麼，以及第三方來源怎樣描述你，
因此重心落在名錄收錄、評價平台，以及一致的公開事實之上，而不是 robots 檔案裡的任何一行。

## 為何在香港，中國爬蟲比 OpenAI 的更重要

大部分 AI 爬蟲參考資料是為美國企業而寫，並把 `GPTBot` 當作清單上最重要的一項。對於服務香港的企業，
這個排序是倒轉的。ChatGPT 與 Claude 被地區限制，因此 `GPTBot` 與 `ClaudeBot` 管理的是本地客戶根本
打不開的助理；而 `QwenBot`、`Qwen-User`、`Bytespider` 及 `PetalBot` 管理的，才是他們能打開的那些。
一間香港診所若有一套一絲不苟的 OpenAI robots 政策、卻沒有任何阿里巴巴相關規則，等於為錯誤的受眾
做了優化。

## 一份歡迎全部爬蟲的 robots.txt

對大部分企業而言，正確答案是全部允許：一間希望 AI 推薦自己的執業機構，封鎖那些令推薦成為可能的爬蟲
並無好處。真正的例外是授權內容的出版商，他們應該有意識地作出這個決定。

值得避免的錯誤，比「封鎖」更隱蔽：在萬用 `User-agent: *` 之下的一句 `Disallow`，或是一個未關掉的
Cloudflare AI 機械人開關，都會不聲不響地排除上表所有爬蟲，無論檔案其餘部分寫了甚麼。除了檢查檔案，
也要檢查平台設定——通常是設定說了算。

## 核實爬蟲是否名副其實

User-agent 字串可以輕易偽造，因此一筆自稱 `GPTBot` 的紀錄，也可能只是一個冒名的抓取程式。真正重視
此事的供應商會公開 IP 範圍，而對請求來源 IP 做反向 DNS 是標準的核實方法。如果你要根據爬蟲流量作
決策，這件事很重要；但如果只是要「被允許」，偽造並不是需要擔心的問題。

## 常見問題

**DeepSeek 有沒有爬蟲 user-agent？** 沒有。其抓取呈現為一般瀏覽器流量，因此沒有任何 robots.txt
規則可以針對它。`DeepSeekBot` 屬社群流傳，並非官方 token。

**GPTBot 與 OAI-SearchBot 有甚麼分別？** GPTBot 收集訓練內容，影響模型的整體知識。OAI-SearchBot
建立 ChatGPT Search 在回答時查詢的索引，影響你能否出現在即時、有依據的答案中。ChatGPT-User 則在
對話期間按需抓取某一頁。

**我應該允許哪些 AI 爬蟲？** 對大部分企業而言，全部。搜尋索引與即時抓取類最關鍵，因為它們決定即時
可引用性：OAI-SearchBot、Claude-SearchBot、PerplexityBot、Google-Extended、QwenBot、Qwen-User。

**AI 爬蟲會遵守 robots.txt 嗎？** OpenAI、Anthropic、Google、Apple 及 Perplexity 均聲明其爬蟲會
遵守。這屬聲明的政策而非技術保證；而沒有公開 user-agent 的爬蟲根本無法以 robots.txt 管理。

## 資料來源

1. OpenAI. *Overview of OpenAI Crawlers.* https://platform.openai.com/docs/bots
2. Anthropic. *Does Anthropic crawl data from the web?* https://support.anthropic.com/en/articles/8896518
3. Google Search Central. *Google crawlers and user-agent strings.* https://developers.google.com/search/docs/crawling-indexing/overview-google-crawlers
4. xSeek Docs. *DeepSeek user agents.* https://www.xseek.io/docs/deepseek-user-agents
5. xSeek Docs. *Qwen user agents.* https://www.xseek.io/docs/qwen-user-agents

---

**引用本頁：** SimplyAI（2026）。*AI 爬蟲完整參考。* 更新於 2026 年 8 月 24 日。
https://simplyai.work/zh-Hant/learn/ai-crawler-reference/
