我的 robots.txt 該放行哪些 AI 爬蟲?哪些封鎖了也不會失去可見度?
搜尋型與使用者型爬蟲決定助理讀不讀得到你的商品頁。訓練型爬蟲不會,每家廠商自己都這麼寫。
- 不適用情況
- 透過 Shopify Catalog 送到 ChatGPT、Copilot 或其他已啟用通路的商品資料,不經過 robots.txt。robots.txt 的決定只改變爬蟲在開放網頁上讀到什麼。 [8] [10]
- 為什麼重要
- OpenAI 寫明退出 OAI-SearchBot 的網站不會出現在 ChatGPT 搜尋回答裡;Google 寫明 Googlebot 的規則就是 AI Overviews 與 AI Mode 的控制項。寫錯一行就少掉一條路徑。 [1] [5]
- 要做的事(也可能是不用做)
- 讀你線上的 robots.txt。每一個搜尋型與使用者型爬蟲都保持放行。訓練型爬蟲依你的同意意願決定,因為 OpenAI、Google 與 Anthropic 都寫明訓練用的 token 不決定搜尋收錄。 [1] [4] [2]
- 查證於
- 2026年9月5日
什麼時候第三方值得付錢,你又不必買什麼
- 什麼時候付錢請人做才划算
- 只有在無頭或自訂店面躲在會於網路層挑戰爬蟲的防火牆或 CDN 後面時,付錢請人處理才划算;那一層 robots.txt 看不到也修不了。 [8]
可能有 app、範本或代理商提議替你的商店封鎖 AI 爬蟲。這個提議把兩種不同的爬蟲包在同一個詞裡。一種是替購物者回答問題時去讀頁面;另一種是蒐集頁面拿去訓練模型。每家廠商都寫明自家哪個爬蟲做哪件事,也都寫明封鎖訓練型爬蟲不影響搜尋收錄。整個決定就在這裡。
robots.txt 在 Shopify 商店管得到什麼
Shopify 的 robots.txt 說明把兩條路徑分開。送往 ChatGPT 或 Microsoft Copilot 這類已啟用代理式店面的商品資料,是經由 Shopify Catalog 傳送,與 robots.txt 無關。AI 爬蟲也可能直接從開放網頁讀你的商店,robots.txt 管的是這一條。
同一頁寫了三個限制。Shopify 代管的商店,網路層的機器人管理由 Shopify 處理,你不需要做任何事。robots.txt 裡的規則屬於方向性與建議性質,並非每個爬蟲都會遵守。在任一層封鎖 AI 爬蟲,影響的只有開放網頁的可發現性,不會讓 Shopify Catalog 停止把商品資料送到你已啟用的通路。
Shopify 的資料分享說明補上另一半:即使某個通路沒有收到 Catalog 資料,它仍可能透過網頁爬取與索引取得商品資訊,只是那些資料未必總是完整、正確或最新。開放網頁這條路徑對每一個助理都持續開放,所以就算商店是透過 Shopify Catalog 銷售,它的爬蟲規則仍然重要。
兩種爬蟲,用每家廠商自己的話說
| 廠商 | 為回答或搜尋而讀頁面 | 為訓練而蒐集頁面 | 廠商對封鎖的說法 |
|---|---|---|---|
| OpenAI | OAI-SearchBot、ChatGPT-User | GPTBot | 退出 OAI-SearchBot 的網站不會出現在 ChatGPT 搜尋回答裡。ChatGPT-User 不用來決定內容能否出現在搜尋中,robots.txt 規則對它可能不適用。 |
| Anthropic | Claude-SearchBot、Claude-User | ClaudeBot | 停用 Claude-SearchBot 會讓內容不被索引用於搜尋。停用 Claude-User 會讓系統無法在有人詢問時取回內容。停用 ClaudeBot 代表未來的內容排除在訓練資料集之外。 |
| Perplexity | PerplexityBot、Perplexity-User | 未記載 | PerplexityBot 用於在 Perplexity 搜尋結果中呈現與連結網站,不用於為基礎模型爬取內容。Perplexity-User 因為是使用者要求的抓取,一般會忽略 robots.txt。 |
Googlebot | Google-Extended token | AI 內建於搜尋之中,所以 Googlebot 的 robots.txt 規則就是 AI Overviews 與 AI Mode 的控制項。Google-Extended 不影響 Google 搜尋的收錄,也不是排名訊號。 | |
| Meta | Meta-ExternalFetcher | Meta-ExternalAgent | Meta-ExternalAgent 爬取網頁用於訓練基礎模型,或直接索引內容以改進產品。Meta-ExternalFetcher 依使用者要求抓取個別連結,可能略過 robots.txt。 |
| Amazon | Amzn-SearchBot | Amazonbot | 允許 Amzn-SearchBot 會讓內容有資格出現在 Alexa 這類搜尋體驗中。Amazonbot 用於改進 Amazon 的產品與服務,並可能用來訓練 Amazon 的 AI 模型。 |
各列來源:OpenAI 的爬蟲文件、Anthropic 的爬蟲說明、Perplexity 的爬蟲指南、Google 的常見爬蟲清單與 AI 功能說明、Meta 的網頁爬蟲說明,以及 Amazon 的 Amazonbot 說明。
有兩列要特別說明。Google-Extended 沒有自己的 user-agent 字串;爬取仍由 Google 既有的代理程式執行,這個 token 只決定內容能否用於訓練或作為 Gemini 的依據。Meta 的訓練爬蟲與索引爬蟲是同一個 user agent,所以封鎖 Meta-ExternalAgent 的商店會同時放棄 Meta 直接索引的部分,而 Meta 的頁面沒有把這兩種用途分開。
怎麼決定
第一欄的每個爬蟲都保持放行。每家廠商都寫明,這個爬蟲決定你的頁面能否出現在它的回答或搜尋結果裡。針對 OAI-SearchBot 或 Googlebot 寫一行 Disallow,是少掉一條路徑而沒有任何回報。
第二欄依同意意願決定。OpenAI、Google 與 Anthropic 都寫明,各自的訓練爬蟲或 token 與搜尋收錄無關,所以依廠商自己的說法,封鎖 GPTBot、Google-Extended 或 ClaudeBot 不會損失可見度。這個選擇關乎你是否願意讓商品文案進入訓練資料集,兩種答案都站得住。
把使用者觸發的抓取器視為檔案管不到的東西。ChatGPT-User、Claude-User、Perplexity-User 與 Meta-ExternalFetcher 是在有人要求特定頁面時才行動。廠商都寫明 robots.txt 對它們可能不適用,所以針對它們寫的一行規則只是記錄偏好,不是控制。
Shopify 預設檔長什麼樣
Shopify 代管的店面由 Shopify 提供自己的 robots.txt。佈景主題範本參考說明,佈景主題裡的 robots.txt.liquid 檔案會取代那份輸出,而範本應該保留 Shopify 的預設群組。預設檔會封鎖 admin、購物車、結帳、篩選後的商品系列、搜尋與政策路徑,讓索引集中在獨特內容上。它沒有任何針對 AI 爬蟲的規則。
所以如果你線上的 robots.txt 列出了你沒有選過的 AI user agent,那是某個 app 或範本寫進去的。如果其中包含 OAI-SearchBot 這類搜尋型爬蟲,或預設群組出現了卻沒有任何規則在底下,這份檔案是取代了 Shopify 的規則,而不是擴充它。〈移除 robots.txt.liquid 範本,讓 Shopify 規則回來〉那則 Answer 處理移除;本篇處理移除之後檔案該寫什麼。
怎麼檢查
- 在瀏覽器開啟
https://你的商店網域/robots.txt,用購物者助理的角度讀一遍。 - 找
OAI-SearchBot、Claude-SearchBot、PerplexityBot或Googlebot底下有沒有Disallow行。任何一行都會少掉一條路徑。 - 對列出的每一個訓練型爬蟲,確認那一行反映的是你自己做過、說得出理由的選擇。
- 如果商店是無頭或自訂店面,躲在防火牆或 CDN 後面,另外檢查那一層。Shopify 的頁面寫明不支援在代管商店前方架設代理,而邊緣的挑戰頁會在 robots.txt 被讀到之前就把爬蟲擋下。
結果是一份你能逐行說明的檔案。它說明你允許什麼。它無法證明有任何爬蟲抓取了頁面、頁面被索引,或商品被呈現給購物者。