我的 robots.txt 該放行哪些 AI 爬蟲?哪些封鎖了也不會失去可見度?

搜尋型與使用者型爬蟲決定助理讀不讀得到你的商品頁。訓練型爬蟲不會,每家廠商自己都這麼寫。

適用情況
你店面的 robots.txt 列出了 AI 爬蟲、有 app 或範本提議替你封鎖它們,或你想讓商品頁維持能被助理讀取,同時不進入模型訓練。 [8] [1]
不適用情況
透過 Shopify Catalog 送到 ChatGPT、Copilot 或其他已啟用通路的商品資料,不經過 robots.txt。robots.txt 的決定只改變爬蟲在開放網頁上讀到什麼。 [8] [10]
為什麼重要
OpenAI 寫明退出 OAI-SearchBot 的網站不會出現在 ChatGPT 搜尋回答裡;Google 寫明 Googlebot 的規則就是 AI Overviews 與 AI Mode 的控制項。寫錯一行就少掉一條路徑。 [1] [5]
要做的事(也可能是不用做)
讀你線上的 robots.txt。每一個搜尋型與使用者型爬蟲都保持放行。訓練型爬蟲依你的同意意願決定,因為 OpenAI、Google 與 Anthropic 都寫明訓練用的 token 不決定搜尋收錄。 [1] [4] [2]
你能親眼看到的結果
你的 robots.txt 對 OAI-SearchBot、Claude-SearchBot、PerplexityBot 或 Googlebot 沒有任何 Disallow 行,而檔案裡每一行訓練型爬蟲規則都是你自己選的、說得出理由的。 [1] [2] [3]
這個結果不能證明什麼
放行的爬蟲讀得到頁面。這無法證明頁面真的被抓取、被索引、被引用或被選給購物者,而且 robots.txt 的規則是建議性質,不是強制執行。 [8] [1]
查證於
2026年9月5日

什麼時候第三方值得付錢,你又不必買什麼

什麼時候付錢請人做才划算
只有在無頭或自訂店面躲在會於網路層挑戰爬蟲的防火牆或 CDN 後面時,付錢請人處理才划算;那一層 robots.txt 看不到也修不了。 [8]
你不必買什麼
Shopify 代管的商店由 Shopify 在網路層處理機器人管理,並提供一份沒有任何 AI 爬蟲規則的預設 robots.txt,所以「全部放行」這個基準不需要 app 也不需要範本。 [8] [9]

可能有 app、範本或代理商提議替你的商店封鎖 AI 爬蟲。這個提議把兩種不同的爬蟲包在同一個詞裡。一種是替購物者回答問題時去讀頁面;另一種是蒐集頁面拿去訓練模型。每家廠商都寫明自家哪個爬蟲做哪件事,也都寫明封鎖訓練型爬蟲不影響搜尋收錄。整個決定就在這裡。

robots.txt 在 Shopify 商店管得到什麼

Shopify 的 robots.txt 說明把兩條路徑分開。送往 ChatGPT 或 Microsoft Copilot 這類已啟用代理式店面的商品資料,是經由 Shopify Catalog 傳送,與 robots.txt 無關。AI 爬蟲也可能直接從開放網頁讀你的商店,robots.txt 管的是這一條。

同一頁寫了三個限制。Shopify 代管的商店,網路層的機器人管理由 Shopify 處理,你不需要做任何事。robots.txt 裡的規則屬於方向性與建議性質,並非每個爬蟲都會遵守。在任一層封鎖 AI 爬蟲,影響的只有開放網頁的可發現性,不會讓 Shopify Catalog 停止把商品資料送到你已啟用的通路。

Shopify 的資料分享說明補上另一半:即使某個通路沒有收到 Catalog 資料,它仍可能透過網頁爬取與索引取得商品資訊,只是那些資料未必總是完整、正確或最新。開放網頁這條路徑對每一個助理都持續開放,所以就算商店是透過 Shopify Catalog 銷售,它的爬蟲規則仍然重要。

兩種爬蟲,用每家廠商自己的話說

廠商為回答或搜尋而讀頁面為訓練而蒐集頁面廠商對封鎖的說法
OpenAIOAI-SearchBotChatGPT-UserGPTBot退出 OAI-SearchBot 的網站不會出現在 ChatGPT 搜尋回答裡。ChatGPT-User 不用來決定內容能否出現在搜尋中,robots.txt 規則對它可能不適用。
AnthropicClaude-SearchBotClaude-UserClaudeBot停用 Claude-SearchBot 會讓內容不被索引用於搜尋。停用 Claude-User 會讓系統無法在有人詢問時取回內容。停用 ClaudeBot 代表未來的內容排除在訓練資料集之外。
PerplexityPerplexityBotPerplexity-User未記載PerplexityBot 用於在 Perplexity 搜尋結果中呈現與連結網站,不用於為基礎模型爬取內容。Perplexity-User 因為是使用者要求的抓取,一般會忽略 robots.txt。
GoogleGooglebotGoogle-Extended tokenAI 內建於搜尋之中,所以 Googlebot 的 robots.txt 規則就是 AI Overviews 與 AI Mode 的控制項。Google-Extended 不影響 Google 搜尋的收錄,也不是排名訊號。
MetaMeta-ExternalFetcherMeta-ExternalAgentMeta-ExternalAgent 爬取網頁用於訓練基礎模型,或直接索引內容以改進產品。Meta-ExternalFetcher 依使用者要求抓取個別連結,可能略過 robots.txt。
AmazonAmzn-SearchBotAmazonbot允許 Amzn-SearchBot 會讓內容有資格出現在 Alexa 這類搜尋體驗中。Amazonbot 用於改進 Amazon 的產品與服務,並可能用來訓練 Amazon 的 AI 模型。

各列來源:OpenAI 的爬蟲文件、Anthropic 的爬蟲說明、Perplexity 的爬蟲指南、Google 的常見爬蟲清單AI 功能說明、Meta 的網頁爬蟲說明,以及 Amazon 的 Amazonbot 說明

有兩列要特別說明。Google-Extended 沒有自己的 user-agent 字串;爬取仍由 Google 既有的代理程式執行,這個 token 只決定內容能否用於訓練或作為 Gemini 的依據。Meta 的訓練爬蟲與索引爬蟲是同一個 user agent,所以封鎖 Meta-ExternalAgent 的商店會同時放棄 Meta 直接索引的部分,而 Meta 的頁面沒有把這兩種用途分開。

怎麼決定

第一欄的每個爬蟲都保持放行。每家廠商都寫明,這個爬蟲決定你的頁面能否出現在它的回答或搜尋結果裡。針對 OAI-SearchBotGooglebot 寫一行 Disallow,是少掉一條路徑而沒有任何回報。

第二欄依同意意願決定。OpenAI、Google 與 Anthropic 都寫明,各自的訓練爬蟲或 token 與搜尋收錄無關,所以依廠商自己的說法,封鎖 GPTBotGoogle-ExtendedClaudeBot 不會損失可見度。這個選擇關乎你是否願意讓商品文案進入訓練資料集,兩種答案都站得住。

把使用者觸發的抓取器視為檔案管不到的東西。ChatGPT-UserClaude-UserPerplexity-UserMeta-ExternalFetcher 是在有人要求特定頁面時才行動。廠商都寫明 robots.txt 對它們可能不適用,所以針對它們寫的一行規則只是記錄偏好,不是控制。

Shopify 預設檔長什麼樣

Shopify 代管的店面由 Shopify 提供自己的 robots.txt。佈景主題範本參考說明,佈景主題裡的 robots.txt.liquid 檔案會取代那份輸出,而範本應該保留 Shopify 的預設群組。預設檔會封鎖 admin、購物車、結帳、篩選後的商品系列、搜尋與政策路徑,讓索引集中在獨特內容上。它沒有任何針對 AI 爬蟲的規則。

所以如果你線上的 robots.txt 列出了你沒有選過的 AI user agent,那是某個 app 或範本寫進去的。如果其中包含 OAI-SearchBot 這類搜尋型爬蟲,或預設群組出現了卻沒有任何規則在底下,這份檔案是取代了 Shopify 的規則,而不是擴充它。〈移除 robots.txt.liquid 範本,讓 Shopify 規則回來〉那則 Answer 處理移除;本篇處理移除之後檔案該寫什麼。

怎麼檢查

  1. 在瀏覽器開啟 https://你的商店網域/robots.txt,用購物者助理的角度讀一遍。
  2. OAI-SearchBotClaude-SearchBotPerplexityBotGooglebot 底下有沒有 Disallow 行。任何一行都會少掉一條路徑。
  3. 對列出的每一個訓練型爬蟲,確認那一行反映的是你自己做過、說得出理由的選擇。
  4. 如果商店是無頭或自訂店面,躲在防火牆或 CDN 後面,另外檢查那一層。Shopify 的頁面寫明不支援在代管商店前方架設代理,而邊緣的挑戰頁會在 robots.txt 被讀到之前就把爬蟲擋下。

結果是一份你能逐行說明的檔案。它說明你允許什麼。它無法證明有任何爬蟲抓取了頁面、頁面被索引,或商品被呈現給購物者。

來源

  1. OpenAI crawlers and user agents
  2. Anthropic crawler article
  3. Perplexity crawlers
  4. Google common crawlers
  5. AI features and your website
  6. Meta web crawlers
  7. Amazonbot and Amzn-SearchBot
  8. Editing robots.txt.liquid
  9. robots.txt.liquid template reference
  10. Data sharing and privacy for agentic storefronts