AI 爬蟲與 robots.txt:香港網站應如何設定?
更新日期: · GEO Score
robots.txt 是甚麼?
robots.txt 是放在網站根目錄(例如 https://example.com.hk/robots.txt)的純文字檔,用來告訴爬蟲哪些網址可以抓取、哪些不可以。
這套規則已於 2022 年成為 IETF 標準 RFC 9309(背景可參考維基百科:robots.txt)。robots.txt 屬君子協定:正規的搜尋與 AI 爬蟲會遵守,但它並不是保安措施,不能用來保護私人資料。
主要 AI 爬蟲有哪些?
主要 AI 爬蟲可分為三類:搜尋用、即時讀取用及模型訓練用,每類的影響不同。
- 搜尋用:Googlebot(Google 搜尋及 AI Overview)、Bingbot(Bing 及 Copilot)、OAI-SearchBot(ChatGPT 搜尋)、PerplexityBot、Claude-SearchBot。封鎖這類爬蟲,網站便難以出現在 AI 搜尋答案中。
- 即時讀取用:ChatGPT-User、Perplexity-User、Claude-User,在用戶要求 AI 讀取某個網頁時使用。
- 訓練用:GPTBot、ClaudeBot,以及 Google 的控制項 Google-Extended。這類設定決定內容可否用於訓練 AI 模型。
各公司的官方說明:Google 爬蟲清單(Google-Extended 不影響 Google 搜尋收錄)、OpenAI 爬蟲、Perplexity 爬蟲。
香港網站建議怎樣設定?
香港公司一般應容許搜尋類及即時讀取類爬蟲,而是否開放訓練類爬蟲,則按公司對內容使用的政策決定。
以下是一個常見的寫法(只開放搜尋及即時讀取,不開放訓練):
User-agent: *
Allow: /
Disallow: /admin/
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
Sitemap: https://example.com.hk/sitemap.xml
如公司希望內容亦可被用於模型訓練,刪除相應的 Disallow 段落即可。修改前應保留原有的 Disallow 規則(例如後台、購物車),避免誤開不應公開的網址。
最常見的設定錯誤是甚麼?
最常見的錯誤是 robots.txt 本身沒有禁止 AI 爬蟲,但網站防火牆或 CDN 的「封鎖機械人」選項把它們擋在門外。
其他常見問題包括:整個網站被誤設為 Disallow: /;網頁內容只在瀏覽器執行 JavaScript 後才出現,爬蟲只讀到空白頁;robots.txt 回應伺服器錯誤(5xx),令爬蟲暫停抓取整個網站。
如何確認 AI 爬蟲讀得到網站?
確認的方法是以各爬蟲的身分實際請求網站,並對照 robots.txt 的規則,GEO Score 免費檢查會自動完成這一步。
檢查會以 11 個爬蟲身分讀取首頁,分別顯示放行、拒絕或只讀到空殼。由於這是模擬請求,真正的爬蟲來自各公司的網絡,結果應再配合伺服器記錄核實。相關背景可參考甚麼是 GEO。
免費檢查您的網站:輸入網址,約 30 秒完成 32 項香港 GEO/SEO 檢查,即時看到分數與主要問題。
開始免費檢查參考資料
以下是本頁引用的官方及學術資料,全部可以公開查閱。
- RFC 9309 www.rfc-editor.org
- 維基百科:robots.txt zh.wikipedia.org
- Google 爬蟲清單 developers.google.com
- OpenAI 爬蟲 platform.openai.com
- Perplexity 爬蟲 docs.perplexity.ai