GEO Score香港首個自助式 GEO 網站健康檢查

AI 爬蟲與 robots.txt:香港網站應如何設定?

robots.txt 是甚麼?

robots.txt 是放在網站根目錄(例如 https://example.com.hk/robots.txt)的純文字檔,用來告訴爬蟲哪些網址可以抓取、哪些不可以。

這套規則已於 2022 年成為 IETF 標準 RFC 9309(背景可參考維基百科:robots.txt)。robots.txt 屬君子協定:正規的搜尋與 AI 爬蟲會遵守,但它並不是保安措施,不能用來保護私人資料。

主要 AI 爬蟲有哪些?

主要 AI 爬蟲可分為三類:搜尋用、即時讀取用及模型訓練用,每類的影響不同。

各公司的官方說明:Google 爬蟲清單(Google-Extended 不影響 Google 搜尋收錄)、OpenAI 爬蟲Perplexity 爬蟲

香港網站建議怎樣設定?

香港公司一般應容許搜尋類及即時讀取類爬蟲,而是否開放訓練類爬蟲,則按公司對內容使用的政策決定。

以下是一個常見的寫法(只開放搜尋及即時讀取,不開放訓練):

User-agent: *
Allow: /
Disallow: /admin/

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

Sitemap: https://example.com.hk/sitemap.xml

如公司希望內容亦可被用於模型訓練,刪除相應的 Disallow 段落即可。修改前應保留原有的 Disallow 規則(例如後台、購物車),避免誤開不應公開的網址。

最常見的設定錯誤是甚麼?

最常見的錯誤是 robots.txt 本身沒有禁止 AI 爬蟲,但網站防火牆或 CDN 的「封鎖機械人」選項把它們擋在門外。

其他常見問題包括:整個網站被誤設為 Disallow: /;網頁內容只在瀏覽器執行 JavaScript 後才出現,爬蟲只讀到空白頁;robots.txt 回應伺服器錯誤(5xx),令爬蟲暫停抓取整個網站。

如何確認 AI 爬蟲讀得到網站?

確認的方法是以各爬蟲的身分實際請求網站,並對照 robots.txt 的規則,GEO Score 免費檢查會自動完成這一步。

檢查會以 11 個爬蟲身分讀取首頁,分別顯示放行、拒絕或只讀到空殼。由於這是模擬請求,真正的爬蟲來自各公司的網絡,結果應再配合伺服器記錄核實。相關背景可參考甚麼是 GEO

免費檢查您的網站:輸入網址,約 30 秒完成 32 項香港 GEO/SEO 檢查,即時看到分數與主要問題。

開始免費檢查

延伸閱讀

以下是與本文相關的其他香港 GEO 指南文章。

參考資料

以下是本頁引用的官方及學術資料,全部可以公開查閱。

  1. RFC 9309 www.rfc-editor.org
  2. 維基百科:robots.txt zh.wikipedia.org
  3. Google 爬蟲清單 developers.google.com
  4. OpenAI 爬蟲 platform.openai.com
  5. Perplexity 爬蟲 docs.perplexity.ai