Robots.txt 匹配原理與 User-agent 分組機制
在設定網站的爬蟲存取權限時,了解 robots.txt 的匹配原理至關重要。當爬蟲讀取檔案時,它會尋找與自身 User-agent 相符的群組。匹配順序具有嚴格的優先級:爬蟲首先尋找完全符合自身名稱的群組,例如 Googlebot。若找不到專屬群組,它會回退到父級 token,例如 Googlebot-Image 會套用 Googlebot 的規則。若依然沒有匹配項,爬蟲才會套用預設的 * 萬用群組。
許多網站管理員誤以為特定群組會與 * 群組的規則疊加,這是不正確的。一旦爬蟲找到了專屬或父級群組,它就會完全忽略 * 群組中的所有指令。這意味著,如果您在 * 群組中設定了 Disallow: /admin/,但在 Googlebot 群組中沒有重複此規則,Google 爬蟲依然可以存取該目錄。使用 Robots.txt 測試工具 時,您可以清楚看到爬蟲最終套用了哪個群組,從而避免因規則未繼承而導致的意外曝光。