選擇語言

Robots.txt 測試工具:檢查網址是否被爬蟲阻擋

貼上 robots.txt 內容與網址,即時模擬 Googlebot 或 AI 爬蟲的抓取結果。支援 RFC 9309 規範、萬用字元與匯出 CSV,輕鬆驗證阻擋規則。

Robots.txt 測試工具使用說明 ↓
請貼上 /robots.txt 提供的檔案內容。評估作業在您的瀏覽器中進行,不會擷取或上傳任何內容。
Googlebot、GPTBot 或 ClaudeBot 等產品權杖,或完整的 User-Agent 字串
每行一個。完整 URL 會縮減為其路徑與查詢字串。

遵循 RFC 9309 規範,支援 * 萬用字元與 $ 結尾錨點:爬蟲專屬群組的優先順序高於 * 群組,並以最長符合規則為準,若條件相同則優先採用 Allow。實際爬蟲在少數特殊情況下,運作方式可能略有不同。

Mehmet Demiray 發佈日期 更新日期
分享

Robots.txt 匹配原理與 User-agent 分組機制

在設定網站的爬蟲存取權限時,了解 robots.txt 的匹配原理至關重要。當爬蟲讀取檔案時,它會尋找與自身 User-agent 相符的群組。匹配順序具有嚴格的優先級:爬蟲首先尋找完全符合自身名稱的群組,例如 Googlebot。若找不到專屬群組,它會回退到父級 token,例如 Googlebot-Image 會套用 Googlebot 的規則。若依然沒有匹配項,爬蟲才會套用預設的 * 萬用群組。

許多網站管理員誤以為特定群組會與 * 群組的規則疊加,這是不正確的。一旦爬蟲找到了專屬或父級群組,它就會完全忽略 * 群組中的所有指令。這意味著,如果您在 * 群組中設定了 Disallow: /admin/,但在 Googlebot 群組中沒有重複此規則,Google 爬蟲依然可以存取該目錄。使用 Robots.txt 測試工具 時,您可以清楚看到爬蟲最終套用了哪個群組,從而避免因規則未繼承而導致的意外曝光。

Robots.txt 最長匹配優先與萬用字元解析

robots.txt 的規則衝突是 SEO 稽核中最常見的問題之一。當 Allow 和 Disallow 指令同時匹配某個 URL 時,系統會根據最長匹配優先原則來裁決。例如,Disallow: /images/ 長度為 14,而 Allow: /images/public/ 長度為 21。若請求的 URL 是 /images/public/logo.png,系統會選擇較長的 Allow 規則,允許爬蟲抓取。若兩條規則長度完全相同,系統會優先採用 Allow。

除了基本路徑,現代爬蟲也支援 * 萬用字元和 $ 結束錨點。例如,Disallow: /*.pdf$ 會阻擋所有以 .pdf 結尾的檔案,但不會阻擋 /document.pdf.html。若 Disallow 的值為空,則表示允許抓取所有路徑。若沒有任何規則匹配,預設行為也是允許抓取。透過 Robots.txt 測試工具,您可以輸入多條測試路徑,工具會精確指出哪一行規則贏得了匹配,並顯示其行號,讓除錯過程一目了然。

測試 AI 爬蟲存取權限與 Content-Signal 指令

隨著生成式 AI 的普及,控制 AI 爬蟲的存取權限成為網站管理員的新課題。常見的 AI 爬蟲包含 GPTBot、ClaudeBot 和 Google-Extended。在 robots.txt 中,您可以針對這些 token 設定獨立的 User-agent 群組,決定是否允許它們抓取網站內容以進行模型訓練。

除了傳統的 Allow 和 Disallow,部分 AI 系統開始支援 Content-Signal 指令。這是一個機器可讀的偏好設定,用於聲明內容的預期用途,例如 search 搜尋引擎索引、ai-input 作為 AI 提示輸入或 ai-train 用於訓練 AI 模型。需要注意的是,Content-Signal 僅是一種聲明,並非技術上的強制阻擋。Robots.txt 測試工具 會解析並報告該群組中的 Content-Signal 值,協助您確認設定是否如預期。若您正在規劃 AI 爬蟲的存取策略,可以先使用 AI 爬蟲 Robots.txt 產生器 撰寫規則,再將草稿貼入本工具進行驗證,確保語法完全正確。

常見的 Robots.txt 語法錯誤與解析器警告

撰寫 robots.txt 時,細微的語法錯誤可能導致整個檔案失效或產生非預期的結果。Robots.txt 測試工具 內建的解析器會自動標記常見的違規項目。最嚴重的錯誤之一是將 Allow 或 Disallow 規則寫在任何 User-agent 指令之前,這會導致這些規則被所有爬蟲忽略。另一個常見問題是使用相對路徑,所有路徑必須以 / 開頭。

此外,工具會針對非標準指令發出警告。例如,Crawl-delay 雖被部分爬蟲支援,但 Google 已明確表示忽略此指令。Host 和 Clean-param 是 Yandex 的專屬擴充功能,其他爬蟲不會處理。許多管理員也會誤用 Noindex 指令,但 robots.txt 僅控制抓取,無法阻止頁面被索引。若需阻止索引,應使用 HTML 的 meta robots 標籤。最後,路徑匹配是區分大小寫的,/Images/ 和 /images/ 會被視為不同目錄。透過解析器警告,您可以在部署前修正這些潛在問題。

Robots.txt 測試工具的運作範圍與限制

了解工具的運作邊界與了解其功能同等重要。Robots.txt 測試工具 採用純瀏覽器端運行,這意味著您貼上的檔案內容不會上傳至任何伺服器。這種設計非常適合測試尚未部署的草稿,或處理包含敏感路徑的內部檔案,確保資料隱私。

然而,本工具僅進行規格模擬,不會即時抓取您網站上的 robots.txt 檔案,也不會檢查 URL 的實際索引狀態。阻擋爬蟲抓取並不等於將頁面從搜尋結果中移除,若頁面有其他外部連結指向它,搜尋引擎仍可能將其收錄。此外,工具不會自動進行百分比編碼的標準化處理,您需確保輸入的測試 URL 與檔案中的路徑格式一致。對於需要向 AI 系統提供結構化資料的網站,建議搭配 llms.txt 產生器 建立根目錄說明檔。若需驗證爬蟲的真實身份,則需依賴 Web Bot Auth 金鑰產生器,因為 robots.txt 本身無法提供身份驗證機制。

最常被問到的問題

如何使用 Robots.txt 測試工具檢查網址是否被封鎖?

您只需將 robots.txt 的內容貼上,輸入爬蟲名稱(例如 Googlebot 或 GPTBot),然後在文字框中每行輸入一個路徑或完整 URL。工具會立即顯示每個網址的允許或封鎖結果,並指出是哪一行規則做出了決定。

使用這個工具需要註冊帳號或提供線上網站嗎?

完全不需要。Robots.txt 測試工具是免費且免註冊的,所有運算都在您的瀏覽器本機端完成。您可以直接貼上尚未部署的草稿內容進行測試,不用擔心機密檔案外洩,也不需要將網站實際連線到網際網路。

當 `Allow` 和 `Disallow` 規則同時符合某個路徑時,系統會如何判斷?

根據 RFC 9309 規範,系統會採用最長路徑符合優先的原則。如果兩條規則的字元長度完全相同,系統會優先採用 Allow 規則。這意味著在長度相同的情況下,允許存取的權限會覆蓋封鎖指令。

`robots.txt` 中的 `Content-Signal` 指令有什麼作用?

Content-Signal 是一種機器可讀取的偏好設定,用於向 AI 爬蟲表達您對內容使用的意願,例如 search、ai-input 或 ai-train。Robots.txt 測試工具會報告群組中設定的信號值,但請注意這只是聲明偏好,並非技術上的強制封鎖。若需建立完整的 AI 爬蟲規則,可搭配 AI 爬蟲 robots.txt 產生器 使用。

如果我測試的爬蟲名稱沒有出現在 `robots.txt` 的 `User-agent` 列表中會發生什麼事?

當爬蟲找不到專屬的 User-agent 群組時,它會自動套用 * 萬用字元群組的規則。如果您的 robots.txt 中完全沒有定義 * 群組,該爬蟲將被預設為允許存取網站上的所有路徑。

在 `robots.txt` 中封鎖某個 URL,就能讓它從搜尋引擎結果中消失嗎?

不能。robots.txt 只能控制爬蟲是否抓取該網頁,但無法控制索引狀態。如果其他網站有連結指向這個被封鎖的 URL,搜尋引擎仍然可能將其收錄並顯示在搜尋結果中。若要防止網頁被索引,應使用 noindex 標籤或密碼保護。

Robots.txt 測試工具與 Google Search Console 的 `robots.txt` 報告有什麼差異?

Google Search Console 僅顯示搜尋引擎實際抓取到的線上檔案與錯誤,且需要驗證網站所有權。我們的工具則允許您隨時貼上任何草稿版本,針對各種爬蟲進行即時模擬測試,無需任何驗證或部署。

測試時可以輸入完整的 URL 嗎,還是只能輸入路徑?

兩者皆可。您可以直接貼上完整的 URL,工具會自動忽略網域部分,僅擷取路徑與查詢參數來進行比對。這讓您在測試大量網址清單時更加直覺且方便。