產生檔案的運作方式
AI 爬蟲 robots.txt 產生器 所建立的檔案結構具有高度的邏輯性。檔案開頭通常會包含一個萬用字元群組 User-agent: *,並在此群組中設定 Content-Signal 指令與 Allow: /,這代表對所有未特別指定的機器人宣告內容使用偏好,同時允許它們正常抓取。
接下來,檔案會為每一個需要封鎖的特定 AI 機器人建立獨立的群組。每個群組包含一行 User-agent 指定機器人名稱,以及一行 Disallow 指令。所有被封鎖的機器人都會共用同一個封鎖路徑,預設為 /,也就是封鎖整個網站。如果您只需要封鎖特定目錄,可以將路徑更改為 /drafts/ 等特定資料夾。
此外,工具還會在檔案底部加入可選的 Sitemap 指令與 llms.txt 指標註解。這些設定能幫助合規的搜尋引擎與 AI 系統更好地理解您的網站結構,同時確保您的 robots.txt 檔案符合現代網頁標準。
Content-Signal 詳解
Content-Signal 是一種較新的精細控制層,用於向 AI 系統宣告網站內容的使用偏好。它包含三個主要信號:search 控制內容是否可用於 AI 搜尋結果,ai-input 決定內容是否可作為 AI 對話的輸入來源,而 ai-train 則規範內容是否可用於訓練 AI 模型。每個信號都可以設定為允許、拒絕或無偏好。當設定為無偏好時,該信號值會直接從程式碼中省略。
除了這三個基本信號,Cloudflare 還引入了 use 擴充參數,提供 immediate、reference 與 full 三種層級,進一步細化 AI 系統讀取內容的即時性與完整性。
對於歐盟地區的發布者,AI 爬蟲 robots.txt 產生器 提供了一個政策註解區塊選項。這個區塊包含了歐盟 Directive 2019/790 Article 4 關於文字與資料探勘權利保留的標準聲明。雖然這只是註解,但能在法律層面明確表達您拒絕 AI 訓練的立場,為歐洲的智慧財產權保護提供多一層保障。