言語を選択

robots.txtテスター:URLのクロール許可判定と構文バリデーション

ブラウザ上でrobots.txtの下書きを貼り付け、GooglebotやAIクローラーが特定のURLにアクセスできるかを判定します。RFC 9309準拠のルール解析と詳細なエラー表示に対応。

robots.txtテスター使い方 ↓
/robots.txtで配信されるファイルを貼り付けてください。ブラウザ内で評価されるため、取得やアップロードは行われません。
Googlebot、GPTBot、ClaudeBotなどの製品トークン、または完全なUser-Agent文字列
1行に1つ入力してください。完全なURLはパスとクエリに縮約されます。

RFC 9309に準拠しており、*ワイルドカードと$終端アンカーをサポートしています。クローラー固有のグループは*グループよりも優先され、最も長く一致するルールが適用されます。条件が同じ場合はAllowが優先されます。実際のクローラーでは、まれなケースで挙動が異なる場合があります。

Mehmet Demiray 公開日 更新日
共有

robots.txtのマッチングの仕組みとUser-agentの優先順位

robots.txtテスターを使う際、クローラーがどのようにルールを選択するか理解することが重要です。クローラーはまず自分専用のUser-agentグループを探します。例えばGooglebot-Imageは、まずGooglebot-Imageのグループを探し、なければ親トークンであるGooglebotのグループを参照します。それでも見つからない場合は、ワイルドカードである*のグループにフォールバックします。重要な点は、特定のクローラー向けグループが存在する場合、そのグループが*のルールを完全に上書きするということです。*のルールと特定クローラーのルールが合算されるわけではありません。robots.txtテスターでは、この優先順位に基づいて正確な判定結果を出力します。これにより、意図しないアクセス許可やブロックを防ぐことができます。

最長一致の原則とAllowおよびDisallowの優先順位

robots.txtのルール評価において、最も重要な原則が最長一致です。複数のAllowやDisallowディレクティブが同じURLにマッチする場合、パターンが最も長いルールが採用されます。例えば、Disallow: /images/とAllow: /images/public/が存在し、/images/public/photo.jpgを評価する場合、文字数の長いAllowルールが優先されます。もしAllowとDisallowのパターン長が完全に同じ場合は、Allowが優先される仕様です。また、Disallow:のようにパスが空の場合はすべてを許可することを意味し、該当するルールが全くない場合も許可されます。robots.txtテスターは、ワイルドカードの*や終端アンカーの$を含むパターンも正しく解析し、どのルールが勝ったのかを明示します。

AIクローラーのアクセス制御とContent-Signalの検証

近年、GPTBotやClaudeBotといったAIクローラーのアクセス管理が重要になっています。robots.txtテスターでは、これらのAIクローラーを指定して、特定のURLがブロックされるかどうかを事前に確認できます。また、AIクローラー向けに導入されたContent-Signalディレクティブの値も出力します。Content-Signalは、そのコンテンツが検索、AIの入力、AIの学習のいずれに利用可能かを機械可読な形式で示すものです。ただし、このツールはContent-Signalの値を報告するだけであり、技術的なブロックを行うわけではありません。AIクローラー向けのルールを最初から作成する場合は、AIクローラー用robots.txtジェネレーターを活用し、生成したルールをrobots.txtテスターで検証するのが効率的です。AIシステム向けのルートファイルであるllms.txtジェネレーターも併用すると効果的です。

robots.txtでやりがちな構文エラーとパーサーの警告

robots.txtの記述には、意図しない結果を招く典型的な間違いがいくつかあります。robots.txtテスターは、こうした構文エラーや非標準のディレクティブをパーサー警告として検出します。よくある間違いは、User-agentディレクティブより前にAllowやDisallowを記述してしまうことです。また、パスの先頭にスラッシュ/がない場合や、大文字と小文字を区別するパスの扱いにも注意が必要です。Crawl-delayはRFC 9309に含まれておらず、Googleは無視します。同様に、HostやClean-paramは特定の検索エンジン独自の拡張機能です。さらに、robots.txtにNoindexを記述してもインデックス制御はできません。robots.txtはクロール制御のみを行い、ブロックされたURLでも外部リンクを通じてインデックスに登録される可能性がある点に留意してください。

robots.txtテスターの仕様と対象範囲の限界

robots.txtテスターは非常に強力なシミュレーションツールですが、その対象範囲には明確な限界があります。このツールはライブのrobots.txtファイルをサーバーから取得しません。ユーザーがテキストエリアに貼り付けた内容のみを解析します。そのため、公開前のドラフト段階や、ローカル環境のファイルを安全にテストできます。すべての処理はブラウザ内で完結するため、機密情報が外部に送信されることはありません。一方で、実際のインデックス登録状況を確認したり、URLのパーセントエンコーディングの正規化を行ったりする機能は備えていません。あくまで仕様準拠のシミュレーターとして活用してください。ボットの認証について詳しく知りたい場合は、Web Bot Auth Key Generatorを参照してください。

最もよくいただく質問

robots.txtテスターを使って、特定のURLがブロックされているか確認するにはどうすればよいですか?

robots.txtの内容をテキストエリアに貼り付け、テストしたいクローラーとURLを1行に1つずつ入力してください。ツールはRFC 9309の仕様に従って判定し、許可またはブロックの結果と、適用された具体的なルールおよび行番号を表示します。

テストするためにアカウント登録や、実際のWebサイトへのデプロイは必要ですか?

アカウント登録は不要で、完全に無料でご利用いただけます。すべての処理はブラウザ内で完結するため、実際のサーバーにアップロードする前のドラフト状態のrobots.txtを安全にテストできます。

`Allow`と`Disallow`の両方のルールにマッチするURLを入力した場合、どちらが優先されますか?

パスの文字数が最も長いルールが優先されます。もし長さが同じで競合した場合は、Allowが優先される仕様です。マッチするルールが全くない場合は、デフォルトで許可とみなされます。

`*`や`$`といった記号はどのように解釈されますか?

*は任意の文字列にマッチするワイルドカード、$はURLの末尾にマッチするアンカーとして機能します。これらは元のRFCには含まれていませんが、主要なクローラーがサポートしている拡張記法であり、本ツールでも正しく評価されます。

特定のAIクローラーをテストしたいのですが、`Content-Signal`ディレクティブはどのように扱われますか?

Content-Signalは、検索やAI学習などの機械可読な利用意向を示すものです。本ツールは技術的なブロックとは別に、このシグナル値をレポートします。AIクローラー向けのルールを簡単に作成したい場合は、AIクローラー用のルール作成ツールもあわせてご活用ください。

`robots.txt`でURLをブロックすれば、検索結果からそのページを削除できますか?

robots.txtはクロールを制御するものであり、インデックスを直接制御するものではありません。ブロックされたURLでも、外部からのリンクを通じてインデックスに登録される可能性があるため、検索結果からの削除には別の手法が必要です。

Google Search Consoleのレポートと、このツールにはどのような違いがありますか?

Google Search Consoleは実際に配信されているライブファイルの確認に適しています。一方、robots.txtテスターはサイト所有権の確認なしに、任意のドラフトファイルと任意のクローラーの組み合わせを瞬時にシミュレーションできる点が特徴です。

AIシステム向けの設定ファイルには、`robots.txt`以外にもどのようなものがありますか?

AIシステムに対してサイト全体の構造を明示的に伝えたい場合は、llms.txtの生成ツールを使って専用ファイルを作成できます。また、ボットの身元を証明する仕組みについてはWeb Bot Authキーの生成が役立ちます。