言語を選択

AIクローラーを制御するrobots.txt生成ツール

GPTBotやClaudeBotなど50種類以上のAIクローラーを制御するrobots.txtをブラウザ上で生成。Content-Signalの設定やプリセット機能で、サイトの学習データ収集を簡単にブロックします。

AIクローラー robots.txt生成使い方 ↓
ページをインデックスし、短い抜粋とともにリンクを表示
回答生成のソースとしてページを使用
AIモデルのトレーニングやファインチューニングにページを使用
Cloudflare拡張: ボットが取得したコンテンツをどこまで利用できるか
EU著作権規則の下でシグナルに法的効力を与える文言
これらをブロックしても検索での表示には影響しません
これらをブロックすると、AI検索の回答とその引用から除外されます
これらをブロックすると、アシスタントが要求に応じてページを開くのを防ぎます
ユーザーの代わりにクリックやフォーム入力を行うエージェント
サイト全体の場合は /、フォルダの場合は /articles/ のように指定します
Sitemapとllms.txtのポインターにのみ必要です
コメントとして追加されます。robots.txtにllms.txtディレクティブはありません

robots.txtとContent-Signalは設定を表明するものであり、単独では何もブロックしません。マナーの良いクローラーはこれに従いますが、他は無視します。また、GoogleはContent-Signalに基づいて行動しないと述べています。強制力が必要な場合は、サーバー側のボットルールと組み合わせてください。

Mehmet Demiray 公開日 更新日
共有

AIクローラーの4つの種類とブロックの影響

AIボットは主に4つの役割に分けられます。1つ目はトレーニングデータ収集ボットで、GPTBotやClaudeBotなどが該当し、AIモデルの学習にページ内容を使用します。2つ目はAI検索インデクサーで、OAI-SearchBotのようにAI検索エンジンの回答生成時にリアルタイムで情報を参照します。3つ目はユーザー起動型フェッチャーで、ChatGPT-UserのようにユーザーがURLを指定した際にのみページを取得します。4つ目はブラウジングエージェントで、自律的にウェブを巡回します。

トレーニングボットだけをブロックするデフォルト設定は、AIによる学習を防ぎつつ、AI検索でのサイト引用を維持できるため、多くのパブリッシャーにとって理にかなった選択です。逆に、すべてのAIボットをブロックすると、AIを活用した検索結果からサイトが完全に除外され、新たな流入経路を失うリスクがあります。「AIクローラー robots.txt生成」には50以上のAIボットが登録されており、役割ごとに細かく制御できます。

生成されるrobots.txtファイルの構造

「AIクローラー robots.txt生成」が出力するファイルは、いくつかの論理ブロックで構成されます。まず、User-agent: * のワイルドカードグループには、Content-Signal ディレクティブと Allow: / が記述されます。これにより、明示的にブロックされていないボットに対する基本方針が示されます。

次に、ブロック対象として選択された各ボットに対して、個別の User-agent と Disallow グループが生成されます。たとえば GPTBot をブロックする場合、User-agent: GPTBot の直後に Disallow: / が続きます。ツールでは、すべてのブロック対象ボットに共通のパスを適用するため、管理が容易です。

さらに、サイトURLを入力すると、ファイルの末尾に Sitemap ディレクティブと、llms.txt を指し示すコメント行が追加されます。生成されたファイルはブラウザ上で直接コピーするか、ダウンロードしてサーバーにアップロードできます。

Content-SignalとEU著作権指令の役割

Content-Signal は、AIによるコンテンツの利用意向をより細かく伝えるための新しい規格です。search、ai-input、ai-train の3つのキーに対し、許可、不許可、または指定なしを設定できます。たとえば、AIの学習は拒否しつつ、検索結果での使用は許可するといった柔軟な制御が可能です。Cloudflareが提案する use パラメーターを使えば、即時利用、参照のみ、完全利用といった粒度も指定できます。

また、EU著作権指令に基づくテキスト・データマイニングの権利留保を明示するためのポリシーコメントブロックを含めるオプションもあります。これは欧州の出版社が法的な権利を主張する際に役立ちます。ただし、Googleは現在 Content-Signal を処理しないことを表明しているため、確実なブロックには従来の Disallow との併用が推奨されます。

サイトの目的に合わせたブロック対象の選択

サイトの運営方針に合わせて、適切なプリセットを選択することが重要です。記事の引用や要約をAI検索に許可しつつ、モデル学習への組み込みを防ぎたい場合は、デフォルトのトレーニングクローラーのみブロックが最適です。これにより、GPTBot や Google-Extended などの学習用ボットを遮断できます。なお、Google-Extended をブロックしても、通常のGoogle検索ランキングに影響を与える Googlebot は影響を受けません。

一方で、AIによる利用を一切拒否したい場合は、すべてのAIクローラーをブロックを選択します。テスト環境や非公開の草稿フォルダだけを保護したい場合は、カスタム設定で Disallow パスを /drafts/ などに変更し、シグナルのみのプリセットと組み合わせることで、特定のディレクトリへのアクセスだけを制限できます。

robots.txtの制限とサーバー側での強制

robots.txtはあくまでクローラーに対するリクエストであり、物理的な壁ではありません。悪意のあるスクリプトや、ルールを無視するボットに対しては無力です。また、robots.txtでブロックしても、すでに収集済みのデータがAIモデルから削除されるわけではありません。

確実なアクセス制御を行うには、サーバー側のファイアウォールやCDNのボット管理ルールと組み合わせる必要があります。たとえば、Webボット認証鍵生成を利用して、正当なボットを暗号学的に検証する仕組みを導入すれば、User-Agentの偽装を防げます。設定後は、robots.txtテスターを使用して、意図した通りにボットが制御されているかを検証する手順を習慣づけましょう。

robots.txtとllms.txtの使い分け

AIクローラー向けには、robots.txtに加えて llms.txt という新しいファイル形式も注目されています。robots.txtがどのボットのアクセスを拒否するかという制御を担うのに対し、llms.txtはAIが読むべき重要なページやコンテキストはどれかを能動的に提示するためのファイルです。

「AIクローラー robots.txt生成」では、llms.txtへのポインターをコメントとして出力します。これは、robots.txtの公式なディレクティブとして llms.txt が定義されていないためです。AIに対して自サイトの構造やライセンス情報を明確に伝えたい場合は、llms.txtジェネレーターを別途利用してファイルを作成し、サーバーのルートディレクトリに配置することをお勧めします。両者を併用することで、AIクローラーに対する防御と情報提供のバランスが取れたサイト設計が可能になります。

最もよくいただく質問

AIクローラーをブロックするにはどうすればいいですか?

「AIクローラー robots.txt生成」では、50種類以上のAIボットからブロック対象を選択し、生成された robots.txt をダウンロードして、ウェブサイトのルートディレクトリにアップロードするだけです。デフォルトの「学習用クローラーのみブロック」は、AI検索での引用は維持しつつ、無断での学習データ利用を防ぐおすすめの設定です。設定後はrobots.txtテスターで正しく反映されているか確認しましょう。

GPTBot、OAI-SearchBot、ChatGPT-Userの違いは何ですか?

これらはすべてOpenAIのボットですが、役割が異なります。GPTBot はAIモデルの学習データを収集し、OAI-SearchBot はAI検索エンジンのインデックスを作成し、ChatGPT-User はユーザーがチャット中にリンクをクリックした際にページを取得します。学習を防ぎたい場合は GPTBot だけをブロックし、検索結果やチャットでの引用は許可するのが一般的です。

AIボットをブロックするとGoogleの検索順位に悪影響が出ますか?

いいえ、AI学習用ボットをブロックしても、通常のGoogle検索順位には影響しません。ただし、AI検索ボットまでブロックすると、AI回答であなたのサイトが引用されなくなるため、そこからのトラフィックは減少します。学習用と検索用を分けて制御することが重要です。

robots.txtだけでAIのスクレイピングを完全に防げますか?

robots.txt はあくまでクローラーに対するアクセス制御のお願いであり、悪意のあるボットやルールを無視するスクリプトを物理的に遮断するものではありません。確実にブロックするには、サーバー側やCDNのファイアウォールルールでのIP制限や、Web Bot Auth Key Generatorを使った暗号学的なボット認証を併用することをおすすめします。

Content-SignalとDisallowの違いは何ですか?

Disallow は「このページにアクセスしないでください」というクローラーへのアクセス拒否指令です。一方、Content-Signal は「アクセスは許可するが、検索やAI学習への利用は許可しない」という、コンテンツの利用方法に関する意思表示です。「AIクローラー robots.txt生成」では、この両方を組み合わせた最適な設定を簡単に作成できます。

特定のフォルダだけAIボットをブロックできますか?

はい、可能です。「AIクローラー robots.txt生成」のDisallowパス設定で、/drafts/ や /private/ などの特定のディレクトリを指定すれば、そのフォルダ内のみをブロック対象にできます。このパス設定は、ブロック対象として選択したすべてのAIボットに一律で適用されます。

Google-Extendedは何をブロックしますか?

Google-Extended は、GoogleのAIモデルの学習にサイトコンテンツを利用することを拒否するためのトークンです。これをブロックしても、通常のGooglebotによる検索インデックスの収集や、Google検索での順位には一切影響しません。AI学習だけを切り離して制御したい場合に有効です。

Sitemapやllms.txtの行が出力に含まれないのはなぜですか?

Sitemap や llms.txt のポインターを robots.txt に追加するには、有効なサイトのURL入力が必要です。URLが入力されていない場合、これらの行は自動で省略されます。llms.txt ファイル自体の作成には、別途llms.txtジェネレーターをご利用ください。

このツールは無料で使えますか?アカウント登録は必要ですか?

「AIクローラー robots.txt生成」は完全に無料でご利用いただけ、アカウント登録も不要です。すべての処理はブラウザ内で完結するため、サイトのURLや設定データが外部サーバーに送信されることはなく、プライバシーが完全に保護されます。