AI 봇의 네 가지 유형과 차단 영향
웹사이트를 방문하는 AI 봇은 크게 네 가지 역할로 나뉩니다. 첫 번째는 학습 데이터 수집기입니다. GPTBot이나 ClaudeBot이 여기에 속하며, 웹사이트의 텍스트를 대규모 언어 모델 학습에 사용합니다. 이를 차단하면 내 콘텐츠가 AI 학습에 쓰이는 것을 막을 수 있습니다. 두 번째는 AI 검색 인덱서입니다. OAI-SearchBot이나 PerplexityBot이 대표적이며, 사용자가 AI에게 질문할 때 답변의 출처로 인용하기 위해 페이지를 색인합니다. 세 번째는 사용자 트리거 페처입니다. ChatGPT-User가 여기에 속하는데, 사용자가 채팅창에 특정 URL을 입력했을 때 해당 페이지의 내용을 실시간으로 읽어오는 역할을 합니다. 네 번째는 브라우징 에이전트로, 자율적으로 웹을 탐색하며 작업을 수행합니다. AI 크롤러 robots.txt 생성기는 50개 이상의 AI 봇을 이러한 역할별로 분류하여 제공합니다. 학습용 봇만 차단하고 검색 인덱서는 허용하면, 내 글이 AI 학습에 도용되는 것은 막으면서 AI 답변에는 출처로 인용되도록 유지할 수 있습니다. 반면 모든 AI 봇을 차단하면 AI 기반 검색 엔진에서의 노출이 완전히 사라지는 비용이 발생합니다.
생성된 robots.txt 파일의 구조
AI 크롤러 robots.txt 생성기가 만들어내는 파일은 크게 두 가지 계층으로 구성됩니다. 첫 번째 계층은 모든 봇에 적용되는 와일드카드 그룹입니다. User-agent: *로 시작하며, 여기에 Content-Signal 지시문과 Allow: / 명령어가 포함됩니다. 이는 AI 봇의 학습 및 검색 사용에 대한 사이트 소유자의 선호도를 명시하는 역할을 합니다. 두 번째 계층은 차단하려는 특정 AI 봇을 대상으로 하는 개별 그룹입니다. 차단하도록 선택한 각 봇에 대해 User-agent와 Disallow가 한 세트로 생성됩니다. 예를 들어 기본 경로인 /를 차단 경로로 설정하면, 선택된 모든 봇이 사이트 전체에 접근하지 못하도록 요청합니다. 파일 하단에는 선택 사항으로 Sitemap 줄과 llms.txt 포인터 주석이 추가될 수 있습니다. 이 두 가지 옵션을 사용하려면 유효한 사이트 URL을 입력해야 합니다. 생성이 완료되면 화면에 차단된 봇의 수, 영향을 받는 운영자 수, User-agent 그룹 수를 요약하여 보여주며, 복사하거나 다운로드할 수 있는 완성된 텍스트를 제공합니다.
Content-Signal 지시문과 EU 저작권 유보
Content-Signal은 기존의 Disallow 명령어보다 세밀하게 AI의 데이터 사용 방식을 제어할 수 있는 새로운 표준입니다. 이 지시문은 search, ai-input, ai-train이라는 세 가지 키를 사용합니다. search는 AI 검색 결과에 콘텐츠를 표시할 수 있는지, ai-input은 사용자의 프롬프트 입력에 콘텐츠를 활용할 수 있는지, ai-train은 모델 학습에 사용할 수 있는지를 각각 allow, disallow 또는 선호도 없음으로 설정합니다. 선호도 없음을 선택하면 해당 키 자체가 파일에서 제외됩니다. 또한 클라우드플레어에서 제안한 use 매개변수를 통해 immediate, reference, full 등 더 구체적인 사용 조건을 명시할 수도 있습니다. AI 크롤러 robots.txt 생성기는 이러한 신호와 함께 EU 저작권 지침 제4조에 따른 텍스트 및 데이터 마이닝 권리 유보 문구를 주석으로 포함할 수 있는 옵션을 제공합니다. 이는 유럽 연합 내에서 법적인 권리 유보를 명확히 선언하려는 출판사나 블로그 운영자에게 유용합니다. 다만 구글은 현재 Content-Signal을 공식적으로 반영하지 않는다고 밝혔으므로, 이는 보조적인 수단으로 활용해야 합니다.