robots.txt 매칭 작동 원리
robots.txt 파일은 크롤러가 웹사이트에 접근할 때 따르는 규칙을 정의합니다. Robots.txt 테스터를 사용하면 특정 크롤러가 특정 URL에 접근할 수 있는지 미리 확인할 수 있습니다. 매칭의 핵심은 그룹 선택입니다. 파일 내의 각 규칙 블록은 User-agent 지시문으로 시작하며, 이는 특정 크롤러를 대상으로 하는 그룹을 형성합니다.
크롤러가 사이트에 방문하면 자신의 토큰과 정확히 일치하는 그룹을 찾습니다. 예를 들어 구글봇은 Googlebot 그룹을 우선적으로 적용합니다. 만약 자신의 토큰에 해당하는 그룹이 없다면, 모든 크롤러를 의미하는 * 그룹으로 대체됩니다. 여기서 중요한 점은 특정 크롤러를 위한 그룹이 존재할 경우, 해당 크롤러는 * 그룹의 규칙을 완전히 무시하고 오직 자신의 그룹 규칙만 따른다는 것입니다. 두 그룹의 규칙이 합쳐지는 것이 아닙니다.
또한 하위 토큰에 대한 폴백 메커니즘도 존재합니다. Googlebot-Image 크롤러는 먼저 Googlebot-Image 그룹을 찾고, 없으면 상위 토큰인 Googlebot 그룹을 찾은 뒤, 최종적으로 * 그룹을 참조합니다. Robots.txt 테스터는 이러한 계층적 매칭 로직을 RFC 9,309 표준에 따라 정확히 시뮬레이션하여 어떤 그룹이 적용되었는지 명확히 보여줍니다.