Cómo funciona el emparejamiento de reglas en robots.txt
El archivo robots.txt es la primera línea de comunicación entre un sitio web y los rastreadores. Su estructura se basa en grupos, cada uno definido por una o más líneas User-agent que especifican a qué bot se aplican las reglas. Por ejemplo, si un archivo contiene:
User-agent: Googlebot
Disallow: /privado/
User-agent: *
Disallow: /temporal/
El grupo para Googlebot incluye solo la regla /privado/, mientras que el grupo marcado con * (que actúa como comodín) aplica a todos los rastreadores que no tengan un grupo específico. Un detalle clave es que un bot siempre prioriza su grupo exacto sobre el comodín. Si Googlebot visita el sitio, ignorará la regla /temporal/ del grupo * y solo respetará /privado/. Esto evita conflictos cuando se quieren aplicar reglas distintas a diferentes crawlers.
Cuando un rastreador no encuentra su token exacto (por ejemplo, GPTBot en un archivo que solo menciona Googlebot y *), busca primero un token padre. Así, Googlebot-Image heredará las reglas de Googlebot. Si no hay coincidencia ni padre, el bot recurre al grupo *. Si tampoco existe, todas las rutas están permitidas por defecto. Este sistema de herencia y prioridad es esencial para entender por qué algunas URLs son accesibles para ciertos bots pero no para otros, incluso con el mismo archivo robots.txt.