Seleccionar idioma

Probador de robots.txt: verifica qué URLs bloquea tu archivo

Pega tu robots.txt, elige un rastreador (Googlebot, GPTBot, etc.) y comprueba qué URLs están permitidas o bloqueadas. Reglas ganadoras, avisos y CSV.

Probador de robots.txtCómo funciona ↓
Pega el archivo tal como se sirve en /robots.txt. Se evalúa en tu navegador, sin descargas ni subidas.
Un token de producto como Googlebot, GPTBot o ClaudeBot, o una cadena User-Agent completa
Una por línea. Las URLs completas se reducen a su ruta y consulta.

Sigue el RFC 9309, incluyendo su comodín * y el ancla de fin $: el grupo propio del rastreador prevalece sobre el grupo *, la regla con la coincidencia más larga gana y, en caso de empate, se aplica Allow. Los rastreadores reales pueden diferir en casos extremos.

Mehmet Demiray Publicado Actualizado
Compartir

Cómo funciona el emparejamiento de reglas en robots.txt

El archivo robots.txt es la primera línea de comunicación entre un sitio web y los rastreadores. Su estructura se basa en grupos, cada uno definido por una o más líneas User-agent que especifican a qué bot se aplican las reglas. Por ejemplo, si un archivo contiene:

User-agent: Googlebot
Disallow: /privado/

User-agent: *
Disallow: /temporal/

El grupo para Googlebot incluye solo la regla /privado/, mientras que el grupo marcado con * (que actúa como comodín) aplica a todos los rastreadores que no tengan un grupo específico. Un detalle clave es que un bot siempre prioriza su grupo exacto sobre el comodín. Si Googlebot visita el sitio, ignorará la regla /temporal/ del grupo * y solo respetará /privado/. Esto evita conflictos cuando se quieren aplicar reglas distintas a diferentes crawlers.

Cuando un rastreador no encuentra su token exacto (por ejemplo, GPTBot en un archivo que solo menciona Googlebot y *), busca primero un token padre. Así, Googlebot-Image heredará las reglas de Googlebot. Si no hay coincidencia ni padre, el bot recurre al grupo *. Si tampoco existe, todas las rutas están permitidas por defecto. Este sistema de herencia y prioridad es esencial para entender por qué algunas URLs son accesibles para ciertos bots pero no para otros, incluso con el mismo archivo robots.txt.

La regla de 'la coincidencia más larga gana' en robots.txt

Cuando un rastreador evalúa si puede acceder a una URL, el archivo robots.txt no se lee de arriba hacia abajo como un script, sino que se aplican reglas de precedencia basadas en la longitud de la ruta coincidente. Imagina este fragmento:

User-agent: *
Disallow: /blog/
Allow: /blog/articulos/
Disallow: /*.pdf$

Si un bot intenta acceder a /blog/articulos/guia.pdf, el sistema compara todas las reglas que podrían aplicarse:

  1. /blog/ (7 caracteres)
  2. /blog/articulos/ (17 caracteres)
  3. /*.pdf$ (6 caracteres, pero con comodín)

La regla más larga (/blog/articulos/) es la que decide el resultado, y como es un Allow, el acceso está permitido. En caso de empate (por ejemplo, si existiera otra regla como Disallow: /blog/articulos/*), gana el Allow. Esta lógica explica por qué patrones como /*.pdf$ (que bloquea archivos PDF solo si terminan con esa extensión) pueden coexistir con rutas más específicas sin conflictos.

Un error común es asumir que el orden de las reglas importa. En realidad, el archivo se procesa como un conjunto de patrones, donde la longitud y el tipo de regla (Allow o Disallow) son los únicos factores decisivos. Esto permite estructurar archivos complejos sin preocuparse por la secuencia, siempre que las rutas estén bien definidas.

Cómo probar el acceso de rastreadores de IA con el Probador de robots.txt

Los crawlers de inteligencia artificial, como GPTBot (de OpenAI) o ClaudeBot (de Anthropic), han añadido una capa nueva de complejidad al archivo robots.txt. Estos bots no solo siguen las reglas tradicionales de Disallow, sino que también interpretan la directiva Content-Signal, que indica el uso permitido del contenido: search (para motores de búsqueda), ai-input (para entrenamiento de modelos) o ai-train (para ajuste fino). Por ejemplo:

User-agent: GPTBot
Disallow: /admin/
Content-Signal: ai-input

Con el Generador de reglas para crawlers de IA, puedes crear estas directivas y luego validarlas en el Probador de robots.txt. Al pegar el archivo y seleccionar GPTBot como agente, el probador mostrará no solo si una URL está bloqueada, sino también qué valor de Content-Signal se aplica. Esto es crucial para editores que quieren permitir el acceso a su contenido para búsquedas, pero no para entrenamiento de modelos.

El probador también resuelve dudas frecuentes: ¿qué pasa si no incluyo GPTBot en mi archivo? El bot usará las reglas del grupo *. ¿Y si quiero bloquear solo ClaudeBot? Basta con crear un grupo específico para él. La herramienta incluso advierte si hay conflictos, como cuando una URL está permitida por Allow pero bloqueada por un Disallow más largo. Para sitios con contenido en español, es especialmente útil probar rutas con caracteres especiales, como /español/ñandú/, que algunos crawlers podrían malinterpretar.

Errores comunes en robots.txt que el Probador de robots.txt detecta

Aunque el archivo robots.txt parece simple, pequeños errores pueden tener consecuencias graves. El Probador de robots.txt identifica problemas que muchos editores pasan por alto:

  1. Rutas relativas: Escribir Disallow: privado/ en lugar de Disallow: /privado/ es un error frecuente. El probador advierte que las rutas deben empezar con / para ser válidas.
  2. *Directivas antes de User-agent**: Si colocas una línea como Disallow: / antes de cualquier User-agent*, el probador la marcará como inválida, ya que las reglas deben agruparse bajo un agente.
  3. Crawl-delay: Aunque algunos bots como Yandex lo respetan, Google lo ignora. El probador lo señala como una directiva no estándar en RFC 9309.
  4. Directivas de proveedores: Extensiones como Host (de Yandex) o Clean-param (para eliminar parámetros de URL) son reportadas como no universales.
  5. Noindex en robots.txt: Algunos sitios intentan usar Noindex: / para evitar la indexación, pero esta directiva no está en el estándar y no tiene efecto.

Además, el probador alerta sobre conflictos de mayúsculas/minúsculas. Por ejemplo, /ES/ y /es/ son rutas distintas en sistemas sensibles al caso. También aclara que bloquear una URL con robots.txt no la elimina de los resultados de búsqueda: solo impide que los crawlers la visiten. Si la URL ya está indexada, seguirá apareciendo en los resultados, aunque sin descripción.

Para sitios con múltiples idiomas, como los que usan /es/, /en/ y /pt/, es vital probar cada ruta por separado. El probador permite ingresar URLs completas (como https://ejemplo.com/es/articulo) y las reduce a su ruta y parámetros, ignorando el dominio. Esto facilita la depuración sin necesidad de subir el archivo a un servidor.

Qué NO hace el Probador de robots.txt (y por qué es una ventaja)

El Probador de robots.txt está diseñado para ser una herramienta ligera y privada, pero esto implica algunas limitaciones que, en realidad, son ventajas para ciertos usuarios. En primer lugar, *no descarga el archivo robots.txt de un sitio en vivo*. Esto significa que puedes probar borradores o versiones locales sin exponerlos públicamente. Por ejemplo, si estás rediseñando un sitio y quieres validar las reglas antes de subir el nuevo archivo, el probador te permite hacerlo sin riesgo.

Otra limitación es que no verifica el estado de indexación de una URL. Si una página está bloqueada por robots.txt pero ya fue indexada, el probador solo te dirá que el crawler no puede acceder a ella, no si sigue apareciendo en los resultados de búsqueda. Para esto, necesitarías herramientas como Google Search Console.

El probador tampoco normaliza codificaciones. Si tu archivo contiene rutas con caracteres especiales como /español/ñ/, debes asegurarte de que estén correctamente codificadas en UTF-8 antes de pegarlas. Además, no resuelve redirecciones: si una URL redirige a otra, el probador evaluará la ruta original, no la final.

Por último, la herramienta no interactúa con llms.txt. Aunque ambos archivos pueden coexistir en la raíz de un sitio, el Probador de robots.txt solo analiza las reglas de robots.txt. Si quieres gestionar permisos para modelos de lenguaje, puedes usar el Generador de llms.txt para crear ese archivo y luego validar su comportamiento con otras herramientas.

Estas limitaciones hacen que el probador sea ideal para pruebas rápidas y seguras, especialmente para desarrolladores que trabajan en entornos locales o para editores que quieren evitar cambios accidentales en sus sitios en producción.

Cómo interpretar los resultados del Probador de robots.txt

Al usar el Probador de robots.txt, cada URL que ingreses recibirá un veredicto claro: Permitido o Bloqueado, junto con detalles que explican por qué. Por ejemplo, si pruebas la URL /blog/articulo-secreto con un archivo que contiene:

User-agent: *
Disallow: /blog/
Allow: /blog/publico/

El resultado mostrará: - Verdicto: Bloqueado - Regla decisiva: Disallow: /blog/ (línea 2) - Grupo aplicado: * - Content-Signal: No especificado (si no hay directiva)

El número de línea es crucial para depurar: si tienes un archivo largo, saber exactamente qué regla está causando el bloqueo te ahorra tiempo. Además, el probador indica qué grupo se aplicó (Googlebot, GPTBot, *, etc.), lo que ayuda a entender si el crawler está usando sus reglas específicas o las genéricas.

Otro dato útil es el valor de Content-Signal. Si tu archivo incluye Content-Signal: ai-input para ClaudeBot, el probador lo reportará, aunque no lo aplique como bloqueo técnico. Esto es importante para editores que quieren permitir el acceso a su contenido, pero con restricciones de uso.

El probador también lista las líneas de Sitemap que encuentre en el archivo, aunque no las valida. Por último, si hay advertencias (como directivas no estándar o rutas relativas), aparecerán al final. Estos mensajes son clave para corregir errores antes de subir el archivo a producción. Los resultados se pueden exportar como CSV o imagen, lo que facilita compartir informes con equipos de SEO o desarrollo.

Diferencias entre el Probador de robots.txt y otras herramientas

Google Search Console ofrece un informe de robots.txt que muestra el archivo en vivo de un sitio y posibles errores de rastreo, pero tiene limitaciones: solo funciona con dominios verificados y no permite probar borradores. En cambio, el Probador de robots.txt de Callculation es independiente del sitio: puedes pegar cualquier texto, incluso uno que aún no hayas subido, y probarlo contra cualquier crawler, desde Googlebot hasta GPTBot.

Otras herramientas en línea suelen requerir registro o solo validan la sintaxis, sin simular el comportamiento real de los bots. El probador de Callculation va más allá: no solo verifica que el archivo sea válido, sino que aplica las reglas de precedencia (como la coincidencia más larga gana) y muestra qué ruta específica está bloqueando o permitiendo el acceso. Esto es especialmente útil para sitios con estructuras complejas, como los que usan parámetros de URL o rutas con múltiples niveles.

Además, el probador es 100% local: todo el procesamiento ocurre en el navegador, por lo que no envía datos a servidores externos. Esto lo hace ideal para probar archivos confidenciales o para desarrolladores que trabajan sin conexión. También exporta los resultados en formatos prácticos (CSV o imagen), algo que herramientas como la de Google no ofrecen.

Para quienes gestionan sitios multilingües, el probador es una ventaja: puedes probar rutas con caracteres especiales (como /español/ o /café/) sin preocuparte por problemas de codificación. Y si trabajas con crawlers de IA, la integración con el Generador de reglas para crawlers de IA te permite crear y validar reglas en un mismo flujo de trabajo.

Las que respondemos con más frecuencia.

¿Cómo uso el Probador de robots.txt para ver si una URL está bloqueada?

Simplemente pega el contenido de tu archivo robots.txt en el campo correspondiente, escribe el nombre del rastreador (por ejemplo, Googlebot, GPTBot o ClaudeBot) y lista las URLs o rutas que quieres probar, una por línea. El Probador de robots.txt te mostrará si cada URL está permitida o bloqueada, junto con la regla que decidió el resultado y el número de línea en el archivo. Todo se procesa en tu navegador, sin necesidad de subir el archivo a un servidor.

¿Necesito tener mi sitio web en línea o crear una cuenta para usar el Probador de robots.txt?

No. El Probador de robots.txt funciona completamente en tu navegador y no requiere que tu sitio esté publicado ni que te registres. Puedes probar borradores de archivos robots.txt antes de subirlos a tu servidor, lo que es útil para evitar errores antes de implementarlos.

¿Qué pasa si tanto una regla Allow como una Disallow coinciden con la misma URL?

Gana la regla con el patrón más largo. Si ambas reglas tienen la misma longitud, la regla Allow prevalece. Por ejemplo, si tienes Disallow: /blog/ y Allow: /blog/articulo, la segunda regla permitirá el acceso a /blog/articulo porque es más específica. Si no hay coincidencia, la URL se considera permitida por defecto.

¿Qué significan los símbolos * y $ en las reglas de robots.txt?

El símbolo * actúa como comodín y puede representar cualquier secuencia de caracteres. Por ejemplo, Disallow: /*.pdf bloquea todos los archivos PDF. El símbolo $ indica el final de una URL, por lo que Disallow: /*.pdf$ bloquea solo las URLs que terminan en .pdf. Aunque estos símbolos no están en el RFC 9309 original, son ampliamente utilizados por los principales rastreadores como Googlebot.

¿Qué es la línea Content-Signal y por qué aparece en los resultados?

La línea Content-Signal es una directiva opcional que indica el uso preferido del contenido por parte del propietario del sitio (por ejemplo, search, ai-input o ai-train). El Probador de robots.txt la detecta y te muestra su valor, pero no la aplica como bloqueo técnico. Es útil para gestionar cómo los rastreadores de IA, como GPTBot o ClaudeBot, pueden utilizar tu contenido. Si quieres configurar estas reglas, puedes usar el generador de reglas para rastreadores de IA.

¿Por qué el Probador de robots.txt marca la directiva Crawl-delay como advertencia?

La directiva Crawl-delay no está incluida en el estándar RFC 9309 y es ignorada por la mayoría de los rastreadores importantes, como Googlebot. Aunque algunos motores de búsqueda (como Yandex o Bing) la respetan, el Probador de robots.txt la marca para recordarte que no es una solución universal si buscas controlar la frecuencia de rastreo. Para estos casos, es mejor usar herramientas específicas del motor de búsqueda o ajustar la configuración del servidor.

Si bloqueo una URL en robots.txt, ¿se eliminará de los resultados de búsqueda?

No. El archivo robots.txt controla el acceso de los rastreadores a tu sitio, pero no influye directamente en la indexación. Una URL bloqueada puede seguir apareciendo en los resultados de búsqueda si otros sitios enlazan a ella. Si quieres evitar que una página se indexe, debes usar la metaetiqueta noindex o protegerla con autenticación. El Probador de robots.txt solo te ayuda a verificar qué URLs están bloqueadas para el rastreo.

¿Puedo probar un rastreador que no está mencionado explícitamente en mi archivo robots.txt?

Sí. Si el rastreador no tiene un grupo específico en tu archivo robots.txt, el Probador de robots.txt buscará primero un grupo con el token padre (por ejemplo, Googlebot-Image usará las reglas de Googlebot) y, si no lo encuentra, aplicará las reglas del grupo *. Si no hay un grupo *, todas las URLs se considerarán permitidas por defecto.

¿En qué se diferencia este Probador de robots.txt del informe de robots.txt de Google Search Console?

El informe de Google Search Console muestra el archivo robots.txt que Google ha descargado de tu sitio en vivo y cualquier error de rastreo. En cambio, el Probador de robots.txt te permite probar cualquier borrador de archivo (incluso antes de subirlo) contra cualquier rastreador, sin necesidad de verificar la propiedad del sitio. Es ideal para hacer pruebas rápidas o depurar reglas antes de implementarlas.

¿Puedo exportar los resultados del Probador de robots.txt?

Sí. Después de ejecutar la prueba, puedes exportar los resultados en formato CSV o como imagen. Esto es útil para documentar las reglas aplicadas o compartir los resultados con tu equipo de desarrollo o SEO. Los datos exportados incluyen el veredicto (permitido/bloqueado), la regla decisiva, el número de línea y el grupo aplicado.