Seleccionar idioma

Generador de robots.txt para bloquear rastreadores de IA en tu sitio web

Crea un robots.txt para rastreadores de IA como GPTBot o Google-Extended, con Content-Signal y bloqueo por rol: entrenamiento, búsqueda o usuarios.

Generador de robots.txt para rastreadores de IACómo funciona ↓
Indexar la página y mostrar enlaces con fragmentos cortos
Usar la página como material fuente para respuestas generadas
Usar la página para entrenar o ajustar modelos de IA
Extensión de Cloudflare: hasta dónde puede llegar un bot con el contenido obtenido
Redacción legal que da efecto a las señales según las normas de copyright de la UE
Bloquearlos no afecta a la visibilidad en búsquedas
Bloquearlos te excluye de las respuestas de búsqueda con IA y sus citas
Bloquearlos impide que los asistentes abran tus páginas cuando se les solicite
Agentes que hacen clic y rellenan formularios en nombre de un usuario
Usa / para todo el sitio o una carpeta como /articulos/
Solo necesario para los enlaces de Sitemap y llms.txt
Se añade como comentario; robots.txt no tiene directiva llms.txt

robots.txt y Content-Signal expresan preferencias; no bloquean nada por sí mismos. Los rastreadores bien comportados las respetan, otros las ignoran, y Google ha indicado que no actúa sobre Content-Signal. Combínalos con reglas de servidor para bots si necesitas hacerlas cumplir.

Mehmet Demiray Publicado Actualizado
Compartir

Los cuatro tipos de bots de IA y qué hacen con tu contenido

Cuando hablamos de rastreadores de inteligencia artificial, no todos actúan igual ni tienen el mismo impacto en tu sitio web. El Generador de robots.txt para rastreadores de IA clasifica los bots en cuatro categorías, cada una con un propósito distinto y un costo diferente al bloquearlos. Entender estas diferencias te ayudará a decidir qué conviene permitir o restringir en tu archivo robots.txt.

El primer grupo son los colectores de datos para entrenamiento, que representan más de la mitad de los bots incluidos en la herramienta. Estos rastreadores, como GPTBot (OpenAI), CCBot (Common Crawl) o Google-Extended, visitan tu sitio para extraer contenido y usarlo en el entrenamiento de modelos de lenguaje. Si bloqueas estos bots, evitas que tu contenido se utilice para mejorar sistemas como ChatGPT o Gemini, pero también reduces la probabilidad de que tu sitio aparezca como fuente en respuestas generadas por IA. Para muchos creadores de contenido, este es el equilibrio ideal: proteger su trabajo sin desaparecer por completo del ecosistema de la IA.

El segundo grupo son los indexadores de búsqueda con IA, como OAI-SearchBot o PerplexityBot. Estos bots no recopilan datos para entrenamiento, sino que analizan tu contenido para incluirlo en bases de datos que luego alimentan motores de búsqueda basados en IA. Si bloqueas estos rastreadores, tu sitio dejará de aparecer en respuestas de herramientas como Perplexity o You.com, lo que puede afectar tu visibilidad en un segmento creciente de usuarios. Para un medio digital o un blog que depende del tráfico orgánico, esta decisión no es trivial.

El tercer grupo son los rastreadores activados por usuarios, como ChatGPT-User o BingPreview. Estos bots acceden a tu sitio cuando un usuario solicita información específica, por ejemplo, al pedirle a un asistente de IA que resuma una noticia o verifique un dato. Bloquearlos significa que tu contenido no se mostrará en respuestas personalizadas, pero tampoco se usará para entrenar modelos. Para sitios con contenido premium o información sensible, esta puede ser una opción intermedia: permitir el acceso puntual sin ceder derechos sobre el uso masivo de los datos.

El último grupo son los agentes de navegación, como Anthropic-Web o CohereBot. Estos bots simulan el comportamiento de un usuario humano para interactuar con tu sitio, ya sea para extraer información estructurada o para realizar tareas automatizadas. Aunque su impacto en el tráfico es menor, bloquearlos puede ser útil si detectas que están consumiendo recursos del servidor sin aportar valor real. Por ejemplo, un sitio pequeño con un hosting limitado podría priorizar el bloqueo de estos bots para evitar sobrecargas.

La herramienta te permite elegir qué grupos bloquear mediante ajustes preestablecidos. El valor predeterminado, por ejemplo, bloquea solo los colectores de entrenamiento, manteniendo abiertas las puertas a los indexadores de búsqueda y los rastreadores activados por usuarios. Esta configuración es ideal para quienes buscan un equilibrio entre proteger su contenido y mantener su relevancia en el ecosistema digital actual.

Cómo funciona el archivo robots.txt generado para controlar bots de IA

El Generador de robots.txt para rastreadores de IA crea un archivo que combina dos capas de control: las señales de contenido (Content-Signal) y las reglas de bloqueo por bot individual. El resultado es un documento que puedes subir directamente a la raíz de tu dominio, como www.tudominio.com/robots.txt, y que los rastreadores respetarán si cumplen con el estándar.

La primera capa es el grupo de reglas para todos los rastreadores, identificado con User-agent: *. Aquí se incluyen las señales de contenido, que son una extensión reciente del protocolo robots.txt. Estas señales permiten especificar qué usos se permiten o restringen para el contenido del sitio. Por ejemplo, la línea Content-Signal: search=allow, ai-input=disallow, ai-train=disallow indica que el sitio permite que su contenido se use en resultados de búsqueda, pero prohíbe su uso para entrenar modelos de IA o como entrada directa en sistemas de IA. Además, puedes añadir el parámetro use de Cloudflare, que define el nivel de aplicación de estas reglas: immediate (aplicación inmediata), reference (uso solo como referencia) o full (uso completo).

La segunda capa son los grupos individuales para cada bot que decidas bloquear. Por ejemplo, si eliges bloquear GPTBot, el archivo incluirá:

User-agent: GPTBot
Disallow: /

Esto significa que GPTBot no podrá acceder a ninguna página de tu sitio. La herramienta aplica la misma ruta de bloqueo (Disallow: /) a todos los bots seleccionados, pero puedes editar el archivo descargado para especificar rutas más específicas, como Disallow: /privado/ si solo quieres proteger una carpeta concreta. Esta flexibilidad es útil para sitios con áreas restringidas, como un blog con secciones de pago o un portal de noticias con contenido exclusivo para suscriptores.

El archivo generado también incluye opciones adicionales, como una línea para el mapa del sitio (Sitemap: https://tudominio.com/sitemap.xml) y un comentario que apunta a un archivo llms.txt. Estas líneas no son obligatorias, pero sí recomendables para mejorar la indexación y la transparencia. El comentario sobre llms.txt, por ejemplo, sirve como recordatorio de que existe otro archivo complementario para gestionar el acceso de los modelos de lenguaje a tu contenido.

Una vez generado el archivo, la herramienta te muestra un resumen con información clave: cuántos bots has bloqueado, qué operadores están afectados (como OpenAI o Google) y cuántos grupos de User-agent se han creado. Este resumen te ayuda a verificar que la configuración coincide con lo que esperabas antes de subir el archivo a tu servidor.

Qué son las señales de contenido y cómo afectan a tu sitio

Las señales de contenido (Content-Signal) son una extensión del protocolo robots.txt que permite a los propietarios de sitios web especificar cómo quieren que se utilice su contenido en el contexto de la inteligencia artificial. A diferencia de las reglas tradicionales de Disallow, que solo indican si un bot puede o no acceder a una página, las señales de contenido ofrecen un control más granular sobre el propósito del acceso. Estas señales son especialmente relevantes en un entorno donde los rastreadores de IA no solo indexan contenido, sino que también lo usan para entrenar modelos o generar respuestas.

El estándar define tres señales principales: search, ai-input y ai-train. Cada una de ellas puede tomar los valores allow (permitido), disallow (prohibido) o no-preference (sin preferencia, lo que equivale a omitir la señal). La señal search indica si el contenido puede usarse en resultados de búsqueda, tanto tradicionales como basados en IA. Por ejemplo, si un sitio permite search=allow, los motores de búsqueda podrán mostrar fragmentos de su contenido en respuestas a consultas de usuarios. La señal ai-input controla si el contenido puede usarse como entrada directa en sistemas de IA, como cuando un asistente virtual resume una noticia. Finalmente, ai-train determina si el contenido puede utilizarse para entrenar modelos de lenguaje.

Además de estas tres señales, el parámetro use de Cloudflare añade un nivel adicional de control. Este parámetro, que solo es relevante si usas Cloudflare como proveedor de CDN, define cómo se aplican las señales de contenido. El valor immediate significa que las reglas deben aplicarse de inmediato, reference permite usar el contenido solo como referencia (por ejemplo, para citarlo en respuestas sin entrenar con él) y full no impone restricciones adicionales. Esta opción es útil para sitios que quieren mantener un control estricto sobre cómo se utiliza su contenido en plataformas que respetan estas reglas.

El Generador de robots.txt para rastreadores de IA incluye un bloque de comentarios que explica la política de señales de contenido en el contexto de la Directiva Europea 2019/790 sobre derechos de autor. Este bloque, que puedes activar o desactivar, reserva explícitamente los derechos de minería de textos y datos (TDM) bajo el artículo 4 de la directiva. Aunque esta reserva no tiene efecto legal vinculante fuera de la UE, sirve como una declaración clara de intenciones para los operadores de bots que respetan las normas de transparencia. Para sitios con audiencia en Europa, esta opción puede ser un complemento útil a las reglas técnicas de robots.txt.

Es importante tener en cuenta que las señales de contenido son una solicitud, no una obligación. Algunos rastreadores, como Google, han declarado que no actúan en función de estas señales, mientras que otros, como Cloudflare, las respetan de manera activa. Por eso, aunque el archivo generado por la herramienta es un primer paso efectivo, no sustituye a medidas adicionales como reglas de firewall o autenticación de bots, especialmente para sitios con contenido sensible o de alto valor.

Cómo elegir qué bots de IA bloquear según tu tipo de sitio

La decisión de qué bots de IA bloquear en tu archivo robots.txt depende del tipo de contenido que publiques y de los objetivos que tengas para tu sitio. El Generador de robots.txt para rastreadores de IA ofrece cuatro ajustes preestablecidos que cubren las necesidades más comunes, pero también permite personalizar la configuración para casos específicos. A continuación, te explicamos cómo elegir la opción más adecuada según el perfil de tu sitio.

Si gestionas un blog personal o un medio digital que depende del tráfico orgánico, el ajuste predeterminado de la herramienta es probablemente el más adecuado. Este ajuste bloquea los bots de entrenamiento (como GPTBot o CCBot) pero permite el acceso a los indexadores de búsqueda con IA (como OAI-SearchBot o PerplexityBot) y a los rastreadores activados por usuarios (como ChatGPT-User). La lógica detrás de esta configuración es clara: evitas que tu contenido se use para entrenar modelos sin tu consentimiento, pero mantienes la posibilidad de que tu sitio aparezca en respuestas de IA cuando los usuarios busquen información relacionada. Para un blog en español que cubre temas de tecnología o cultura, por ejemplo, esta opción te permite proteger tu trabajo sin sacrificar visibilidad.

Si tu sitio es un portal de noticias o una plataforma con contenido premium, es posible que prefieras bloquear todos los bots de IA para evitar que tu contenido se replique sin atribución. En este caso, el ajuste "Todos los bots de IA" es la opción más restrictiva. Sin embargo, debes ser consciente de que esta decisión puede reducir tu alcance en herramientas como Perplexity o You.com, que cada vez son más utilizadas por los usuarios. Una alternativa intermedia es bloquear solo los bots de entrenamiento y los agentes de navegación, manteniendo abiertos los indexadores de búsqueda. Así, tu contenido seguirá apareciendo en respuestas de IA, pero no se usará para entrenar modelos.

Para sitios con áreas privadas o contenido sensible, como un portal de membresía o una intranet corporativa, la clave está en utilizar rutas de bloqueo específicas. El ajuste predeterminado de la herramienta bloquea todos los bots seleccionados en la raíz del sitio (Disallow: /), pero puedes editar el archivo descargado para restringir solo ciertas carpetas. Por ejemplo, si tienes una sección de /miembros/ que solo deben ver los suscriptores, puedes añadir una línea como Disallow: /miembros/ para cada bot que quieras bloquear. Esta configuración es útil para proteger información confidencial sin afectar el resto del sitio.

Si tu objetivo es optar por completo del ecosistema de la IA, el ajuste "Solo señales" puede ser una opción interesante. Este ajuste no bloquea ningún bot individual, pero incluye las señales de contenido en el grupo User-agent: * para indicar que no permites el uso de tu contenido en entrenamiento o como entrada directa en sistemas de IA. Aunque esta opción no impide que los bots accedan a tu sitio, sirve como una declaración de intenciones y puede ser útil si quieres mantener una postura clara sin cerrar las puertas a los motores de búsqueda tradicionales.

Finalmente, si gestionas un sitio de comercio electrónico o una plataforma con contenido dinámico, es posible que prefieras una configuración personalizada. Por ejemplo, podrías bloquear los bots de entrenamiento para proteger tus descripciones de productos, pero permitir el acceso a los indexadores de búsqueda para que tus productos aparezcan en respuestas de IA. En este caso, la herramienta te permite seleccionar manualmente qué bots bloquear y cuáles permitir, adaptando la configuración a tus necesidades específicas.

Límites del robots.txt y cómo reforzar el bloqueo de bots de IA

El archivo robots.txt es una herramienta útil para gestionar el acceso de los rastreadores a tu sitio, pero tiene limitaciones importantes que debes conocer. En primer lugar, el cumplimiento de las reglas es voluntario. Aunque la mayoría de los bots respetan el estándar, algunos rastreadores malintencionados o poco transparentes pueden ignorar las directivas de Disallow o las señales de contenido. Esto significa que, aunque generes un archivo robots.txt con el Generador de robots.txt para rastreadores de IA, no hay garantía de que todos los bots lo acaten. Por ejemplo, algunos rastreadores de entrenamiento podrían seguir accediendo a tu contenido si no implementas medidas adicionales.

Otra limitación es que el robots.txt no elimina contenido ya recopilado. Si un bot ha accedido a tu sitio antes de que implementaras las reglas de bloqueo, el contenido ya puede estar almacenado en sus bases de datos. Esto es especialmente relevante para los bots de entrenamiento, que suelen recopilar grandes volúmenes de datos antes de que los propietarios de los sitios tomen medidas. Si descubres que tu contenido ha sido utilizado sin permiso, el robots.txt no te ayudará a eliminarlo de los modelos ya entrenados. En estos casos, es posible que necesites recurrir a acciones legales o a herramientas como el archivo llms.txt para solicitar la eliminación.

Para reforzar el bloqueo de bots de IA, puedes complementar el robots.txt con otras medidas técnicas. Una opción es configurar reglas en tu servidor o CDN para bloquear los bots no deseados a nivel de red. Por ejemplo, si usas Cloudflare, puedes crear reglas de firewall que bloqueen las direcciones IP asociadas a los bots de entrenamiento. Otra alternativa es autenticar los bots mediante claves criptográficas, como las generadas por el Generador de claves de autenticación para bots web. Esta técnica verifica la identidad de los rastreadores antes de permitirles el acceso, lo que reduce el riesgo de que bots no autorizados ignoren las reglas de robots.txt.

También es recomendable verificar el archivo robots.txt antes de subirlo a tu sitio. El Probador de robots.txt te permite simular cómo los distintos bots interpretarán tus reglas, lo que te ayuda a detectar errores de configuración. Por ejemplo, si has especificado una ruta de bloqueo incorrecta, el probador te mostrará qué páginas seguirán siendo accesibles para los bots. Esta herramienta es especialmente útil si has editado manualmente el archivo generado para añadir rutas personalizadas.

Finalmente, recuerda que el robots.txt no es la única herramienta para gestionar el acceso de los bots. El archivo llms.txt, por ejemplo, es un estándar emergente que permite a los propietarios de sitios especificar políticas más detalladas sobre el uso de su contenido en modelos de lenguaje. Aunque el Generador de robots.txt para rastreadores de IA solo incluye un comentario que apunta a este archivo, puedes crear uno con el Generador de llms.txt para complementar tu estrategia de control de bots. La combinación de robots.txt, llms.txt y medidas técnicas adicionales te dará un mayor control sobre cómo se utiliza tu contenido en el ecosistema de la IA.

Robots.txt vs. llms.txt: diferencias y cómo usarlos juntos

Aunque ambos archivos sirven para gestionar el acceso de los bots a tu sitio, robots.txt y llms.txt tienen propósitos distintos y se complementan en lugar de sustituirse. El archivo robots.txt es el estándar tradicional para controlar qué rastreadores pueden acceder a tu sitio y qué páginas pueden visitar. Su enfoque es técnico: define reglas de acceso basadas en el User-agent y las rutas del sitio. Por ejemplo, puedes usar robots.txt para bloquear GPTBot en todas las páginas o permitir el acceso de Googlebot solo a ciertas secciones. Este archivo es reconocido por la mayoría de los motores de búsqueda y rastreadores, lo que lo convierte en una herramienta esencial para cualquier sitio web.

En cambio, el archivo llms.txt es un estándar más reciente, diseñado específicamente para gestionar cómo los modelos de lenguaje (LLM) pueden utilizar el contenido de tu sitio. A diferencia de robots.txt, que se centra en el acceso, llms.txt define políticas sobre el uso del contenido. Por ejemplo, puedes especificar si permites que tu contenido se use para entrenar modelos, si debe atribuirse siempre a tu sitio o si solo puede utilizarse en respuestas a consultas específicas. Este archivo es especialmente útil para creadores de contenido que quieren mantener el control sobre cómo se replica su trabajo en herramientas de IA, como asistentes virtuales o motores de búsqueda basados en LLM.

El Generador de robots.txt para rastreadores de IA incluye un comentario que apunta a tu archivo llms.txt, pero no genera este archivo directamente. Esto se debe a que robots.txt no tiene una directiva estándar para llms.txt, a diferencia de la línea Sitemap que sí está reconocida. Para crear un archivo llms.txt, puedes usar el Generador de llms.txt, que te permite definir políticas detalladas sobre el uso de tu contenido en modelos de lenguaje. Por ejemplo, puedes indicar que tu contenido no debe usarse para entrenar modelos sin tu consentimiento explícito o que debe citarse siempre como fuente.

Usar ambos archivos juntos te da un control más completo sobre el acceso y el uso de tu contenido. Por ejemplo, puedes configurar robots.txt para bloquear los bots de entrenamiento (como GPTBot) y usar llms.txt para especificar que, incluso si un bot accede a tu sitio, no debe usar el contenido para entrenar modelos. Esta combinación es especialmente útil para sitios con contenido de alto valor, como medios digitales o plataformas educativas, que quieren proteger su trabajo sin perder visibilidad en los motores de búsqueda.

Otra diferencia clave entre ambos archivos es su alcance. Mientras que robots.txt es reconocido por la mayoría de los rastreadores, llms.txt es un estándar emergente que aún no es adoptado por todos los operadores de bots. Sin embargo, su uso está creciendo, especialmente entre plataformas que buscan ser más transparentes sobre cómo utilizan el contenido de terceros. Por ejemplo, algunos motores de búsqueda basados en IA ya respetan las políticas definidas en llms.txt, lo que lo convierte en una herramienta valiosa para el futuro.

Si decides implementar ambos archivos, es importante que sus políticas sean coherentes. Por ejemplo, si bloqueas un bot en robots.txt, no tiene sentido permitir su acceso en llms.txt, ya que el bot no podrá leer este último archivo si no puede acceder al sitio. Del mismo modo, si defines políticas restrictivas en llms.txt, asegúrate de que robots.txt no permita el acceso a bots que no respetan estas políticas. La coherencia entre ambos archivos te ayudará a mantener un control efectivo sobre cómo se utiliza tu contenido en el ecosistema digital.

Preguntas frecuentes sobre el bloqueo de bots de IA con robots.txt

El bloqueo de bots de IA mediante el archivo robots.txt genera muchas dudas, especialmente entre quienes no están familiarizados con el estándar o con el funcionamiento de los rastreadores. A continuación, respondemos algunas de las preguntas más comunes para ayudarte a tomar decisiones informadas.

¿Cómo bloqueo los bots de IA en mi sitio? Para bloquear los bots de IA, primero selecciona los rastreadores que quieres restringir en el Generador de robots.txt para rastreadores de IA. La herramienta te ofrece ajustes preestablecidos, como "Solo bots de entrenamiento" o "Todos los bots de IA", o la opción de personalizar la configuración. Una vez generado el archivo, descárgalo y súbelo a la raíz de tu dominio, por ejemplo, en www.tudominio.com/robots.txt. Asegúrate de que el archivo sea accesible desde esa ubicación exacta, ya que los bots solo lo buscarán allí.

¿Dónde debo colocar el archivo robots.txt? El archivo robots.txt debe ubicarse en la raíz de tu dominio, es decir, en la carpeta principal del sitio. Por ejemplo, si tu dominio es www.ejemplo.com, el archivo debe estar en www.ejemplo.com/robots.txt. No puede estar en una subcarpeta como www.ejemplo.com/blog/robots.txt, ya que los bots no lo buscarán allí. Además, solo puede haber un archivo robots.txt por dominio, por lo que si gestionas varios subdominios (como blog.ejemplo.com), cada uno debe tener su propio archivo.

¿Es gratis el Generador de robots.txt para rastreadores de IA? ¿Necesito registrarme? Sí, la herramienta es completamente gratuita y no requiere registro. Funciona directamente en tu navegador, sin enviar datos a ningún servidor. Esto significa que puedes usarla sin preocuparte por la privacidad de tu sitio o por la seguridad de la información que introduces. Además, al no requerir registro, puedes generar y descargar el archivo en cuestión de segundos, sin trámites adicionales.

¿Qué diferencia hay entre GPTBot, OAI-SearchBot y ChatGPT-User? Estos tres bots pertenecen a OpenAI, pero cumplen funciones distintas. GPTBot es un rastreador de entrenamiento: accede a tu sitio para recopilar datos y usarlos en el entrenamiento de modelos como ChatGPT. OAI-SearchBot, en cambio, es un indexador de búsqueda: analiza tu contenido para incluirlo en bases de datos que alimentan motores de búsqueda basados en IA. Finalmente, ChatGPT-User es un rastreador activado por usuarios: accede a tu sitio cuando un usuario solicita información específica, como un resumen de una noticia. Bloquear GPTBot evita que tu contenido se use para entrenar modelos, mientras que bloquear OAI-SearchBot o ChatGPT-User puede reducir tu visibilidad en respuestas de IA.

¿Qué es Content-Signal y cómo funciona? Content-Signal es una extensión del protocolo robots.txt que permite especificar cómo se puede utilizar el contenido de tu sitio en el contexto de la IA. Incluye tres señales: search (si el contenido puede usarse en resultados de búsqueda), ai-input (si puede usarse como entrada directa en sistemas de IA) y ai-train (si puede usarse para entrenar modelos). Cada señal puede tomar los valores allow, disallow o no-preference. Por ejemplo, Content-Signal: search=allow, ai-input=disallow, ai-train=disallow permite que tu contenido aparezca en resultados de búsqueda, pero prohíbe su uso para entrenar modelos o como entrada en sistemas de IA. Estas señales se incluyen en el grupo User-agent: * del archivo robots.txt.

¿Qué bloquea exactamente Google-Extended? Google-Extended es un User-agent específico de Google que controla el acceso de los bots de entrenamiento para modelos como Gemini. A diferencia de Googlebot, que se encarga de la indexación para el motor de búsqueda tradicional, Google-Extended solo afecta al uso de tu contenido en el entrenamiento de IA. Bloquear Google-Extended no afecta a tu posicionamiento en Google Search, pero sí evita que tu contenido se utilice para entrenar modelos de lenguaje de Google. Esta distinción es importante para sitios que quieren proteger su contenido sin perder visibilidad en los resultados de búsqueda tradicionales.

¿Bloquear bots de IA afectará a mi posicionamiento en Google? Bloquear los bots de entrenamiento, como GPTBot o Google-Extended, no afectará a tu posicionamiento en Google Search, ya que estos bots no están relacionados con la indexación tradicional. Sin embargo, si bloqueas los indexadores de búsqueda con IA, como OAI-SearchBot o PerplexityBot, tu sitio dejará de aparecer en respuestas de herramientas como Perplexity o You.com. Esto puede reducir tu alcance en un segmento de usuarios que cada vez más recurren a estos motores de búsqueda. Por eso, es importante evaluar qué bots bloquear en función de tus objetivos de visibilidad.

Las que respondemos con más frecuencia.

¿Cómo bloqueo los rastreadores de IA en mi sitio web con el Generador de robots.txt para rastreadores de IA?

Selecciona un ajuste predefinido (por ejemplo, «solo rastreadores de entrenamiento», que es el predeterminado), genera el archivo robots.txt y súbelo a la raíz de tu dominio. El generador crea un archivo listo para usar que combina señales de contenido (como ai-train: disallow) con reglas específicas para más de 50 agentes de IA agrupados en cuatro categorías. No necesitas registrarte ni pagar nada.

¿Dónde debo colocar el archivo robots.txt generado?

El archivo debe ir en la raíz de tu dominio, es decir, en la carpeta principal de tu sitio web (por ejemplo, tudominio.com/robots.txt). Solo puede haber un archivo robots.txt por dominio, y los rastreadores lo buscan automáticamente en esa ubicación.

¿Qué diferencia hay entre bloquear GPTBot, OAI-SearchBot y ChatGPT-User?

GPTBot recopila datos para entrenar modelos de IA (como los de OpenAI), OAI-SearchBot indexa contenido para respuestas en motores de búsqueda de IA, y ChatGPT-User accede a páginas cuando un usuario solicita información en tiempo real (por ejemplo, al hacer clic en un enlace desde ChatGPT). Bloquear el primero evita que usen tu contenido para entrenamiento, pero bloquear los otros dos puede reducir la visibilidad de tu sitio en respuestas de IA.

¿El Generador de robots.txt para rastreadores de IA realmente detiene el scraping de IA?

No del todo. El archivo robots.txt es una solicitud educada, no una barrera técnica. Algunos rastreadores lo ignoran o lo respetan solo parcialmente. Para mayor protección, combina este método con reglas en tu servidor o CDN, como las que ofrece el generador de claves de autenticación para bots.

¿Puedo bloquear rastreadores de IA solo en una carpeta específica de mi sitio?

Sí. En el generador, cambia la ruta de bloqueo predeterminada (/) por la carpeta que quieras proteger (por ejemplo, /borradores/). Todos los bots bloqueados respetarán esa regla. Esto es útil para ocultar contenido en desarrollo o privado sin afectar el resto del sitio.

¿Qué son las señales de contenido (Content-Signal) y por qué aparecen en el robots.txt?

Las señales de contenido son directivas como search, ai-input y ai-train que indican cómo prefieres que se use tu contenido: para búsquedas, como entrada de IA o para entrenamiento de modelos. El generador las incluye en el grupo User-agent: * para que los rastreadores que las reconozcan (como los de Cloudflare) las apliquen. También puedes añadir un comentario con la reserva de derechos bajo el Artículo 4 de la Directiva Europea 2019/790.

¿Bloquear Google-Extended afecta a mi posicionamiento en Google Search?

No. Google-Extended controla el uso de tu contenido para entrenar modelos como Gemini, pero no afecta al rastreo de Googlebot ni a tu posicionamiento en Google Search. Si quieres bloquear solo el entrenamiento de IA sin perder visibilidad en búsquedas tradicionales, este es el ajuste ideal.

¿Por qué no aparecen las líneas de Sitemap y llms.txt en el archivo generado?

El generador no incluye estas líneas automáticamente porque necesitan una URL válida de tu sitio (por ejemplo, Sitemap: https://tudominio.com/sitemap.xml). Si quieres añadirlas, introduce tu dominio en el campo correspondiente antes de generar el archivo. La línea de llms.txt es solo un comentario que apunta a ese archivo, no una directiva oficial de robots.txt.

¿Puedo añadir un bot que no está en la lista del generador?

No directamente desde el generador. Si necesitas bloquear un agente de IA que no aparece en la lista, descarga el archivo generado y edítalo manualmente para añadir la línea User-agent: [nombre-del-bot] seguida de Disallow: /. Asegúrate de usar el nombre exacto del bot (por ejemplo, User-agent: FacebookBot). Para verificar que funciona, usa el probador de robots.txt.

¿Qué ajuste predefinido debo elegir si quiero que mi sitio aparezca en respuestas de IA pero no sea usado para entrenar modelos?

Elige el ajuste predeterminado «solo rastreadores de entrenamiento». Este bloquea a los bots que recopilan datos para entrenar modelos (como GPTBot o CCBot), pero permite que los rastreadores de búsqueda de IA (como OAI-SearchBot) y los agentes de usuario (como ChatGPT-User) accedan a tu contenido. Así mantienes visibilidad en respuestas de IA sin contribuir a su entrenamiento.