Choisir la langue

Vérifiez les règles de votre fichier robots.txt avant publication

Collez votre robots.txt et testez si un crawler (Googlebot, GPTBot, etc.) peut accéder à vos URLs. Analyse des règles, détection des erreurs, export.

Testeur de robots.txtFonctionnement ↓
Collez le fichier tel qu'il est servi à /robots.txt. Évalué dans votre navigateur, rien n'est téléchargé ou envoyé.
Un jeton de produit comme Googlebot, GPTBot ou ClaudeBot, ou une chaîne User-Agent complète
Une par ligne. Les URLs complètes sont réduites à leur chemin et requête.

Respecte la norme RFC 9309, y compris les caractères * (joker) et $ (ancre de fin) : le groupe propre au crawler l'emporte sur le groupe *, la règle la plus longue correspondante est prioritaire, et en cas d'égalité, c'est Allow qui s'applique. Les crawlers réels peuvent toutefois différer sur certains cas particuliers.

Mehmet Demiray Publié Mis à jour
Partager

Comment fonctionne la correspondance des règles dans robots.txt ?

Le fichier robots.txt repose sur un système de groupes définis par des lignes User-agent. Chaque groupe cible un ou plusieurs robots d'exploration (crawlers) et contient des directives Allow ou Disallow qui déterminent quelles parties d'un site sont accessibles. Lorsqu'un crawler comme Googlebot analyse ce fichier, il commence par identifier le groupe qui lui est spécifiquement destiné. Par exemple, si le fichier contient une ligne User-agent: Googlebot, ce groupe sera prioritaire pour ce robot. Si aucun groupe spécifique n'est trouvé, le crawler se rabat sur le groupe générique User-agent: *, qui s'applique à tous les robots.

Un point crucial à comprendre est qu'un groupe spécifique remplace entièrement le groupe * plutôt que de s'y ajouter. Ainsi, si un fichier robots.txt contient à la fois un groupe pour Googlebot et un groupe pour *, Googlebot ignorera les règles du groupe * et n'appliquera que celles de son propre groupe. Cette logique évite les conflits et garantit que les règles spécifiques priment toujours sur les règles générales. Par exemple, si le groupe * interdit l'accès à /admin/ mais que le groupe Googlebot l'autorise, Googlebot pourra accéder à ce chemin.

Pour les robots dont le nom contient un suffixe, comme Googlebot-Image, le système applique une règle de repli vers le parent. Ainsi, Googlebot-Image utilisera les règles du groupe Googlebot si aucun groupe spécifique n'est défini pour lui. Cette approche simplifie la gestion des fichiers robots.txt, surtout pour les sites qui souhaitent appliquer des règles similaires à plusieurs variantes d'un même crawler.

Le générateur de règles pour robots.txt peut vous aider à structurer ces groupes de manière optimale avant de les tester avec le Testeur de robots.txt.

La règle du « plus long motif gagnant » expliquée simplement

Dans un fichier robots.txt, la priorité entre les directives Allow et Disallow ne dépend pas de leur ordre d'apparition, mais de la longueur du motif qui correspond à l'URL testée. C'est ce qu'on appelle la règle du « plus long motif gagnant ». Par exemple, si vous avez les règles suivantes :

Disallow: /blog/
Allow: /blog/actualites/

Une URL comme https://exemple.fr/blog/actualites/ sera autorisée, car le motif /blog/actualites/ est plus long et donc plus spécifique que /blog/. En cas d'égalité entre un Allow et un Disallow (par exemple, deux motifs de même longueur), c'est la directive Allow qui l'emporte.

Les caractères spéciaux * et $ jouent également un rôle clé dans cette logique. Le caractère * agit comme un joker et peut remplacer n'importe quelle séquence de caractères. Par exemple, Disallow: /*.pdf bloquera tous les fichiers PDF, quel que soit leur emplacement. Le caractère $, quant à lui, indique la fin d'une URL. Ainsi, Disallow: /*.pdf$ bloquera uniquement les URLs se terminant par .pdf, mais pas celles qui contiennent .pdf ailleurs dans leur chemin.

Un cas particulier à noter : si aucune règle ne correspond à une URL, celle-ci est considérée comme autorisée par défaut. Par exemple, si votre fichier robots.txt ne contient aucune directive pour /contact/, ce chemin sera accessible à tous les crawlers. Cette règle garantit que les sites ne sont pas bloqués par inadvertance en l'absence de directives explicites.

Pour vérifier l'application de ces règles, le Testeur de robots.txt affiche non seulement le verdict (autorisé ou bloqué) pour chaque URL, mais aussi la règle qui a déterminé ce résultat, ainsi que le numéro de ligne concerné dans le fichier.

Comment tester l'accès des crawlers d'IA comme GPTBot ou ClaudeBot ?

Avec l'essor des modèles d'intelligence artificielle, de plus en plus de crawlers spécialisés parcourent le web pour alimenter leurs bases de données. Des agents comme GPTBot (OpenAI), ClaudeBot (Anthropic) ou Google-Extended (Google) sont désormais courants dans les fichiers robots.txt. Le Testeur de robots.txt permet de vérifier précisément quelles parties de votre site sont accessibles à ces robots, en simulant leur comportement selon les règles que vous avez définies.

Pour tester l'accès d'un crawler d'IA, il suffit de coller le contenu de votre fichier robots.txt dans l'outil, de sélectionner le token du crawler (par exemple, GPTBot) et d'entrer les URLs ou chemins que vous souhaitez vérifier. L'outil affichera alors un verdict clair pour chaque URL, indiquant si elle est autorisée ou bloquée, ainsi que la règle qui a déterminé ce résultat. Par exemple, si vous avez une directive Disallow: /archives/ dans le groupe GPTBot, l'outil confirmera que ce chemin est bien inaccessible pour ce robot.

Un élément important à surveiller est la ligne Content-Signal, qui permet d'indiquer l'usage prévu des données collectées. Cette ligne peut prendre trois valeurs : search (pour les moteurs de recherche classiques), ai-input (pour l'entraînement des modèles d'IA) ou ai-train (pour une utilisation plus large dans les systèmes d'IA). Bien que cette directive ne bloque pas techniquement l'accès, elle fournit une indication claire aux crawlers sur vos préférences. Le Testeur de robots.txt signale cette ligne dans ses résultats, mais ne l'interprète pas comme une règle de blocage.

Pour les éditeurs qui souhaitent contrôler finement l'accès des crawlers d'IA, le générateur de règles pour robots.txt permet de créer des directives adaptées avant de les tester avec l'outil. Cela évite les erreurs de syntaxe et garantit que les règles sont correctement appliquées.

Les erreurs courantes dans un fichier robots.txt et comment les éviter

Un fichier robots.txt mal rédigé peut entraîner des problèmes d'indexation ou, pire, bloquer involontairement l'accès à des parties importantes de votre site. Voici quelques erreurs fréquentes que le Testeur de robots.txt peut vous aider à détecter et à corriger.

  1. Des règles avant la première ligne User-agent : Toutes les directives Allow ou Disallow doivent être placées après une ligne User-agent. Si une règle apparaît avant, elle sera ignorée par les crawlers, et l'outil affichera un avertissement.
  1. Des chemins qui ne commencent pas par / : Une directive comme Disallow: blog/ est invalide, car les chemins doivent toujours commencer par une barre oblique (Disallow: /blog/). Cette erreur est fréquente et peut rendre une règle inefficace.
  1. L'utilisation de Crawl-delay : Bien que cette directive soit parfois utilisée pour limiter la fréquence de crawl, elle n'est pas reconnue par Google et peut être ignorée par d'autres crawlers. Le Testeur de robots.txt la signalera comme une directive non standard.
  1. Les directives spécifiques à certains moteurs : Des extensions comme Host (pour Yandex) ou Clean-param (pour nettoyer les paramètres d'URL) ne sont pas universelles. Si vous les utilisez, l'outil les signalera comme des directives propres à certains crawlers, ce qui peut ne pas être votre intention.
  1. La confusion entre blocage et non-indexation : Beaucoup pensent qu'une directive Disallow dans robots.txt empêche une page d'apparaître dans les résultats de recherche. En réalité, robots.txt contrôle uniquement le crawl, pas l'indexation. Une page bloquée peut toujours être indexée si elle est liée depuis d'autres sites. Pour éviter l'indexation, il faut utiliser la balise <meta name="robots" content="noindex"> ou l'en-tête HTTP X-Robots-Tag.
  1. Les chemins sensibles à la casse : Les URLs /Contact/ et /contact/ peuvent être traitées différemment selon les serveurs. Il est donc recommandé d'utiliser une casse cohérente dans vos règles pour éviter les surprises.

En utilisant le Testeur de robots.txt avant de déployer votre fichier, vous pouvez identifier ces erreurs et les corriger rapidement, sans risquer d'affecter le référencement de votre site.

Ce que le Testeur de robots.txt ne fait pas (et pourquoi c'est important)

Le Testeur de robots.txt est un outil puissant pour simuler le comportement des crawlers, mais il présente certaines limites qu'il est essentiel de comprendre pour l'utiliser efficacement.

Tout d'abord, l'outil ne récupère pas automatiquement le fichier robots.txt de votre site. Vous devez copier-coller manuellement son contenu dans l'interface. Cela signifie que vous pouvez tester des versions en cours de rédaction ou des fichiers privés sans les publier. Cependant, cela implique aussi que l'outil ne vérifie pas si le fichier est accessible en ligne ou s'il contient des erreurs de syntaxe liées à son encodage.

Ensuite, le Testeur de robots.txt ne vérifie pas l'état d'indexation des URLs. Il se concentre uniquement sur la conformité des règles de crawl, sans indiquer si une page est effectivement indexée par les moteurs de recherche. Pour obtenir cette information, il faut utiliser des outils comme Google Search Console ou Bing Webmaster Tools.

Une autre limite concerne le traitement des URLs. L'outil réduit les URLs complètes à leur chemin et leur chaîne de requête, en ignorant le domaine. Par exemple, https://exemple.fr/blog/article sera traité comme /blog/article. Cela simplifie les tests, mais ne permet pas de vérifier des règles spécifiques à un sous-domaine.

De plus, l'outil ne normalise pas les encodages de caractères. Si votre fichier robots.txt contient des chemins avec des caractères spéciaux (comme des espaces encodés en %20), ceux-ci doivent être saisis tels quels dans l'outil. Il ne les convertit pas automatiquement, ce qui peut entraîner des différences entre les résultats du test et le comportement réel des crawlers.

Enfin, bien que le Testeur de robots.txt suive la norme RFC 9309 et les extensions courantes comme * et $, certains crawlers peuvent interpréter les règles différemment dans des cas particuliers. Par exemple, certains robots peuvent ignorer les directives Allow ou appliquer des règles de priorité légèrement différentes. L'outil fournit donc une simulation fidèle, mais pas une garantie absolue du comportement de tous les crawlers.

Malgré ces limites, le Testeur de robots.txt reste un outil précieux pour les développeurs et les référenceurs, car il permet de tester rapidement et gratuitement des règles avant leur déploiement, sans nécessiter de compte ou de site en ligne.

Pourquoi tester son robots.txt avant de le déployer ?

Déployer un fichier robots.txt sans l'avoir testé au préalable peut avoir des conséquences imprévues sur le référencement de votre site. Par exemple, une simple erreur de syntaxe ou une règle mal placée peut bloquer l'accès à des pages importantes, réduisant ainsi leur visibilité dans les résultats de recherche. Le Testeur de robots.txt permet d'éviter ces pièges en offrant une simulation précise du comportement des crawlers avant toute mise en ligne.

Un des principaux avantages de cet outil est sa capacité à travailler sur des versions en cours de rédaction. Vous n'avez pas besoin d'uploader le fichier sur votre serveur pour le tester : il suffit de coller son contenu dans l'interface. Cela est particulièrement utile pour les sites en développement ou les refontes, où les règles peuvent évoluer fréquemment. Par exemple, si vous ajoutez une nouvelle section à votre site et que vous souhaitez vérifier que les crawlers d'IA comme GPTBot y ont accès, vous pouvez tester cette configuration en quelques secondes.

L'outil fournit également des informations détaillées sur les règles appliquées. Pour chaque URL testée, il indique non seulement si elle est autorisée ou bloquée, mais aussi quelle directive a déterminé ce résultat et à quelle ligne du fichier elle se trouve. Cela permet d'identifier rapidement les règles problématiques et de les corriger. Par exemple, si une page importante est bloquée par erreur, vous saurez immédiatement quelle ligne du fichier robots.txt est responsable.

Un autre atout du Testeur de robots.txt est sa capacité à gérer plusieurs crawlers simultanément. Vous pouvez tester l'accès de Googlebot, Bingbot et ClaudeBot en une seule opération, ce qui est particulièrement utile pour les sites qui souhaitent appliquer des règles différentes selon les robots. Par exemple, vous pourriez autoriser l'accès à /blog/ pour les moteurs de recherche classiques, mais le bloquer pour les crawlers d'IA.

Enfin, l'outil est entièrement gratuit et ne nécessite aucune inscription. Contrairement à d'autres solutions qui imposent la création d'un compte ou l'ajout d'un site en ligne, le Testeur de robots.txt fonctionne directement dans votre navigateur, sans aucune contrainte. Cela en fait un outil accessible à tous, des développeurs aux propriétaires de sites, en passant par les référenceurs.

Pour aller plus loin, vous pouvez utiliser le générateur de règles pour robots.txt pour créer des directives adaptées à vos besoins, puis les tester avec cet outil avant de les déployer en production.

Comment interpréter les résultats du Testeur de robots.txt ?

Lorsque vous utilisez le Testeur de robots.txt, l'outil génère un rapport détaillé pour chaque URL testée. Comprendre ces résultats est essentiel pour ajuster vos règles et garantir que votre fichier robots.txt fonctionne comme prévu.

Pour chaque URL, le rapport affiche d'abord un verdict clair : « Autorisé » ou « Bloqué ». Ce verdict est accompagné de la règle qui a déterminé ce résultat. Par exemple, si une URL est bloquée, l'outil indiquera quelque chose comme : Bloqué par Disallow: /private/ (ligne [number=12]). Cela vous permet d'identifier immédiatement la source du problème et de la corriger si nécessaire.

Le rapport précise également le groupe de règles appliqué. Par exemple, si vous testez avec Googlebot, l'outil indiquera si les règles proviennent du groupe Googlebot ou du groupe générique *. Cela est particulièrement utile pour vérifier que les règles spécifiques priment bien sur les règles générales, comme le prévoit la norme RFC 9309.

Un autre élément important est la valeur Content-Signal associée au groupe appliqué. Cette ligne, bien que non bloquante, indique l'usage prévu des données collectées. Par exemple, si le groupe contient Content-Signal: ai-input, cela signifie que les données peuvent être utilisées pour l'entraînement des modèles d'IA. Le Testeur de robots.txt signale cette valeur, mais ne l'interprète pas comme une règle de blocage.

Le rapport inclut également les lignes Sitemap trouvées dans le fichier robots.txt. Bien que ces lignes n'affectent pas directement les règles de crawl, elles sont utiles pour vérifier que les sitemaps sont correctement référencées.

Enfin, l'outil affiche des avertissements pour les éléments non conformes à la norme RFC 9309. Par exemple, si votre fichier contient des directives comme Crawl-delay ou Host, qui ne sont pas universellement reconnues, le Testeur de robots.txt les signalera. De même, il détectera les chemins relatifs (qui ne commencent pas par /) ou les règles placées avant la première ligne User-agent. Ces avertissements vous aident à corriger les erreurs avant de déployer votre fichier.

Pour exporter ces résultats, vous pouvez utiliser les options de téléchargement proposées par l'outil : un fichier CSV pour une analyse approfondie ou une image pour un partage rapide. Cela est particulièrement utile pour documenter vos tests ou pour collaborer avec d'autres membres de votre équipe.

Celles que nous répondons le plus souvent.

Comment vérifier si une URL est bloquée par mon fichier robots.txt avec le Testeur de robots.txt ?

Copiez-collez le contenu de votre fichier robots.txt dans l’outil, indiquez le nom du crawler (par exemple, Googlebot ou GPTBot) et listez les URLs ou chemins à tester, un par ligne. Le Testeur de robots.txt affiche pour chaque URL si elle est autorisée ou bloquée, avec la règle décisive et son numéro de ligne. Aucun téléchargement ni compte n’est nécessaire : tout se fait directement dans votre navigateur.

Pourquoi le Testeur de robots.txt signale-t-il une erreur pour *Crawl-delay* ?

La directive Crawl-delay n’est pas reconnue par la norme RFC 9309 et est ignorée par des moteurs comme Google. Bien que certains crawlers (comme Bing ou Yandex) l’utilisent pour limiter la fréquence de visite, elle peut fausser vos tests si vous ciblez principalement les résultats de recherche francophones, où Google domine. L’outil la signale pour éviter des malentendus.

Mon crawler (ex. *ClaudeBot*) n’apparaît pas dans mon robots.txt. Que se passe-t-il ?

Si le crawler n’est pas explicitement mentionné, l’outil applique les règles du groupe (s’il existe). Sans groupe , toutes les URLs sont considérées comme autorisées. Par exemple, si votre fichier ne contient que User-agent: Googlebot, ClaudeBot aura accès à tout le site. Pour bloquer spécifiquement les crawlers d’IA, utilisez le générateur de règles pour robots.txt avant de tester.

Pourquoi une URL bloquée dans robots.txt peut-elle encore apparaître dans les résultats de recherche ?

Le fichier robots.txt contrôle uniquement le crawling (l’accès des robots), pas l’indexation. Une URL bloquée peut être indexée si elle est référencée par d’autres sites (via des liens, par exemple). Pour supprimer une page des résultats, utilisez plutôt une balise noindex ou une authentification via le générateur de clés d’authentification pour bots.

Comment interpréter la ligne *Content-Signal* dans les résultats du Testeur de robots.txt ?

La directive Content-Signal (ex. search, ai-input, ai-train) indique l’usage prévu des données par le crawler, mais elle n’a pas d’effet technique bloquant. Par exemple, ai-train signifie que le contenu pourrait être utilisé pour entraîner des modèles d’IA. L’outil la signale pour vous aider à prendre des décisions éclairées, notamment si vous gérez un site francophone sensible au respect du RGPD.

Puis-je tester un fichier robots.txt avant de le mettre en ligne ?

Oui, le Testeur de robots.txt fonctionne avec n’importe quel texte collé, même un brouillon. Vous pouvez ainsi valider vos règles avant de les déployer sur votre serveur, sans risquer d’affecter votre référencement. C’est particulièrement utile pour les sites e-commerce ou médias francophones, où une erreur dans robots.txt peut bloquer l’accès aux fiches produits ou aux articles.

Que signifie *le plus long motif l’emporte* dans les règles de robots.txt ?

Lorsqu’une URL correspond à plusieurs règles (Allow et Disallow), c’est la règle avec le motif le plus long qui s’applique. Par exemple, Disallow: /blog/ bloque /blog/article, mais Allow: /blog/actualites autorise /blog/actualites/2024. En cas d’égalité, Allow prime. Les caractères * (joker) et $ (fin de chaîne) sont pris en compte pour calculer la longueur du motif.

En quoi le Testeur de robots.txt diffère-t-il de l’outil de Google Search Console ?

Google Search Console vérifie le fichier robots.txt en ligne de votre site et signale les erreurs de téléchargement, tandis que le Testeur de robots.txt analyse un texte hors ligne (copié-collé) et simule le comportement de n’importe quel crawler (y compris les bots d’IA comme GPTBot). Il est donc idéal pour tester des modifications avant leur mise en production, sans attendre l’indexation par Google.

Pourquoi l’outil signale-t-il des chemins relatifs comme une erreur ?

Les chemins dans robots.txt doivent toujours commencer par un slash (/) pour être valides selon la norme RFC 9309. Un chemin comme blog/article sera ignoré par les crawlers, ce qui peut entraîner des accès non désirés. L’outil signale ces erreurs pour éviter des problèmes de sécurité, notamment sur les sites multilingues où les chemins peuvent contenir des caractères spéciaux (ex. é, ç).