Taal kiezen

Robots.txt Tester en URL-validator

Test robots.txt-regels per crawler volgens RFC 9309. Controleer URL-toegang voor Googlebot of AI-bots en ontdek direct welke regel blokkeert.

Robots.txt-testerHoe het werkt ↓
Plak het bestand zoals aangeboden op /robots.txt. Wordt lokaal in uw browser verwerkt; er wordt niets geüpload.
Een producttoken zoals Googlebot, GPTBot of ClaudeBot, of een volledige User-Agent-string
Eén per regel. Volledige URL's worden ingekort tot hun pad en query.

Volgt RFC 9309, inclusief het * jokerteken en het $ eindteken: de eigen groep van de crawler krijgt voorrang op de *-groep, de langst overeenkomende regel wint en bij een gelijke stand geldt Allow. Echte crawlers kunnen in uitzonderingsgevallen afwijken.

Mehmet Demiray Gepubliceerd Bijgewerkt
Delen

Hoe de matching van robots.txt werkt

Het robots.txt-bestand vormt de standaardmethode waarmee websites communiceren met geautomatiseerde webcrawlers. Volgens de officiële internetstandaard RFC 9309 is een robots.txt opgebouwd uit groepen van regels. Elke groep begint met een of meerdere User-agent-regels, gevolgd door richtlijnen zoals Allow en Disallow.

Wanneer een zoekmachinebot of AI-crawler uw website bezoekt, zoekt de bot eerst naar de groep die specifiek op zijn eigen naam is gericht. Een crawler volgt hierbij een strikte volgorde:

  1. De bot zoekt een groep met zijn exacte naam (zoals User-agent: Googlebot).
  2. Wordt die niet gevonden, dan zoekt een gespecialiseerde bot naar de hoofdgroep via het woord voor het koppelteken (zoals Googlebot voor Googlebot-Image).
  3. Is er geen specifieke groep aanwezig, dan valt de bot terug op de algemene groep User-agent: *.

Een cruciaal principe in RFC 9309 is dat een specifieke groep de algemene wildcardgroep volledig vervangt. Als een robots.txt-bestand zowel regels voor * als voor Googlebot bevat, leest Googlebot uitsluitend de regels in zijn eigen sectie. De regels uit de *-groep worden in dat geval volledig genegeerd en niet samengevoegd. De Robots.txt-tester simuleert deze toewijzing exact zoals crawlers dat doen, zodat u direct ziet welke groep van toepassing is.

De langste regel wint: prioriteit en syntax

Wanneer binnen een groep meerdere regels van toepassing zijn op dezelfde URL, bepaalt de lengte van het patroon welke instructie voorrang krijgt. Het mechanisme werkt volgens het principe dat de meest specifieke regel, oftewel het langste pad in tekens, altijd wint.

Regel in robots.txt Opgevraagde URL Resultaat Reden
Disallow: /producten/ /producten/schoenen Geblokkeerd Pad valt onder Disallow
Allow: /producten/schoenen /producten/schoenen Toegestaan Allow-regel bevat meer tekens dan Disallow
Disallow: /doc/ en Allow: /doc/ /doc/handleiding.pdf Toegestaan Bij gelijke lengte wint Allow
Disallow: (leeg) /willekeurig-pad Toegestaan Een lege Disallow heft alle blokkades op

Naast vaste paden ondersteunen moderne crawlers twee speciale tekens: - De asterisk * fungeert als wildcard voor nul of meer willekeurige tekens. - Het dollarteken $ markeert het exacte einde van een URL.

Met de regel Disallow: /*.pdf$ blokkeert u bijvoorbeeld alle bestanden die eindigen op de extensie PDF, terwijl een URL zoals /bestanden/handleiding.pdf?download=1 wel toegankelijk blijft omdat deze niet op het dollarteken eindigt. Als er helemaal geen regel overeenkomt met het opgevraagde pad, is de standaardstatus altijd toegestaan. Met de Robots.txt-tester ziet u per URL direct het winnende regelnummer en het exacte pad dat de beslissing heeft bepaald.

AI-crawlers en Content-Signal testen

Met de opkomst van grote taalmodellen en generatieve AI zetten organisaties steeds vaker specifieke regels op voor crawlers zoals GPTBot, ClaudeBot, Bytespider en Google-Extended. Deze bots verzamelen trainingsdata of leveren actuele webresultaten aan chatinterfaces.

U kunt AI-crawlers individueel beheren door aparte blokken aan te maken in uw configuratie. Als u snel een complete set regels wilt opstellen voor diverse AI-bots, kunt u gebruikmaken van de robots.txt-generator voor AI-crawlers. Vervolgens plakt u het resultaat in de Robots.txt-tester om te controleren of de paden correct worden afgeschermd.

Daarnaast verschijnt in moderne robots.txt-bestanden steeds vaker de experimentele richtlijn Content-Signal. Deze richtlijn definieert gebruiksrechten voor content: - search: Geeft toestemming voor indexering ten behoeve van traditionele zoekresultaten. - ai-input: Geeft aan dat inhoud mag worden gebruikt als context voor antwoorden. - ai-train: Geeft aan of data gebruikt mag worden voor het trainen van modellen.

De Robots.txt-tester leest deze Content-Signal-waarden uit en toont ze in het resultatenoverzicht. Houd er rekening mee dat Content-Signal een signaal over gebruiksrecht is en geen technisch toegangsblokkade zoals Disallow.

Veelgemaakte fouten in robots.txt

Een kleine typefout in robots.txt kan ertoe leiden dat zoekmachines onbedoeld belangrijke delen van een website overslaan of juist afgeschermde paden indexeren. De parser van de Robots.txt-tester controleert uw invoer op de meest voorkomende syntaxfouten:

  • Richtlijnen vóór de eerste User-agent: Regels zoals Disallow: /admin/ die helemaal bovenaan het bestand staan zonder voorafgaande User-agent zijn ongeldig volgens RFC 9309.
  • Paden zonder slash aan het begin: Een regel zoals Disallow: beheer is ongeldig. Een pad moet altijd beginnen met een schuine streep, zoals Disallow: /beheer.
  • Gebruik van Crawl-delay: De richtlijn Crawl-delay maakt geen deel uit van de RFC-standaard. Grote zoekmachines zoals Google negeren deze instructie volledig.
  • Platformspecifieke directives: Richtlijnen zoals Host of Clean-param worden uitsluitend door specifieke zoekmachines ondersteund en veroorzaken waarschuwingen in algemene validators.
  • Noindex in robots.txt: Zoekmachines ondersteunen de instructie Noindex: binnen robots.txt al jaren niet meer. Indexering voorkomt u uitsluitend via HTTP-headers of meta-tags op de pagina zelf.
  • Hoofdlettergevoeligheid: Paden in robots.txt zijn strikt hoofdlettergevoelig. De regel Disallow: /nieuws/ blokkeert /Nieuws/ niet.

Een belangrijk misverstand is het verschil tussen crawlen en indexeren. Een geblokkeerde URL via Disallow kan alsnog in zoekresultaten verschijnen als er externe links naar verwijzen, al kan de crawler de pagina-inhoud zelf niet lezen.

De reikwijdte van de Robots.txt-tester

De Robots.txt-tester voert alle controles lokaal in uw webbrowser uit. De tool haalt geen bestanden live op van een server en stuurt uw ingevoerde regels niet door naar externe systemen. Hierdoor kunt u conceptbestanden, ontwikkelomgevingen en gevoelige URL-structuren veilig testen voordat u deze op de productieserver publiceert.

Om de werking van de tool goed te begrijpen, is het nuttig om te weten wat buiten de scope valt:

  • Geen indexeringsstatus: De tester controleert uitsluitend of een crawler het pad mag ophalen volgens de regels van het bestand, niet of de pagina daadwerkelijk is geïndexeerd in zoekmachines.
  • Geen live HTTP-status: De tool controleert niet of de opgegeven URL's bestaan (404) of redirects bevatten (301).
  • Geen bot-identiteitscontrole: Een robots.txt kan niet controleren of een bezoeker die zich voordoet als Googlebot ook echt van Google is. Voor het verifiëren van bot-identiteit gebruikt u cryptografische technieken zoals een verificatiesleutel-generator voor webbots.

Als u naast regels voor zoekmachines ook gestructureerde documentatie voor AI-assistenten wilt aanbieden, kunt u een bestand opstellen met de llms.txt-generator. De Robots.txt-tester helpt u vervolgens controleren of uw robots.txt de toegang tot die bestanden correct toestaat.

De vragen die we het vaakst beantwoorden.

Hoe test ik of een URL wordt geblokkeerd door robots.txt?

Plak de inhoud van je robots.txt in het tekstvak van de Robots.txt-tester, vul de gewenste crawler in (zoals Googlebot of GPTBot) en voer de paden of volledige URL's in. De tool controleert direct per regel of toegang is toegestaan of geblokkeerd en toont het exacte regelnummer dat de beslissing bepaalt.

Wat gebeurt er wanneer zowel een Allow- als een Disallow-regel overeenkomt?

Volgens de RFC 9309-standaard wint de meest specifieke regel, wat neerkomt op het langste overeenkomende padpatroon. Wanneer een Allow- en een Disallow-instructie exact even lang zijn, geeft de parser voorrang aan Allow en mag de crawler de pagina ophalen.

Wat is het verschil tussen deze tool en het robots.txt-rapport in Google Search Console?

Google Search Console controleert uitsluitend het live gepubliceerde robots.txt-bestand op je geverifieerde domein voor Googlebot. Met de Robots.txt-tester kun je conceptbestanden vooraf lokaal testen voor elke gewenste bot, inclusief AI-crawlers, zonder dat je een account nodig hebt of een live website hoeft te koppelen.

Verdwijnt een pagina uit de zoekresultaten als ik deze blokkeer in robots.txt?

Nee, robots.txt beheert uitsluitend het crawlen en niet het indexeren. Wanneer externe websites naar een geblokkeerde URL linken, kan Google de pagina alsnog opnemen in de zoekresultaten zonder de inhoud te lezen. Gebruik een noindex-metatag of HTTP-header wanneer je indexatie volledig wilt voorkomen.

Hoe controleer ik regels voor AI-bots zoals GPTBot of ClaudeBot?

Voer de specifieke botnaam in als crawler in de Robots.txt-tester. Als je regels hebt opgesteld met een AI-crawlers robots.txt-generator, toont de tester direct of de bot onder zijn eigen groep valt of terugvalt op de algemene wildcard. Ook eventuele Content-Signal-richtlijnen voor AI-gebruik worden direct uitgelezen.

Waarom gebruikt Googlebot-Image de regels van Googlebot als er geen aparte groep is?

Specifieke crawlers met een samengestelde naam vallen terug op hun hoofdtoken wanneer er geen afzonderlijk blok voor hen bestaat. Als een bestand geen specifieke regels bevat voor Googlebot-Image, controleert de crawler eerst de instructies voor Googlebot voordat deze teruggrijpt op de algemene regels onder de ster.

Waarom geeft de tester een waarschuwing bij de richtlijn Crawl-delay?

De richtlijn Crawl-delay maakt geen deel uit van de officiële RFC 9309-standaard. Hoewel sommige zoekmachines zoals Bing deze optie ondersteunen, negeert Googlebot deze instructie volledig. De tool markeert dit als een waarschuwing zodat je weet dat niet elke crawler hier rekening mee houdt.

Wordt mijn ingevoerde robots.txt-bestand opgeslagen op een externe server?

Nee, de Robots.txt-tester voert alle controles en evaluaties lokaal uit in je webbrowser. Er worden geen URL's of bestandsgegevens naar een server verzonden, waardoor vertrouwelijke concepten en interne sitestructuuroverzichten privé blijven op je eigen apparaat.