Taal kiezen

AI Robots.txt Generator voor Crawlers en Bots

Beheer AI-crawlers zoals GPTBot en ClaudeBot met aangepaste Content-Signal regels, specifieke user-agents en kant-en-klare presets voor robots.txt.

AI Robots.txt GeneratorHoe het werkt ↓
De pagina indexeren en links tonen met korte fragmenten
De pagina gebruiken als bronmateriaal voor gegenereerde antwoorden
De pagina gebruiken om AI-modellen te trainen of te verfijnen
Cloudflare-extensie: hoe ver een bot mag gaan met opgehaalde inhoud
De juridische formulering die de signalen geldigheid geeft onder EU-auteursrechtregels
Het blokkeren hiervan heeft geen invloed op uw zichtbaarheid in zoekmachines
Het blokkeren hiervan verwijdert u uit AI-zoekantwoorden en bronvermeldingen
Het blokkeren hiervan zorgt dat assistenten uw pagina's niet op verzoek kunnen openen
Agents die namens een gebruiker klikken en formulieren invullen
Gebruik / voor de hele site of een map zoals /artikelen/
Alleen nodig voor Sitemap- en llms.txt-verwijzingen
Toegevoegd als opmerking; robots.txt heeft geen llms.txt-instructie

robots.txt en Content-Signal geven voorkeuren aan; ze blokkeren uit zichzelf niets. Nette crawlers respecteren ze, andere negeren ze, en Google heeft aangegeven niets te doen met Content-Signal. Gebruik botregels op serverniveau als afdwinging vereist is.

Mehmet Demiray Gepubliceerd Bijgewerkt
Delen

Vier soorten AI-bots en hun invloed op uw website

Niet elke AI-crawler bezoekt uw website met hetzelfde doel. In het huidige webevolutiemodel opereren meer dan 50 verschillende AI-agents, die grofweg onderverdeeld worden in vier functionele rollen.

  1. Trainingsdatacrawlers: Deze bots verzamelen grote hoeveelheden tekst en media om nieuwe AI-modellen te trainen. Voorbeelden zijn GPTBot van OpenAI, ClaudeBot van Anthropic en CCBot van Common Crawl. De verzamelde inhoud wordt permanent verwerkt in de modelgewichten, meestal zonder directe bronvermelding of doorklikverkeer naar uw website.
  1. AI-zoekmachine-indexeerders: Bots zoals OAI-SearchBot indexeren webpagina's specifiek om actuele antwoorden en samenvattingen te tonen in zoekomgevingen. Wanneer een gebruiker een vraag stelt aan een AI-zoekmachine, genereert het systeem een antwoord met klikbare bronverwijzingen naar de geanalyseerde pagina's.
  1. Gebruikersgestuurde ophaalrobots: Een bot zoals ChatGPT-User treedt uitsluitend in werking wanneer een eindgebruiker een specifieke webkoppeling in een conversatie plakt en vraagt om die pagina samen te vatten of te analyseren. Deze bot crawlt de website niet autonoom op grote schaal.
  1. Autonome webagents: Deze softwareprogramma's voeren gerichte taken uit namens een gebruiker, zoals het controleren van productprijzen of het vergelijken van dienstverlening op verschillende pagina's.

Het uitsluiten van alle AI-verkeer stopt dataverzameling voor modeltraining, maar ontneemt uw platform tegelijkertijd zichtbaarheid in moderne zoeksystemen. De AI Robots.txt Generator helpt bij het instellen van gerichte regels per botcategorie.

Hoe het gegenereerde robots.txt-bestand is opgebouwd

Het robots.txt-protocol berust op eenvoudige tekstregels die zoekmachines en crawlers vertellen welke paden toegankelijk zijn. De AI Robots.txt Generator combineert moderne standaarden met traditionele user-agent-blokkades in een heldere directorystructuur.

Het gegenereerde bestand start met een algemene wildcardgroep onder User-agent: *. Binnen deze groep wordt de toegang tot openbare paden geopend met Allow: /, aangevuld met een Content-Signal-regel. Deze regel geeft programmatisch aan hoe geautomatiseerde systemen mogen omgaan met uw inhoud voor zoekdoeleinden en modeltraining.

Vervolgens maakt de generator voor elke crawler die u wilt beperken een afzonderlijke regelgroep aan. Elke groep bestaat uit twee regels:

User-agent: GPTBot Disallow: /

Wanneer u ervoor kiest om alleen bepaalde mappen af te schermen, past de tool het ingestelde pad, bijvoorbeeld /privedata/, uniform toe op alle geselecteerde bots. Aan het einde van het bestand kan de generator optioneel een verwijzing naar uw Sitemap: toevoegen, evenals een commentaarregel die verwijst naar een eventueel contextbestand voor taalmodellen.

Content Signals en het voorbehoud voor tekst- en datamining

Content Signals is een initiatief van contentsignals.org en Cloudflare om AI-voorkeuren op een compacte manier via één header of robots.txt-regel over te brengen. In plaats van tientallen losse bots handmatig te beheren, definieert een Content-Signal-regel drie kernparameters:

  • search: Geeft toestemming voor indexering ten behoeve van zoekresultaten en citaties.
  • ai-input: Bepaalt of de inhoud als actuele context mag dienen bij gebruikersvragen.
  • ai-train: Bepaalt of de inhoud gebruikt mag worden voor het trainen van nieuwe AI-modellen.

Elke parameter kan de waarde allow of disallow krijgen. Wordt een parameter weggelaten, dan geeft de website-eigenaar geen expliciete voorkeur aan. Cloudflare biedt hierop een uitbreiding via de use-parameter, waarmee beheerders bepalen of een bewerking direct, na bronverwijzing of volledig is toegestaan.

Voor uitgevers in de Europese Unie bevat de AI Robots.txt Generator een optioneel commentaarblok met een formeel voorbehoud. Artikel 4 lid 3 van de Europese Richtlijn 2019/790 (Auteursrechten in de digitale eengemaakte markt) stelt dat tekst- en datamining is toegestaan op openbare online werken, tenzij de rechthebbende dit uitdrukkelijk en in machinaal leesbare vorm heeft voorbehouden. Een gestructureerd commentaarblok in uw robots.txt dient als deze wettelijk erkende verklaring.

Omdat partijen zoals Google publiekelijk hebben aangegeven geen instructies te ontlenen aan Content-Signal, blijft het noodzakelijk om bot-specifieke Disallow-regels te combineren met deze nieuwere standaarden.

De juiste blokkeerstrategie kiezen voor uw website

De keuze welke AI-crawlers u toelaat hangt af van uw bedrijfsmodel, uw publiek en de aard van uw publicaties. De AI Robots.txt Generator biedt verschillende voorinstellingen voor veelvoorkomende situaties.

Strategie Doel Aanbevolen instelling
Zichtbare uitgever Geen AI-training, wel vindbaar via AI-zoekmachines Alleen trainingscrawlers blokkeren
Maximale afscherming Geen enkel geautomatiseerd AI-gebruik toestaan Alle AI-crawlers blokkeren
Alleen signalen Flexibel beheer via headers zonder losse bot-regels Geen bots blokkeren (enkel Content-Signal)
Maatwerk Specifieke platforms weren of bepaalde mappen beschermen Aangepaste selectie

Voor de meeste zakelijke websites, kennisbanken en nieuwsmedia is de standaardinstelling het meest praktisch. Hiermee blokkeert u pure trainingsbots zoals GPTBot, ClaudeBot en CCBot, terwijl zoekbots zoals OAI-SearchBot en interactieve verzoekers zoals ChatGPT-User pagina's kunnen blijven raadplegen. Zo voorkomt u dat uw intellectueel eigendom zonder compensatie in modelgewichten verdwijnt, zonder dat u potentiële bezoekers uit AI-zoekresultaten verliest.

Een belangrijk detail betreft Google-Extended. Deze specifieke user-agent beheert de toegang voor het trainen van Gemini-modellen. Het blokkeren van Google-Extended heeft geen negatieve gevolgen voor uw normale positie in Google Zoeken, omdat de reguliere Googlebot de pagina's voor zoekindexering blijft verwerken.

Beperkingen van robots.txt en effectieve handhaving

Een vermelding in robots.txt is een formele instructie volgens de RFC 9309-standaard, maar vormt geen technische blokkade. Het bestand functioneert als een beleefd verzoek aan webcrawlers.

Grote, erkende technologiebedrijven controleren robots.txt voorafgaand aan het scrapen en respecteren de instructies. Er bestaan echter ook malafide scrapers en minder transparante dataverzamelaars die de regels negeren en zich soms voordoen als reguliere webbrowsers. Bovendien verwijdert een nieuwe Disallow-regel geen data die in het verleden al door een AI-bedrijf is gedownload en verwerkt.

Voor strikte handhaving is een gelaagde beveiliging nodig:

  1. Robots.txt: Dient als eerste formele en juridische barrière voor conforme crawlers.
  2. Web Application Firewall (WAF): Blokkeert IP-adressen en bekende data center-bereiken van agressieve scrapers.
  3. Cryptografische validatie: Bevestig de identiteit van bots met tools zoals een Web Bot Auth Key Generator.

Controleer na het uploaden van uw bestand altijd of er geen syntactische fouten zijn gemaakt die per ongeluk gewone zoekmachines buitensluiten. Gebruik hiervoor een robots.txt tester om de verwerking van specifieke paden en user-agents direct te valideren.

Waarom robots.txt en llms.txt elkaar aanvullen

Naast robots.txt wint een tweede standaard aan populariteit: het llms.txt-bestand. Hoewel beide bestanden zich in de hoofdmap van een website bevinden, vervullen ze tegenovergestelde rollen.

Robots.txt regelt toegangsrechten. Het vertelt crawlers welke bestanden en mappen zij niet mogen bekijken. Het formaat is strikt machineleesbaar en bevat geen contextuele informatie over de inhoud van de website.

Het llms.txt-bestand is juist bedoeld om taalmodellen te helpen de inhoud van een website sneller en beter te begrijpen. Het bevat gestructureerde samenvattingen, links naar documentatie en schone Markdown-teksten zonder opmaakballast zoals navigatiemenu's of advertenties. U kunt een dergelijk bestand samenstellen met een llms.txt generator.

In de AI Robots.txt Generator verschijnt de verwijzing naar llms.txt uitsluitend als een informatieve commentaarregel. De officiële robots.txt-specificatie kent immers geen Llms:-instructie zoals dat voor Sitemap: wel het geval is. Door beide bestanden correct in te richten, behoudt u de controle over wat AI-systemen mogen verzamelen en verbetert u tegelijkertijd de nauwkeurigheid van de antwoorden die toegestane systemen over uw website geven.

De vragen die we het vaakst beantwoorden.

Hoe blokkeer ik AI-crawlers op mijn website met deze generator?

Kies in de AI Robots.txt Generator een voorinstelling, zoals het blokkeren van uitsluitend trainingscrawlers of alle AI-bots. Download vervolgens het bestand en plaats het in de hoofdmap van uw webserver, zodat het bereikbaar is via de URL van uw domein.

Wat is het verschil tussen GPTBot, OAI-SearchBot en ChatGPT-User?

GPTBot verzamelt inhoud voor het trainen van toekomstige taalmodellen van OpenAI. OAI-SearchBot indexeert webpagina's actueel om zoekresultaten en citaten te tonen binnen AI-antwoorden. ChatGPT-User wordt uitsluitend geactiveerd wanneer een bezoeker ChatGPT vraagt om een specifieke webpagina direct te raadplegen.

Heeft het blokkeren van AI-bots invloed op mijn reguliere posities in zoekmachines?

Nee, het blokkeren van trainingscrawlers zoals GPTBot of ClaudeBot heeft geen effect op uw organische posities in Google of Bing. Houd er wel rekening mee dat het blokkeren van AI-zoekcrawlers ertoe kan leiden dat uw pagina's niet meer als bron worden getoond in gegenereerde antwoorden.

Wat doet de Google-Extended user-agent precies?

Google-Extended geeft Google de instructie om uw content niet te gebruiken voor het trainen van AI-modellen zoals Gemini en Vertex AI. Het blokkeren van deze specifieke crawler heeft geen invloed op Googlebot, waardoor uw normale indexering en vindbaarheid in Google Search behouden blijven.

Wat is Content-Signal en hoe verhoudt dit zich tot het Europese auteursrecht?

Content-Signal is een gestandaardiseerde regel waarmee u voorkeuren instelt voor AI-training, AI-invoer en zoekverwerking. In combinatie met het optionele TDM-commentaarblok legt u een formeel rechtenvoorbehoud vast op basis van Artikel 4 van de Europese richtlijn inzake auteursrechten in de digitale eengemaakte markt.

Biedt robots.txt een gegarandeerde bescherming tegen alle AI-scrapers?

Nee, robots.txt is een technisch verzoek dat op vrijwillige basis wordt gerespecteerd. Grote AI-ontwikkelaars houden zich aan deze regels, maar ongecontroleerde bots kunnen het bestand negeren. U kunt een robots.txt tester gebruiken om uw syntax te verifiëren en eventuele strikte blokkades aanvullend op server- of netwerkniveau instellen.

Waarom wordt de verwijzing naar llms.txt als commentaarregel geplaatst?

De officiële standaard voor robots.txt ondersteunt momenteel geen specifieke richtlijn voor llms.txt, anders dan voor XML-sitemaps. De AI Robots.txt Generator plaatst deze verwijzing daarom als een informatieve commentaarregel met een hekje bovenaan het bestand. Gebruik een llms.txt generator om een gestructureerd overzichtsbestand voor AI-modellen op te stellen.