Vier soorten AI-bots en hun invloed op uw website
Niet elke AI-crawler bezoekt uw website met hetzelfde doel. In het huidige webevolutiemodel opereren meer dan 50 verschillende AI-agents, die grofweg onderverdeeld worden in vier functionele rollen.
- Trainingsdatacrawlers: Deze bots verzamelen grote hoeveelheden tekst en media om nieuwe AI-modellen te trainen. Voorbeelden zijn GPTBot van OpenAI, ClaudeBot van Anthropic en CCBot van Common Crawl. De verzamelde inhoud wordt permanent verwerkt in de modelgewichten, meestal zonder directe bronvermelding of doorklikverkeer naar uw website.
- AI-zoekmachine-indexeerders: Bots zoals OAI-SearchBot indexeren webpagina's specifiek om actuele antwoorden en samenvattingen te tonen in zoekomgevingen. Wanneer een gebruiker een vraag stelt aan een AI-zoekmachine, genereert het systeem een antwoord met klikbare bronverwijzingen naar de geanalyseerde pagina's.
- Gebruikersgestuurde ophaalrobots: Een bot zoals ChatGPT-User treedt uitsluitend in werking wanneer een eindgebruiker een specifieke webkoppeling in een conversatie plakt en vraagt om die pagina samen te vatten of te analyseren. Deze bot crawlt de website niet autonoom op grote schaal.
- Autonome webagents: Deze softwareprogramma's voeren gerichte taken uit namens een gebruiker, zoals het controleren van productprijzen of het vergelijken van dienstverlening op verschillende pagina's.
Het uitsluiten van alle AI-verkeer stopt dataverzameling voor modeltraining, maar ontneemt uw platform tegelijkertijd zichtbaarheid in moderne zoeksystemen. De AI Robots.txt Generator helpt bij het instellen van gerichte regels per botcategorie.
Hoe het gegenereerde robots.txt-bestand is opgebouwd
Het robots.txt-protocol berust op eenvoudige tekstregels die zoekmachines en crawlers vertellen welke paden toegankelijk zijn. De AI Robots.txt Generator combineert moderne standaarden met traditionele user-agent-blokkades in een heldere directorystructuur.
Het gegenereerde bestand start met een algemene wildcardgroep onder User-agent: *. Binnen deze groep wordt de toegang tot openbare paden geopend met Allow: /, aangevuld met een Content-Signal-regel. Deze regel geeft programmatisch aan hoe geautomatiseerde systemen mogen omgaan met uw inhoud voor zoekdoeleinden en modeltraining.
Vervolgens maakt de generator voor elke crawler die u wilt beperken een afzonderlijke regelgroep aan. Elke groep bestaat uit twee regels:
User-agent: GPTBot Disallow: /
Wanneer u ervoor kiest om alleen bepaalde mappen af te schermen, past de tool het ingestelde pad, bijvoorbeeld /privedata/, uniform toe op alle geselecteerde bots. Aan het einde van het bestand kan de generator optioneel een verwijzing naar uw Sitemap: toevoegen, evenals een commentaarregel die verwijst naar een eventueel contextbestand voor taalmodellen.
Content Signals en het voorbehoud voor tekst- en datamining
Content Signals is een initiatief van contentsignals.org en Cloudflare om AI-voorkeuren op een compacte manier via één header of robots.txt-regel over te brengen. In plaats van tientallen losse bots handmatig te beheren, definieert een Content-Signal-regel drie kernparameters:
search: Geeft toestemming voor indexering ten behoeve van zoekresultaten en citaties.
ai-input: Bepaalt of de inhoud als actuele context mag dienen bij gebruikersvragen.
ai-train: Bepaalt of de inhoud gebruikt mag worden voor het trainen van nieuwe AI-modellen.
Elke parameter kan de waarde allow of disallow krijgen. Wordt een parameter weggelaten, dan geeft de website-eigenaar geen expliciete voorkeur aan. Cloudflare biedt hierop een uitbreiding via de use-parameter, waarmee beheerders bepalen of een bewerking direct, na bronverwijzing of volledig is toegestaan.
Voor uitgevers in de Europese Unie bevat de AI Robots.txt Generator een optioneel commentaarblok met een formeel voorbehoud. Artikel 4 lid 3 van de Europese Richtlijn 2019/790 (Auteursrechten in de digitale eengemaakte markt) stelt dat tekst- en datamining is toegestaan op openbare online werken, tenzij de rechthebbende dit uitdrukkelijk en in machinaal leesbare vorm heeft voorbehouden. Een gestructureerd commentaarblok in uw robots.txt dient als deze wettelijk erkende verklaring.
Omdat partijen zoals Google publiekelijk hebben aangegeven geen instructies te ontlenen aan Content-Signal, blijft het noodzakelijk om bot-specifieke Disallow-regels te combineren met deze nieuwere standaarden.
De juiste blokkeerstrategie kiezen voor uw website
De keuze welke AI-crawlers u toelaat hangt af van uw bedrijfsmodel, uw publiek en de aard van uw publicaties. De AI Robots.txt Generator biedt verschillende voorinstellingen voor veelvoorkomende situaties.
| Strategie |
Doel |
Aanbevolen instelling |
| Zichtbare uitgever |
Geen AI-training, wel vindbaar via AI-zoekmachines |
Alleen trainingscrawlers blokkeren |
| Maximale afscherming |
Geen enkel geautomatiseerd AI-gebruik toestaan |
Alle AI-crawlers blokkeren |
| Alleen signalen |
Flexibel beheer via headers zonder losse bot-regels |
Geen bots blokkeren (enkel Content-Signal) |
| Maatwerk |
Specifieke platforms weren of bepaalde mappen beschermen |
Aangepaste selectie |
Voor de meeste zakelijke websites, kennisbanken en nieuwsmedia is de standaardinstelling het meest praktisch. Hiermee blokkeert u pure trainingsbots zoals GPTBot, ClaudeBot en CCBot, terwijl zoekbots zoals OAI-SearchBot en interactieve verzoekers zoals ChatGPT-User pagina's kunnen blijven raadplegen. Zo voorkomt u dat uw intellectueel eigendom zonder compensatie in modelgewichten verdwijnt, zonder dat u potentiële bezoekers uit AI-zoekresultaten verliest.
Een belangrijk detail betreft Google-Extended. Deze specifieke user-agent beheert de toegang voor het trainen van Gemini-modellen. Het blokkeren van Google-Extended heeft geen negatieve gevolgen voor uw normale positie in Google Zoeken, omdat de reguliere Googlebot de pagina's voor zoekindexering blijft verwerken.
Beperkingen van robots.txt en effectieve handhaving
Een vermelding in robots.txt is een formele instructie volgens de RFC 9309-standaard, maar vormt geen technische blokkade. Het bestand functioneert als een beleefd verzoek aan webcrawlers.
Grote, erkende technologiebedrijven controleren robots.txt voorafgaand aan het scrapen en respecteren de instructies. Er bestaan echter ook malafide scrapers en minder transparante dataverzamelaars die de regels negeren en zich soms voordoen als reguliere webbrowsers. Bovendien verwijdert een nieuwe Disallow-regel geen data die in het verleden al door een AI-bedrijf is gedownload en verwerkt.
Voor strikte handhaving is een gelaagde beveiliging nodig:
- Robots.txt: Dient als eerste formele en juridische barrière voor conforme crawlers.
- Web Application Firewall (WAF): Blokkeert IP-adressen en bekende data center-bereiken van agressieve scrapers.
- Cryptografische validatie: Bevestig de identiteit van bots met tools zoals een Web Bot Auth Key Generator.
Controleer na het uploaden van uw bestand altijd of er geen syntactische fouten zijn gemaakt die per ongeluk gewone zoekmachines buitensluiten. Gebruik hiervoor een robots.txt tester om de verwerking van specifieke paden en user-agents direct te valideren.
Waarom robots.txt en llms.txt elkaar aanvullen
Naast robots.txt wint een tweede standaard aan populariteit: het llms.txt-bestand. Hoewel beide bestanden zich in de hoofdmap van een website bevinden, vervullen ze tegenovergestelde rollen.
Robots.txt regelt toegangsrechten. Het vertelt crawlers welke bestanden en mappen zij niet mogen bekijken. Het formaat is strikt machineleesbaar en bevat geen contextuele informatie over de inhoud van de website.
Het llms.txt-bestand is juist bedoeld om taalmodellen te helpen de inhoud van een website sneller en beter te begrijpen. Het bevat gestructureerde samenvattingen, links naar documentatie en schone Markdown-teksten zonder opmaakballast zoals navigatiemenu's of advertenties. U kunt een dergelijk bestand samenstellen met een llms.txt generator.
In de AI Robots.txt Generator verschijnt de verwijzing naar llms.txt uitsluitend als een informatieve commentaarregel. De officiële robots.txt-specificatie kent immers geen Llms:-instructie zoals dat voor Sitemap: wel het geval is. Door beide bestanden correct in te richten, behoudt u de controle over wat AI-systemen mogen verzamelen en verbetert u tegelijkertijd de nauwkeurigheid van de antwoorden die toegestane systemen over uw website geven.