Wat een AI-crawler precies doet
Een AI-crawler is een geautomatiseerd programma dat webpagina's ophaalt voor een AI-systeem. Sommige crawlers verzamelen content om een model mee te trainen, andere lezen je pagina live op het moment dat iemand een vraag stelt. Dat zijn twee verschillende dingen. Een marketingbureau schrijft over deze twee functies: "Retrieval (zoeken en citeren): bots halen live webpagina's op om een antwoord te maken, soms met bronvermelding" tegenover training, waarbij bots content verzamelen om modellen te bouwen. Voor jou als ondernemer is vooral die eerste groep interessant: dat zijn de bots die je site kunnen tonen als antwoord op een vraag van een potentiële klant.
Zo check je of AI-crawlers jouw site mogen lezen
Open je eigen site en typ achter de domeinnaam /robots.txt. Dat bestand bepaalt welke bots wel en niet mogen meelezen. Zoek naar regels met bekende namen zoals GPTBot, ClaudeBot of PerplexityBot. Staat er Disallow: / achter zo'n naam, dan sluit je die bot buiten. Ontbreekt het bestand helemaal of staat er niets specifieks in, dan mogen de meeste AI-crawlers gewoon binnen. Dat is meteen een gerelateerd punt: wat robots.txt precies doet, lees je in een eerder artikel op deze kennisbank. Belangrijk om te weten: robots.txt stuurt alleen crawltoegang, het blokkeert geen indexatie en beschermt je content niet tegen kopiëren. Het is een verkeersbord, geen slot op de deur.
Wat je met die uitkomst doet
Wil je gevonden worden via AI-assistenten, laat retrieval-bots dan met rust. Wil je juist niet dat je teksten in trainingsdata belanden, dan blokkeer je specifiek de training-crawlers. Dat kan naast elkaar bestaan: "je wil vaak wel retrieval op je publieke kennis toelaten, maar training op je betaalde content blokkeren". Zo simpel is het. De meeste solo-ondernemers hoeven niets te blokkeren: je blogs mogen juist gezien worden. Wat wel telt, is dat de tekst zelf logisch is opgebouwd, met een heldere eerste zin per sectie die als los antwoord kan dienen. Dat maakt het verschil tussen een pagina die een AI-assistent citeert en een pagina die hij overslaat. Meer over content die AI-tools graag citeren lees je verderop in de kennisbank.
Een blogidee bedenken is zelden het probleem. De tijd vinden om te checken of die tekst ook echt gevonden wordt, wel. dibbi zet elke blog online in een structuur die zowel bezoekers als AI-crawlers kunnen lezen, zonder dat jij aan robots.txt hoeft te sleutelen. Bekijk hoe dibbi dat voor je regelt of blader verder door de kennisbank.
Samengevat
- AI-crawlers zoals GPTBot en ClaudeBot halen webpagina's op om ze te tonen als antwoord op een vraag of om een model mee te trainen.
- Je vindt in het bestand robots.txt van je eigen site terug welke crawlers wel en niet mogen meelezen.
- Robots.txt stuurt alleen crawltoegang en blokkeert geen indexatie, dus het beschermt je content niet tegen kopiëren.
- Je kunt retrieval-crawlers toelaten voor zichtbaarheid en trainingscrawlers apart blokkeren, dat kan naast elkaar.
- Een heldere eerste zin per sectie in je tekst vergroot de kans dat een AI-assistent je pagina citeert.
- De meeste solo-ondernemers hoeven niets te blokkeren, want een blog mag juist gezien worden.