← Terug naar kennisbank

Zo check je of je site klaarstaat voor AI-crawlers

Steeds vaker vindt een klant je niet via Google, maar doordat een AI-crawler je site heeft gelezen voor ChatGPT of Perplexity. De meeste ondernemers hebben dat nog nooit gecheckt.

Vrouw werkt geconcentreerd aan haar laptop in haar thuiskantoor

Wat een AI-crawler precies doet

Een AI-crawler is een geautomatiseerd programma dat webpagina's ophaalt voor een AI-systeem. Sommige crawlers verzamelen content om een model mee te trainen, andere lezen je pagina live op het moment dat iemand een vraag stelt. Dat zijn twee verschillende dingen. Een marketingbureau schrijft over deze twee functies: "Retrieval (zoeken en citeren): bots halen live webpagina's op om een antwoord te maken, soms met bronvermelding" tegenover training, waarbij bots content verzamelen om modellen te bouwen. Voor jou als ondernemer is vooral die eerste groep interessant: dat zijn de bots die je site kunnen tonen als antwoord op een vraag van een potentiële klant.

Zo check je of AI-crawlers jouw site mogen lezen

Open je eigen site en typ achter de domeinnaam /robots.txt. Dat bestand bepaalt welke bots wel en niet mogen meelezen. Zoek naar regels met bekende namen zoals GPTBot, ClaudeBot of PerplexityBot. Staat er Disallow: / achter zo'n naam, dan sluit je die bot buiten. Ontbreekt het bestand helemaal of staat er niets specifieks in, dan mogen de meeste AI-crawlers gewoon binnen. Dat is meteen een gerelateerd punt: wat robots.txt precies doet, lees je in een eerder artikel op deze kennisbank. Belangrijk om te weten: robots.txt stuurt alleen crawltoegang, het blokkeert geen indexatie en beschermt je content niet tegen kopiëren. Het is een verkeersbord, geen slot op de deur.

Wat je met die uitkomst doet

Wil je gevonden worden via AI-assistenten, laat retrieval-bots dan met rust. Wil je juist niet dat je teksten in trainingsdata belanden, dan blokkeer je specifiek de training-crawlers. Dat kan naast elkaar bestaan: "je wil vaak wel retrieval op je publieke kennis toelaten, maar training op je betaalde content blokkeren". Zo simpel is het. De meeste solo-ondernemers hoeven niets te blokkeren: je blogs mogen juist gezien worden. Wat wel telt, is dat de tekst zelf logisch is opgebouwd, met een heldere eerste zin per sectie die als los antwoord kan dienen. Dat maakt het verschil tussen een pagina die een AI-assistent citeert en een pagina die hij overslaat. Meer over content die AI-tools graag citeren lees je verderop in de kennisbank.

Een blogidee bedenken is zelden het probleem. De tijd vinden om te checken of die tekst ook echt gevonden wordt, wel. dibbi zet elke blog online in een structuur die zowel bezoekers als AI-crawlers kunnen lezen, zonder dat jij aan robots.txt hoeft te sleutelen. Bekijk hoe dibbi dat voor je regelt of blader verder door de kennisbank.

Samengevat

  • AI-crawlers zoals GPTBot en ClaudeBot halen webpagina's op om ze te tonen als antwoord op een vraag of om een model mee te trainen.
  • Je vindt in het bestand robots.txt van je eigen site terug welke crawlers wel en niet mogen meelezen.
  • Robots.txt stuurt alleen crawltoegang en blokkeert geen indexatie, dus het beschermt je content niet tegen kopiëren.
  • Je kunt retrieval-crawlers toelaten voor zichtbaarheid en trainingscrawlers apart blokkeren, dat kan naast elkaar.
  • Een heldere eerste zin per sectie in je tekst vergroot de kans dat een AI-assistent je pagina citeert.
  • De meeste solo-ondernemers hoeven niets te blokkeren, want een blog mag juist gezien worden.

Veelgestelde vragen

Wat is een AI-crawler?

Een AI-crawler is een geautomatiseerd programma dat webpagina's ophaalt voor een AI-systeem, bijvoorbeeld om een model te trainen of om een pagina live te lezen als antwoord op een vraag. Bekende voorbeelden zijn GPTBot, ClaudeBot en PerplexityBot. Elke crawler heeft een eigen naam waarmee hij zich meldt.

Hoe zie ik of AI-crawlers mijn site mogen lezen?

Open je site en typ achter de domeinnaam /robots.txt om het bestand te bekijken. Staat een botnaam gevolgd door een regel die crawlen verbiedt, dan sluit je die bot buiten. Staat er niets specifieks, dan mogen de meeste AI-crawlers gewoon binnen.

Beschermt robots.txt mijn content tegen kopiëren?

Nee, robots.txt regelt alleen of een crawler je pagina's mag ophalen. Het blokkeert geen indexatie en beschermt je teksten niet tegen kopiëren. Voor echte bescherming zijn andere technische maatregelen nodig.

Moet ik AI-crawlers blokkeren of juist toelaten?

Dat hangt af van wat je wilt. Wil je gevonden worden via ChatGPT of Perplexity, laat de crawlers dan toe. Wil je niet dat je teksten in trainingsdata belanden, dan blokkeer je specifiek de trainingscrawlers, terwijl je retrieval-bots met rust laat.

Hoe zorg ik dat een AI-assistent mijn blog citeert?

Zorg dat elke sectie van je tekst begint met een zin die op zichzelf een compleet antwoord geeft. dibbi bouwt elke blog al in die structuur, zodat je content leesbaar is voor zowel bezoekers als AI-crawlers.

Hoe zichtbaar ben jij voor je klanten?

Doe de gratis Zichtbaarheidsscan. In 3 minuten weet je je score en je grootste kansen.

Doe de gratis scan

Lees ook

Hoe zichtbaar ben jij voor je klanten?

Doe de gratis Zichtbaarheidsscan. In 3 minuten weet je je score en zie je precies waar je het laat liggen.

Doe de gratis scan

Gratis. 16 korte vragen. Direct je rapport.

Voorbeeld van het scan-rapport met je score en aandachtspunten