AI-crawlers
AI-crawlers zijn bots waarmee AI-aanbieders webpagina's ophalen, hetzij om trainingsdata voor hun modellen te verzamelen, hetzij om bij een vraag van een gebruiker actuele inhoud te laden. Veel aanbieders gebruiken hiervoor aparte user agents, zodat training en zoeken afzonderlijk te sturen zijn.
Drie soorten toegang
Bij de meeste aanbieders zijn drie doelen te onderscheiden:
- Training: De bot verzamelt teksten die later kunnen meegaan in de training van nieuwe modelversies.
- Zoeken: De bot bouwt een index waaruit het systeem bij vragen bronnen kiest en citeert.
- Ophalen in opdracht van een gebruiker: De bot laadt precies de pagina die een gebruiker in de chat noemde of die het systeem voor een antwoord nodig heeft.
| Aanbieder | Training | Zoeken | Ophalen voor gebruikers |
|---|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot | ChatGPT-User |
| Anthropic | ClaudeBot | Claude-SearchBot | Claude-User |
| Perplexity | – | PerplexityBot | Perplexity-User |
| Google-Extended (token) | Googlebot | – | |
| Common Crawl | CCBot | – | – |
Google-Extended is geen eigen crawler, maar een token voor de robots.txt. Het bepaalt of inhoud mag worden gebruikt voor de training en grounding van Gemini, en heeft geen invloed op Google Zoeken en de AI Overviews. Voor die gelden de instellingen van Google Zoeken: een pagina moet geïndexeerd zijn en met snippet mogen worden getoond om als bron te worden gelinkt. Wie daar niet wil verschijnen, beperkt de weergave in de zoekresultaten zelf, bijvoorbeeld met nosnippet.
Sturen via de robots.txt
Met de robots.txt bepaal je afzonderlijk of je inhoud voor training mag worden gebruikt en of die in AI-zoekopdrachten kan verschijnen. Wie de zoekcrawlers blokkeert, kan in de betreffende systemen niet als bron worden geciteerd.
# AI-training verbieden, AI-zoeken toestaan
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Een blokkade voor trainingsbots geldt alleen voor toekomstige training. Wat een model al uit eerdere data kent, haalt ze niet terug.
Wat de robots.txt niet doet
- Het is een verzoek, geen slot. Serieuze aanbieders houden zich eraan, afdwingen kan technisch niet.
- Ophalen in opdracht van gebruikers valt volgens sommige aanbieders niet of maar gedeeltelijk onder de robots.txt, omdat een mens de aanvraag heeft gestart. Lees daarvoor de documentatie van de betreffende aanbieder.
- De user agent is te vervalsen. Wie zeker wil zijn, controleert ook het IP-adres. Meerdere aanbieders publiceren de adresbereiken van hun crawlers.
Crawlers herkennen en controleren
In de serverlogs zie je welke bots je pagina's ophalen en hoe vaak. Filter op de namen uit de tabel. Controleer ook of een dienst ervoor, zoals een CDN of firewall, AI-bots in het algemeen blokkeert. Sommige aanbieders hebben daarvoor schakelaars of standaardregels, en dan helpt zelfs de beste robots.txt niet.
Veel AI-crawlers voeren geen JavaScript uit. Belangrijke inhoud hoort daarom in de aangeleverde HTML te staan (zie JavaScript-SEO).
Veelgemaakte fouten
- Alle AI-bots blokkeren: Wie ook de zoekcrawlers uitsluit, verschijnt in die systemen niet als bron.
- Maar aan één bot van een aanbieder denken: Training, zoeken en ophalen voor gebruikers hebben aparte namen. Een regel voor GPTBot geldt niet voor OAI-SearchBot.
- De namen verkeerd schrijven: De robots.txt vergelijkt de naam van de bot. Een typefout maakt de regel nutteloos.
- Nooit kijken: Aanbieders voegen bots toe en wijzigen ze. Vergelijk de lijst af en toe met de actuele documentatie.
Verwante begrippen
- robots.txt: de toegang tot je website regelen
- llms.txt: voorgesteld oriëntatiebestand voor taalmodellen
- Trainingsdata: waar modellen hun kennis vandaan hebben
- RAG (Retrieval-Augmented Generation): hoe AI-systemen bronnen ophalen
- GEO (Generative Engine Optimization): inhoud optimaliseren voor AI-antwoorden
Bronnen
- OpenAI: Overview of OpenAI Crawlers
- Anthropic: Does Anthropic crawl data from the web?
- Perplexity: Perplexity Crawlers
- Google Search Central: Overview of Google crawlers and fetchers
- Google Search Central: AI features and your website