robots.txt

Bijgewerkt: 3 min. leestijd SEOFuxx-redactie

De robots.txt is een tekstbestand in de hoofdmap van een website (/robots.txt) waarmee je crawlers laat weten welke delen ze mogen ophalen en welke niet. Het stuurt het crawlen, niet het indexeren, en bevat meestal ook de verwijzing naar de sitemap.

Hoe het bestand werkt

Voordat een crawler een pagina ophaalt, laadt hij de robots.txt van het domein en controleert hij of er een regel voor zijn naam geldt. Sinds 2022 is het formaat gestandaardiseerd als RFC 9309. Het bestand bestaat uit groepen die elk beginnen met een User-agent-regel en daaronder de regels voor die bot verzamelen.

InstructieBetekenis
User-agentNaam van de bot waarvoor de groep geldt. * staat voor alle bots die geen eigen groep hebben.
DisallowPaden die de bot niet mag ophalen. Een lege waarde blokkeert niets.
AllowUitzondering binnen een geblokkeerd gebied
SitemapVolledig adres van een sitemap, los van de groepen

In paden staat * voor een willekeurig aantal tekens en $ voor het einde van het adres. Als meerdere regels passen, geldt bij Google de meest specifieke, dus die met het langste pad. Paden zijn hoofdlettergevoelig, botnamen niet.

# robots.txt: voorbeeld van een typische configuratie
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /tmp/
Disallow: /*?sessionid=

# Sitemap toevoegen
Sitemap: https://www.jouwdomein.nl/sitemap.xml

Waar het bestand moet staan

  • Direct in de hoofdmap, bereikbaar op https://www.jouwdomein.nl/robots.txt. In een submap wordt het niet gevonden.
  • Het geldt alleen voor de host, poort en het protocol waarop het staat. Elk subdomein heeft een eigen bestand nodig.
  • Het bestand is UTF-8-tekst. Google leest alleen de eerste 500 KiB.
  • Antwoordt de server met 404, dan geldt alles als toegestaan. Bij een serverfout (5xx) pauzeert Google eerst het crawlen van de website en gebruikt daarna tot 30 dagen de laatst opgeslagen versie.

Wat de robots.txt niet kan

  • Het beschermt geen inhoud. Het bestand is openbaar leesbaar en niet elke bot houdt zich eraan. Vertrouwelijke zaken horen achter een login.
  • Het voorkomt geen indexering. Een geblokkeerd adres kan toch in de index verschijnen als andere pagina's ernaar linken, maar dan zonder beschrijving.
  • Het vervangt geen noindex. Wie een pagina uit de index wil halen, gebruikt de noindex-tag. De crawler moet de pagina daarvoor mogen ophalen, anders ziet hij de instructie nooit. Een noindex-regel in de robots.txt gebruikt Google sinds 2019 niet meer.
  • Het regelt bij Google niet de crawlsnelheid. Google negeert Crawl-delay, andere zoekmachines gebruiken het deels.

De bijbehorende robots-metatag in de HTML:

<!-- Pagina indexeren en links volgen (standaard) -->
<meta name="robots" content="index, follow">

<!-- Pagina NIET indexeren -->
<meta name="robots" content="noindex, nofollow">

robots.txt en AI-crawlers

Ook de bots van AI-aanbieders richten zich naar de robots.txt. Bij de meeste aanbieders hebben training en zoeken eigen namen en zijn ze afzonderlijk toe te staan of te blokkeren; meer onder AI-crawlers.

Controleren en testen

  • Open het bestand in de browser en controleer adres, status 200 en inhoud.
  • Het rapport "robots.txt" in Google Search Console laat zien welke versie Google heeft geladen en of er fouten optreden.
  • Controleer belangrijke adressen een voor een op blokkering door een regel, vooral na elke relaunch.

Veelgemaakte fouten

  • Disallow: / uit de testomgeving: Wordt het bestand van het stagingsysteem overgenomen, dan is de hele website geblokkeerd. Dit is de meest voorkomende en duurste fout.
  • CSS- en JavaScript-bestanden blokkeren: Google moet pagina's kunnen weergeven zoals een bezoeker ze ziet. Geblokkeerde bronnen verslechteren het begrip van de pagina.
  • Pagina's blokkeren die op noindex staan: De bot ziet het noindex niet en het adres kan in de index blijven.
  • Hoofdletters en kleine letters over het hoofd zien: /Admin/ en /admin/ zijn twee verschillende paden.
  • Te brede patronen: Een Disallow: /product blokkeert ook /producten/ en /productie.

Verwante begrippen

Bronnen

Heb je iets aan deze inhoud?

·