Crawlbudget

Bijgewerkt: 2 min. leestijd SEOFuxx-redactie

Het crawlbudget is het aantal pagina's dat Google op je website kan en wil ophalen. Het ontstaat uit twee grootheden: hoeveel je server aankan (crawlcapaciteit) en hoezeer Google je pagina's wil ophalen (crawlvraag). Voor de meeste websites is het geen onderwerp, maar bij zeer grote websites bepaalt het mee hoe snel nieuwe en gewijzigde pagina's in de index komen.

Voor wie het belangrijk is

Google noemt twee ruwe richtwaarden, geen harde grenzen:

  • Websites met meer dan een miljoen unieke pagina's waarvan de inhoud ongeveer wekelijks verandert
  • Websites met meer dan 10.000 unieke pagina's waarvan de inhoud dagelijks verandert
  • Websites waarbij veel adressen in Search Console staan als "Ontdekt: momenteel niet geïndexeerd"

Voor alle anderen is het meestal niet nodig zich erom te bekommeren. Een actuele sitemap en een blik in het rapport over paginaindexering volstaan.

De twee onderdelen

GrootheidBetekenisWat haar beïnvloedt
CrawlcapaciteitBovengrens, zodat Google je server niet overbelastAntwoordtijden en fouten: stabiele, snelle antwoorden verhogen haar, vertraging, 5xx-fouten en de status 429 verlagen haar
CrawlvraagHoezeer Google je pagina's wil ophalenGrootte van de website, hoe vaak ze verandert, kwaliteit en populariteit van de pagina's, plus grote gebeurtenissen zoals een verhuizing

De capaciteit delen alle crawlers van Google. Haalt er één veel op, dan blijft er voor de andere minder over. De vraag beïnvloed je het sterkst via het aantal adressen: veel dubbele of onbelangrijke adressen leggen crawltijd vast.

Wat je kunt verbeteren

  • Dubbele inhoud samenvoegen: met een canonical of een doorverwijzing (zie Duplicate content)
  • Onbelangrijke adressen blokkeren: zoals filtercombinaties of sessie-ID's via robots.txt, als ze nooit gecrawld mogen worden
  • Verwijderde pagina's juist beantwoorden: met 404 of 410, niet met een lege pagina en status 200 (soft 404)
  • De sitemap bijhouden: actueel houden en lastmod alleen bij echte wijzigingen zetten
  • Doorverwijzingsketens vermijden: Elke stap kost een aanvraag
  • De server versnellen: kortere antwoordtijden maken meer aanvragen mogelijk, en HTTP-caching met de status 304 helpt

Wat niet helpt

  • noindex als bezuinigingsmaatregel: Google blijft de pagina ophalen om de noindex te controleren. Dat bespaart geen crawltijd.
  • robots.txt als tijdelijke herverdeling: Het vrijgekomen budget gaat niet automatisch naar andere pagina's zolang Google niet tegen de capaciteitsgrens aanloopt. De robots.txt is bedoeld voor adressen die je nooit gecrawld wilt hebben.

Zo controleer je het

  • Het rapport "Crawlstatistieken" in de instellingen van Google Search Console toont aanvragen per dag, antwoordtijden en fouten.
  • Het rapport over paginaindexering noemt welke adressen zijn ontdekt maar niet geïndexeerd.
  • De serverlogs laten zien welke delen bots echt ophalen en hoe vaak.

Veelgemaakte fouten

  • Het crawlbudget optimaliseren terwijl de website klein is: Het probleem zit dan bijna altijd elders, bijvoorbeeld bij inhoud of linkstructuur.
  • Eindeloze adresruimten: Kalenders, filters en zoekpagina's maken willekeurig veel varianten.
  • Foutpagina's met status 200: Ze worden als echte pagina's behandeld en blijven gecrawld worden.
  • Trage server: Wie Google lang laat wachten, krijgt minder aanvragen.

Verwante begrippen

Bronnen

Heb je iets aan deze inhoud?

·