Crawl Budget
Das Crawl Budget ist die Menge an Seiten, die Google auf deiner Website abrufen kann und will. Es entsteht aus zwei Größen: wie viel dein Server verträgt (Crawling-Kapazität) und wie sehr Google deine Seiten abrufen möchte (Crawling-Bedarf). Für die meisten Websites ist das kein Thema, bei sehr großen Websites entscheidet es mit darüber, wie schnell neue und geänderte Seiten im Index ankommen.
Für wen es wichtig ist
Google nennt zwei grobe Richtwerte, keine harten Grenzen:
- Websites mit mehr als einer Million einzigartiger Seiten, deren Inhalt sich etwa wöchentlich ändert
- Websites mit mehr als 10.000 einzigartigen Seiten, deren Inhalt sich täglich ändert
- Websites, bei denen viele Adressen in der Search Console als „Gefunden: zurzeit nicht indexiert“ stehen
Alle anderen müssen sich in der Regel nicht darum kümmern. Eine aktuelle Sitemap und ein Blick in den Bericht zur Seitenindexierung genügen.
Die zwei Bestandteile
| Größe | Bedeutung | Was sie beeinflusst |
|---|---|---|
| Crawling-Kapazität | Obergrenze, damit Google deinen Server nicht überlastet | Antwortzeiten und Fehler: stabile, schnelle Antworten erhöhen sie, Verlangsamung, 5xx-Fehler und der Status 429 senken sie |
| Crawling-Bedarf | Wie sehr Google deine Seiten abrufen will | Größe der Website, Änderungshäufigkeit, Qualität und Beliebtheit der Seiten, dazu große Ereignisse wie ein Umzug |
Die Kapazität teilen sich alle Crawler von Google. Ruft einer sehr viel ab, bleibt für die anderen weniger übrig. Am stärksten beeinflusst du den Bedarf über die Zahl der Adressen: Viele doppelte oder unwichtige Adressen binden Crawling-Zeit.
Was du verbessern kannst
- Doppelte Inhalte zusammenführen: mit Canonical oder Weiterleitung (siehe Duplicate Content)
- Unwichtige Adressen sperren: etwa Filterkombinationen oder Sitzungs-IDs per robots.txt, wenn sie nie gecrawlt werden sollen
- Entfernte Seiten richtig beantworten: mit 404 oder 410, nicht mit einer leeren Seite und Status 200 (Soft 404)
- Die Sitemap pflegen: aktuell halten und
lastmodnur bei echten Änderungen setzen - Weiterleitungsketten vermeiden: Jede Stufe kostet einen Abruf
- Den Server beschleunigen: kürzere Antwortzeiten erlauben mehr Abrufe, dazu hilft HTTP-Caching mit dem Status 304
Was nicht hilft
- noindex als Sparmaßnahme: Google ruft die Seite weiter ab, um das noindex zu prüfen. Das spart keine Crawling-Zeit.
- robots.txt als vorübergehende Umverteilung: Das freigewordene Budget geht nicht automatisch an andere Seiten, solange Google nicht an die Kapazitätsgrenze stößt. Die robots.txt ist für Adressen gedacht, die du dauerhaft nicht gecrawlt haben willst.
So prüfst du es
- Der Bericht „Crawling-Statistiken“ in den Einstellungen der Google Search Console zeigt Abrufe pro Tag, Antwortzeiten und Fehler.
- Der Bericht zur Seitenindexierung nennt, welche Adressen entdeckt, aber nicht indexiert sind.
- Die Server-Logs zeigen, welche Bereiche Bots tatsächlich abrufen und wie oft.
Häufige Fehler
- Crawl Budget optimieren, obwohl die Website klein ist: Das Problem liegt dann fast immer woanders, etwa bei Inhalt oder Verlinkung.
- Endlose Adressräume: Kalender, Filter und Suchseiten erzeugen beliebig viele Varianten.
- Fehlerseiten mit Status 200: Sie werden wie echte Seiten behandelt und weiter gecrawlt.
- Langsamer Server: Wer Google lange warten lässt, bekommt weniger Abrufe.
Weiterführende Begriffe
- Sitemap.xml: Adressen und Änderungen melden
- robots.txt: Crawling gezielt sperren
- Duplicate Content: Varianten bündeln
- Defekte Links: Weiterleitungen und Fehlerseiten aufräumen
Quellen
- Google Search Central: Crawling-Budget für große Websites verwalten