robots.txt

Stand: 3 Min. Lesezeit SEOFuxx Redaktion

Die robots.txt ist eine Textdatei im Stammverzeichnis einer Website (/robots.txt), mit der du Crawlern mitteilst, welche Bereiche sie abrufen dürfen und welche nicht. Sie steuert das Crawling, nicht die Indexierung, und enthält üblicherweise auch den Verweis auf die Sitemap.

Wie die Datei funktioniert

Bevor ein Crawler eine Seite abruft, lädt er die robots.txt der Domain und prüft, ob für seinen Namen eine Regel gilt. Das Format ist seit 2022 als RFC 9309 standardisiert. Die Datei besteht aus Gruppen, die jeweils mit einer User-agent-Zeile beginnen und darunter Regeln für diesen Bot sammeln.

AnweisungBedeutung
User-agentName des Bots, für den die Gruppe gilt. * steht für alle Bots, die keine eigene Gruppe haben.
DisallowPfade, die der Bot nicht abrufen soll. Ein leerer Wert sperrt nichts.
AllowAusnahme innerhalb eines gesperrten Bereichs
SitemapVollständige Adresse einer Sitemap, unabhängig von den Gruppen

In Pfaden steht * für beliebig viele Zeichen und $ für das Ende der Adresse. Bei mehreren passenden Regeln gilt bei Google die genauere, also die mit dem längeren Pfad. Pfade unterscheiden Groß- und Kleinschreibung, Bot-Namen nicht.

# robots.txt: Beispiel für eine typische Konfiguration
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /tmp/
Disallow: /*?sessionid=

# Sitemap eintragen
Sitemap: https://www.deinedomain.de/sitemap.xml

Wo die Datei liegen muss

  • Direkt im Stammverzeichnis, erreichbar unter https://www.deinedomain.de/robots.txt. In einem Unterordner wird sie nicht gefunden.
  • Sie gilt nur für den Host, Port und das Protokoll, unter dem sie liegt. Jede Subdomain braucht eine eigene Datei.
  • Die Datei ist UTF-8-Text. Google liest nur die ersten 500 KiB.
  • Antwortet der Server mit 404, gilt alles als erlaubt. Bei einem Serverfehler (5xx) pausiert Google zunächst das Crawling der Website und nutzt danach bis zu 30 Tage die zuletzt gespeicherte Fassung.

Was die robots.txt nicht kann

  • Sie schützt keine Inhalte. Die Datei ist öffentlich lesbar, und nicht jeder Bot hält sich daran. Vertrauliches gehört hinter eine Anmeldung.
  • Sie verhindert keine Indexierung. Eine gesperrte Adresse kann trotzdem im Index auftauchen, wenn andere Seiten auf sie verlinken, dann allerdings ohne Beschreibung.
  • Sie ersetzt kein noindex. Wer eine Seite aus dem Index nehmen will, nutzt den Noindex-Tag. Der Crawler muss die Seite dafür abrufen dürfen, sonst sieht er die Anweisung nie. Eine noindex-Zeile in der robots.txt wertet Google seit 2019 nicht mehr aus.
  • Sie regelt keine Abrufgeschwindigkeit bei Google. Crawl-delay ignoriert Google, andere Suchmaschinen werten es teilweise aus.

Zugehöriger Robots-Meta-Tag im HTML:

<!-- Seite indexieren und Links folgen (Standard) -->
<meta name="robots" content="index, follow">

<!-- Seite NICHT indexieren -->
<meta name="robots" content="noindex, nofollow">

robots.txt und KI-Crawler

Auch die Bots der KI-Anbieter richten sich nach der robots.txt. Training und Suche haben bei den meisten Anbietern eigene Namen und lassen sich getrennt erlauben oder sperren, mehr dazu unter KI-Crawler.

Prüfen und testen

  • Rufe die Datei im Browser auf und prüfe Adresse, Status 200 und Inhalt.
  • Der Bericht „robots.txt“ in der Google Search Console zeigt, welche Version Google geladen hat und ob Fehler auftreten.
  • Prüfe wichtige Adressen einzeln darauf, ob sie durch eine Regel gesperrt sind, vor allem nach jedem Relaunch.

Häufige Fehler

  • Disallow: / aus der Testumgebung: Wird die Datei vom Staging-System übernommen, ist die ganze Website gesperrt. Das ist der häufigste und teuerste Fehler.
  • CSS- und JavaScript-Dateien sperren: Google muss Seiten so darstellen können wie ein Besucher. Gesperrte Ressourcen verschlechtern das Verständnis der Seite.
  • Seiten sperren, die auf noindex stehen: Der Bot sieht das noindex nicht und die Adresse bleibt unter Umständen im Index.
  • Groß- und Kleinschreibung übersehen: /Admin/ und /admin/ sind zwei verschiedene Pfade.
  • Zu breite Muster: Ein Disallow: /produkt sperrt auch /produkte/ und /produktion.

Weiterführende Begriffe

Quellen

Ist dieser Inhalt hilfreich?

·