robots.txt
Die robots.txt ist eine Textdatei im Stammverzeichnis einer Website (/robots.txt), mit der du Crawlern mitteilst, welche Bereiche sie abrufen dürfen und welche nicht. Sie steuert das Crawling, nicht die Indexierung, und enthält üblicherweise auch den Verweis auf die Sitemap.
Wie die Datei funktioniert
Bevor ein Crawler eine Seite abruft, lädt er die robots.txt der Domain und prüft, ob für seinen Namen eine Regel gilt. Das Format ist seit 2022 als RFC 9309 standardisiert. Die Datei besteht aus Gruppen, die jeweils mit einer User-agent-Zeile beginnen und darunter Regeln für diesen Bot sammeln.
| Anweisung | Bedeutung |
|---|---|
User-agent | Name des Bots, für den die Gruppe gilt. * steht für alle Bots, die keine eigene Gruppe haben. |
Disallow | Pfade, die der Bot nicht abrufen soll. Ein leerer Wert sperrt nichts. |
Allow | Ausnahme innerhalb eines gesperrten Bereichs |
Sitemap | Vollständige Adresse einer Sitemap, unabhängig von den Gruppen |
In Pfaden steht * für beliebig viele Zeichen und $ für das Ende der Adresse. Bei mehreren passenden Regeln gilt bei Google die genauere, also die mit dem längeren Pfad. Pfade unterscheiden Groß- und Kleinschreibung, Bot-Namen nicht.
# robots.txt: Beispiel für eine typische Konfiguration
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /tmp/
Disallow: /*?sessionid=
# Sitemap eintragen
Sitemap: https://www.deinedomain.de/sitemap.xml
Wo die Datei liegen muss
- Direkt im Stammverzeichnis, erreichbar unter
https://www.deinedomain.de/robots.txt. In einem Unterordner wird sie nicht gefunden. - Sie gilt nur für den Host, Port und das Protokoll, unter dem sie liegt. Jede Subdomain braucht eine eigene Datei.
- Die Datei ist UTF-8-Text. Google liest nur die ersten 500 KiB.
- Antwortet der Server mit 404, gilt alles als erlaubt. Bei einem Serverfehler (5xx) pausiert Google zunächst das Crawling der Website und nutzt danach bis zu 30 Tage die zuletzt gespeicherte Fassung.
Was die robots.txt nicht kann
- Sie schützt keine Inhalte. Die Datei ist öffentlich lesbar, und nicht jeder Bot hält sich daran. Vertrauliches gehört hinter eine Anmeldung.
- Sie verhindert keine Indexierung. Eine gesperrte Adresse kann trotzdem im Index auftauchen, wenn andere Seiten auf sie verlinken, dann allerdings ohne Beschreibung.
- Sie ersetzt kein noindex. Wer eine Seite aus dem Index nehmen will, nutzt den Noindex-Tag. Der Crawler muss die Seite dafür abrufen dürfen, sonst sieht er die Anweisung nie. Eine
noindex-Zeile in der robots.txt wertet Google seit 2019 nicht mehr aus. - Sie regelt keine Abrufgeschwindigkeit bei Google.
Crawl-delayignoriert Google, andere Suchmaschinen werten es teilweise aus.
Zugehöriger Robots-Meta-Tag im HTML:
<!-- Seite indexieren und Links folgen (Standard) -->
<meta name="robots" content="index, follow">
<!-- Seite NICHT indexieren -->
<meta name="robots" content="noindex, nofollow">
robots.txt und KI-Crawler
Auch die Bots der KI-Anbieter richten sich nach der robots.txt. Training und Suche haben bei den meisten Anbietern eigene Namen und lassen sich getrennt erlauben oder sperren, mehr dazu unter KI-Crawler.
Prüfen und testen
- Rufe die Datei im Browser auf und prüfe Adresse, Status 200 und Inhalt.
- Der Bericht „robots.txt“ in der Google Search Console zeigt, welche Version Google geladen hat und ob Fehler auftreten.
- Prüfe wichtige Adressen einzeln darauf, ob sie durch eine Regel gesperrt sind, vor allem nach jedem Relaunch.
Häufige Fehler
Disallow: /aus der Testumgebung: Wird die Datei vom Staging-System übernommen, ist die ganze Website gesperrt. Das ist der häufigste und teuerste Fehler.- CSS- und JavaScript-Dateien sperren: Google muss Seiten so darstellen können wie ein Besucher. Gesperrte Ressourcen verschlechtern das Verständnis der Seite.
- Seiten sperren, die auf noindex stehen: Der Bot sieht das noindex nicht und die Adresse bleibt unter Umständen im Index.
- Groß- und Kleinschreibung übersehen:
/Admin/und/admin/sind zwei verschiedene Pfade. - Zu breite Muster: Ein
Disallow: /produktsperrt auch/produkte/und/produktion.
Weiterführende Begriffe
- Sitemap.xml: URLs für Suchmaschinen melden
- Noindex-Tag: eine Seite aus dem Index nehmen
- Crawl Budget: wie viele Seiten ein Bot abruft
- KI-Crawler: Bots der KI-Anbieter steuern
- llms.txt: vorgeschlagene Orientierungsdatei für Sprachmodelle
Quellen
- IETF: RFC 9309: Robots Exclusion Protocol (2022)
- Google Search Central: Einführung in robots.txt