KI-Crawler
KI-Crawler sind Bots, mit denen KI-Anbieter Webseiten abrufen, entweder um Trainingsdaten für ihre Modelle zu sammeln oder um bei einer Nutzeranfrage aktuelle Inhalte zu laden. Viele Anbieter verwenden dafür getrennte User-Agents, sodass sich Training und Suche einzeln steuern lassen.
Drei Arten von Zugriffen
Bei den meisten Anbietern lassen sich drei Zwecke unterscheiden:
- Training: Der Bot sammelt Texte, die später in das Training neuer Modellversionen einfließen können.
- Suche: Der Bot baut einen Index auf, aus dem das System bei Fragen Quellen auswählt und zitiert.
- Abruf im Auftrag eines Nutzers: Der Bot lädt genau die Seite, die ein Nutzer im Chat genannt hat oder die das System für eine Antwort braucht.
| Anbieter | Training | Suche | Abruf für Nutzer |
|---|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot | ChatGPT-User |
| Anthropic | ClaudeBot | Claude-SearchBot | Claude-User |
| Perplexity | – | PerplexityBot | Perplexity-User |
| Google-Extended (Token) | Googlebot | – | |
| Common Crawl | CCBot | – | – |
Google-Extended ist kein eigener Crawler, sondern ein Token für die robots.txt. Es regelt, ob Inhalte für das Training und Grounding von Gemini verwendet werden dürfen, und hat keinen Einfluss auf die Google-Suche und die AI Overviews. Für sie gelten die Steuerungen der Google-Suche: Eine Seite muss indexiert und für Snippets zugelassen sein, um als Quelle verlinkt zu werden. Wer dort nicht erscheinen will, schränkt die Darstellung in der Suche selbst ein, zum Beispiel mit nosnippet.
Steuerung über die robots.txt
Über die robots.txt legst du getrennt fest, ob deine Inhalte für das Training verwendet werden dürfen und ob sie in KI-Suchen erscheinen können. Wer die Such-Crawler blockiert, kann in den entsprechenden Systemen nicht als Quelle zitiert werden.
# KI-Training untersagen, KI-Suche erlauben
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Eine Sperre für Trainings-Bots betrifft nur künftiges Training. Was ein Modell bereits aus früheren Daten kennt, nimmt sie nicht zurück.
Was die robots.txt nicht leistet
- Sie ist eine Bitte, keine Sperre. Seriöse Anbieter halten sich daran, durchsetzen lässt sich das technisch nicht.
- Abrufe im Auftrag von Nutzern werden nach den Angaben einiger Anbieter nicht oder nur eingeschränkt nach der robots.txt behandelt, weil ein Mensch den Abruf ausgelöst hat. Lies dazu die Dokumentation des jeweiligen Anbieters.
- Der User-Agent lässt sich fälschen. Wer sicher gehen will, prüft zusätzlich die IP-Adresse. Mehrere Anbieter veröffentlichen die Adressbereiche ihrer Crawler.
Crawler erkennen und prüfen
In den Server-Logs siehst du, welche Bots deine Seiten abrufen und wie oft. Filtere nach den Namen aus der Tabelle. Prüfe außerdem, ob ein vorgeschalteter Dienst wie ein CDN oder eine Firewall KI-Bots pauschal blockiert. Manche Anbieter bieten dafür Schalter oder Standardregeln an, und dann nützt die beste robots.txt nichts.
Viele KI-Crawler führen kein JavaScript aus. Wichtige Inhalte sollten deshalb im ausgelieferten HTML stehen (siehe JavaScript-SEO).
Häufige Fehler
- Alle KI-Bots pauschal sperren: Wer auch die Such-Crawler ausschließt, taucht in diesen Systemen nicht als Quelle auf.
- Nur einen Bot eines Anbieters bedenken: Training, Suche und Nutzerabruf sind getrennte Namen. Eine Regel für GPTBot gilt nicht für OAI-SearchBot.
- Die Namen falsch schreiben: Die robots.txt vergleicht den Namen des Bots. Ein Tippfehler macht die Regel wirkungslos.
- Nie nachsehen: Anbieter ergänzen und ändern ihre Bots. Prüfe die Liste ab und zu gegen die aktuelle Dokumentation.
Weiterführende Begriffe
- robots.txt: Zugriff auf deine Website regeln
- llms.txt: vorgeschlagene Orientierungsdatei für Sprachmodelle
- Trainingsdaten: woher Modelle ihr Wissen haben
- RAG (Retrieval-Augmented Generation): wie KI-Systeme Quellen abrufen
- GEO (Generative Engine Optimization): Inhalte für KI-Antworten optimieren
Quellen
- OpenAI: Overview of OpenAI Crawlers
- Anthropic: Does Anthropic crawl data from the web?
- Perplexity: Perplexity Crawlers
- Google Search Central: Übersicht über die Crawler von Google
- Google Search Central: KI-Funktionen und deine Website