KI-Crawler in der robots.txt erlauben oder blocken?

1 Weergaven 2 Reacties

Wir sind ein kleiner Fachverlag. In den Logs tauchen GPTBot, ClaudeBot und PerplexityBot auf. Soll ich sie sperren, oder verschenke ich dann Sichtbarkeit?
0
Das ist eine Abwägung, keine technische Frage. Wichtig ist, dass die Crawler nicht alle denselben Zweck haben:

- Trainings-Crawler (z. B. GPTBot von OpenAI) sammeln Inhalte für das Training von Modellen.
- Such- und Abruf-Crawler (z. B. OAI-SearchBot, ChatGPT-User, PerplexityBot) holen Seiten, um Antworten mit Quellen zu erzeugen. Sperrst du diese, kannst du dort in der Regel nicht als Quelle erscheinen.
- Google-Extended ist ein Steuerungs-Token für Googles KI-Produkte (z. B. Gemini). Es wirkt nicht auf die normale Google-Suche. Ob Inhalte in AI Overviews erscheinen, hängt an der normalen Indexierung und am Snippet-Status durch Googlebot.

Eine sinnvolle Aufteilung für viele Verlage:
1. Willst du Zitate und Verweise in Antworten, lass die Such-/Abruf-Crawler zu.
2. Willst du das Training mit deinen Inhalten nicht, sperr die Trainings-Crawler per User-agent und Disallow.
3. Schütz bezahlte Inhalte zusätzlich technisch (Login/Paywall), robots.txt ist eine Bitte, keine Sperre.

Die genauen User-Agent-Namen ändern sich, prüf sie in der aktuellen Dokumentation des jeweiligen Anbieters. Und schau nach einer Änderung in den Server-Logs, ob sie wirkt.
0
Danke, die Trennung zwischen Training und Suche war mir so nicht klar. Wir lassen die Such-Crawler zu und sperren das Training.
0

Heb je iets aan deze inhoud?

·