Transparente Bot-Informationen

Der SEOFUXX Crawler

Unser Crawler erfasst öffentlich erreichbare Links, um einen unabhängigen Backlinkindex des deutschen Webs aufzubauen. Hier erfährst du, wie er arbeitet, welche Daten er speichert und wie du seine Zugriffe steuerst.

Erkennbarer Bot-Name

seofuxx-crawler

Vollständiger User-Agent

Mozilla/5.0 (compatible; seofuxx-crawler/1.2; +https://www.seofuxx.com/seofuxx-crawler)
.de

Aktueller Crawl-Bereich

2 s

Mindestabstand pro Host

100

Seitenlimit pro Host und Durchlauf

0 HTML

Dauerhaft gespeicherter Seiteninhalt

Was der Crawler macht

SEOFUXX erhebt die Daten für den Backlinkindex selbst. Der Crawler besucht Websites, extrahiert Verlinkungen und macht daraus einen durchsuchbaren Linkgraphen.

Öffentliche Seiten abrufen

Der Crawler besucht öffentlich erreichbare HTML-Seiten im freigegebenen Crawl-Bereich. In der ersten Stufe konzentriert er sich auf .de-Websites.

Links extrahieren

Aus den Seiten werden interne und externe Links, Linkattribute und Ankertexte ausgelesen. Neue interne URLs können in die Crawl-Warteschlange gelangen.

Linkgraph aufbauen

Die gefundenen Verbindungen fließen in unseren eigenen Backlinkindex. So lassen sich verweisende Seiten und Veränderungen über die Zeit erkennen.

Rücksichtsvoll und kontrollierbar

Der Crawler ist so gebaut, dass einzelne Websites geschont werden und Betreiber die Kontrolle behalten.

robots.txt wird respektiert

Regeln für seofuxx-crawler und allgemeine Regeln werden nach RFC 9309 ausgewertet. Gesperrte Pfade werden nicht besucht.

Abstand zwischen Anfragen

Anfragen an denselben Host erfolgen nacheinander und mit mindestens zwei Sekunden Abstand. Ein längeres Crawl-delay hat Vorrang.

Feste technische Grenzen

Seitenzahl, Antwortgröße und Wartezeit sind begrenzt. Zusätzlich deckelt eine globale Ratenbegrenzung die Gesamtlast.

Vorsicht bei Fehlern

Ist die robots.txt wegen eines Serverfehlers nicht verlässlich abrufbar, behandelt der Crawler den Host vorsorglich als gesperrt.

Was wir speichern

Gespeichert werden nur Daten, die für den Linkgraphen und die technische Crawl-Steuerung erforderlich sind.

  • Quell- und Ziel-URLs gefundener Links
  • Ankertexte und Linkattribute wie rel
  • Technische Metadaten wie Status und Zeitpunkt des Abrufs

Was wir nicht dauerhaft speichern

Der Seiteninhalt wird nur im Arbeitsspeicher verarbeitet, um Links und technische Metadaten zu extrahieren.

  • Keine dauerhafte Kopie des HTML-Inhalts
  • Keine Bilder, Videos oder anderen Seitendateien
  • Keine Inhalte aus gesperrten oder nicht öffentlichen Bereichen

Zugriff über robots.txt steuern

Du kannst einzelne Pfade oder deine gesamte Website für den SEOFUXX Crawler sperren. Für eine vollständige Sperre ergänze deine robots.txt um die gezeigten Zeilen.

robots.txt-Änderungen werden beim nächsten Besuch berücksichtigt. Nutze für einzelne Bereiche statt / einfach den gewünschten Pfad.

Vollständige Sperre

User-agent: seofuxx-crawler
Disallow: /

Fragen oder ein Problem mit unserem Crawler?

Schick uns die betroffene Domain und eine kurze Beschreibung. Wir prüfen den Vorgang und helfen dir direkt weiter.

Ist dieser Inhalt hilfreich?

·