Der SEOFUXX Crawler
Unser Crawler erfasst öffentlich erreichbare Links, um einen unabhängigen Backlinkindex des deutschen Webs aufzubauen. Hier erfährst du, wie er arbeitet, welche Daten er speichert und wie du seine Zugriffe steuerst.
Erkennbarer Bot-Name
seofuxx-crawler
Vollständiger User-Agent
Mozilla/5.0 (compatible; seofuxx-crawler/1.2; +https://www.seofuxx.com/seofuxx-crawler)
Aktueller Crawl-Bereich
Mindestabstand pro Host
Seitenlimit pro Host und Durchlauf
Dauerhaft gespeicherter Seiteninhalt
Was der Crawler macht
SEOFUXX erhebt die Daten für den Backlinkindex selbst. Der Crawler besucht Websites, extrahiert Verlinkungen und macht daraus einen durchsuchbaren Linkgraphen.
Öffentliche Seiten abrufen
Der Crawler besucht öffentlich erreichbare HTML-Seiten im freigegebenen Crawl-Bereich. In der ersten Stufe konzentriert er sich auf .de-Websites.
Links extrahieren
Aus den Seiten werden interne und externe Links, Linkattribute und Ankertexte ausgelesen. Neue interne URLs können in die Crawl-Warteschlange gelangen.
Linkgraph aufbauen
Die gefundenen Verbindungen fließen in unseren eigenen Backlinkindex. So lassen sich verweisende Seiten und Veränderungen über die Zeit erkennen.
Rücksichtsvoll und kontrollierbar
Der Crawler ist so gebaut, dass einzelne Websites geschont werden und Betreiber die Kontrolle behalten.
robots.txt wird respektiert
Regeln für seofuxx-crawler und allgemeine Regeln werden nach RFC 9309 ausgewertet. Gesperrte Pfade werden nicht besucht.
Abstand zwischen Anfragen
Anfragen an denselben Host erfolgen nacheinander und mit mindestens zwei Sekunden Abstand. Ein längeres Crawl-delay hat Vorrang.
Feste technische Grenzen
Seitenzahl, Antwortgröße und Wartezeit sind begrenzt. Zusätzlich deckelt eine globale Ratenbegrenzung die Gesamtlast.
Vorsicht bei Fehlern
Ist die robots.txt wegen eines Serverfehlers nicht verlässlich abrufbar, behandelt der Crawler den Host vorsorglich als gesperrt.
Was wir speichern
Gespeichert werden nur Daten, die für den Linkgraphen und die technische Crawl-Steuerung erforderlich sind.
- Quell- und Ziel-URLs gefundener Links
- Ankertexte und Linkattribute wie rel
- Technische Metadaten wie Status und Zeitpunkt des Abrufs
Was wir nicht dauerhaft speichern
Der Seiteninhalt wird nur im Arbeitsspeicher verarbeitet, um Links und technische Metadaten zu extrahieren.
- Keine dauerhafte Kopie des HTML-Inhalts
- Keine Bilder, Videos oder anderen Seitendateien
- Keine Inhalte aus gesperrten oder nicht öffentlichen Bereichen
Zugriff über robots.txt steuern
Du kannst einzelne Pfade oder deine gesamte Website für den SEOFUXX Crawler sperren. Für eine vollständige Sperre ergänze deine robots.txt um die gezeigten Zeilen.
robots.txt-Änderungen werden beim nächsten Besuch berücksichtigt. Nutze für einzelne Bereiche statt / einfach den gewünschten Pfad.
Vollständige Sperre
User-agent: seofuxx-crawler
Disallow: /
Fragen oder ein Problem mit unserem Crawler?
Schick uns die betroffene Domain und eine kurze Beschreibung. Wir prüfen den Vorgang und helfen dir direkt weiter.
Ist dieser Inhalt hilfreich?