De SEOFUXX Crawler
Onze crawler verzamelt openbaar toegankelijke links om een onafhankelijke backlinkindex van het Duitse web op te bouwen. Hier lees je hoe hij werkt, welke gegevens hij bewaart en hoe je de toegang regelt.
Herkenbare botnaam
seofuxx-crawler
Volledige user agent
Mozilla/5.0 (compatible; seofuxx-crawler/1.2; +https://www.seofuxx.com/seofuxx-crawler)
Huidig crawlgebied
Minimale afstand per host
Paginalimiet per host en ronde
Permanent opgeslagen pagina-inhoud
Wat de crawler doet
SEOFUXX verzamelt de gegevens voor de backlinkindex zelf. De crawler bezoekt websites, haalt links eruit en maakt er een doorzoekbare linkgraaf van.
Openbare pagina's ophalen
De crawler bezoekt openbaar toegankelijke HTML-pagina's binnen het vrijgegeven crawlgebied. De eerste fase richt zich op .de-websites.
Links uitlezen
Interne en externe links, linkattributen en ankerteksten worden uitgelezen. Nieuwe interne URL's kunnen aan de crawlwachtrij worden toegevoegd.
Een linkgraaf opbouwen
De gevonden verbindingen komen in onze eigen backlinkindex, zodat verwijzende pagina's en veranderingen door de tijd zichtbaar worden.
Voorzichtig en controleerbaar
De crawler is ontworpen om afzonderlijke websites zo min mogelijk te belasten en beheerders de controle te geven.
robots.txt wordt gerespecteerd
Regels voor seofuxx-crawler en algemene regels worden volgens RFC 9309 verwerkt. Geblokkeerde paden worden niet bezocht.
Afstand tussen verzoeken
Verzoeken aan dezelfde host gebeuren na elkaar en met minstens twee seconden tussenruimte. Een langere Crawl-delay krijgt voorrang.
Vaste technische grenzen
Het aantal pagina's, de antwoordgrootte en de wachttijd zijn begrensd. Een algemene snelheidslimiet begrenst ook de totale belasting.
Voorzichtig bij fouten
Als robots.txt door een serverfout niet betrouwbaar kan worden opgehaald, behandelt de crawler de host uit voorzorg als geblokkeerd.
Wat we bewaren
We bewaren alleen gegevens die nodig zijn voor de linkgraaf en de technische crawlbesturing.
- Bron- en doel-URL's van gevonden links
- Ankerteksten en linkattributen zoals rel
- Technische metadata zoals status en tijdstip van ophalen
Wat we niet permanent bewaren
De pagina-inhoud wordt alleen in het geheugen verwerkt om links en technische metadata te verzamelen.
- Geen permanente kopie van de HTML-inhoud
- Geen afbeeldingen, video's of andere paginabestanden
- Geen inhoud uit geblokkeerde of niet-openbare gedeelten
Toegang regelen met robots.txt
Je kunt afzonderlijke paden of je hele website blokkeren voor de SEOFUXX Crawler. Voeg de getoonde regels toe aan robots.txt voor een volledige blokkade.
Wijzigingen in robots.txt worden bij het volgende bezoek gevolgd. Vervang / door het gewenste pad om alleen een deel te blokkeren.
Volledig blokkeren
User-agent: seofuxx-crawler
Disallow: /
Vragen of een probleem met onze crawler?
Stuur ons het betreffende domein en een korte beschrijving. We bekijken de activiteit en helpen je direct verder.
Heb je iets aan deze inhoud?