El SEOFUXX Crawler
Nuestro crawler recopila enlaces de acceso público para crear un índice de backlinks independiente de la web alemana. Aquí puedes saber cómo funciona, qué datos guarda y cómo controlar su acceso.
Nombre identificable del bot
seofuxx-crawler
User agent completo
Mozilla/5.0 (compatible; seofuxx-crawler/1.2; +https://www.seofuxx.com/seofuxx-crawler)
Ámbito actual del rastreo
Intervalo mínimo por host
Límite de páginas por host y pasada
Contenido de página guardado permanentemente
Qué hace el crawler
SEOFUXX recopila por sí mismo los datos de su índice de backlinks. El crawler visita sitios web, extrae enlaces y crea con ellos un grafo de enlaces consultable.
Visitar páginas públicas
El crawler visita páginas HTML de acceso público dentro del ámbito autorizado. La primera fase se centra en sitios web .de.
Extraer enlaces
Se extraen enlaces internos y externos, atributos de enlace y textos ancla. Las nuevas URLs internas pueden añadirse a la cola de rastreo.
Crear un grafo de enlaces
Las conexiones encontradas pasan a nuestro propio índice de backlinks, que permite detectar páginas de referencia y cambios a lo largo del tiempo.
Cuidadoso y controlable
El crawler está diseñado para reducir la carga de cada sitio y mantener el control en manos de sus administradores.
Respeta robots.txt
Las reglas para seofuxx-crawler y las reglas generales se evalúan conforme a RFC 9309. Las rutas bloqueadas no se visitan.
Intervalo entre solicitudes
Las solicitudes al mismo host son secuenciales y tienen al menos dos segundos de separación. Un Crawl-delay mayor tiene prioridad.
Límites técnicos fijos
El número de páginas, el tamaño de respuesta y el tiempo de espera están limitados. Un límite global también controla la carga total.
Precaución ante errores
Si robots.txt no puede obtenerse de forma fiable por un error del servidor, el crawler trata el host como bloqueado por precaución.
Qué guardamos
Solo guardamos los datos necesarios para el grafo de enlaces y la gestión técnica del rastreo.
- URLs de origen y destino de los enlaces encontrados
- Textos ancla y atributos de enlace como rel
- Metadatos técnicos como estado y momento de la consulta
Qué no guardamos permanentemente
El contenido se procesa solo en memoria para extraer enlaces y metadatos técnicos.
- Ninguna copia permanente del contenido HTML
- Ninguna imagen, vídeo u otro archivo de la página
- Ningún contenido de áreas bloqueadas o no públicas
Controlar el acceso con robots.txt
Puedes bloquear rutas concretas o todo tu sitio para SEOFUXX Crawler. Añade las líneas mostradas a tu robots.txt para bloquearlo por completo.
Los cambios en robots.txt se aplican en la siguiente visita. Para bloquear un área concreta, sustituye / por la ruta correspondiente.
Bloqueo completo
User-agent: seofuxx-crawler
Disallow: /
¿Tienes preguntas o un problema con nuestro crawler?
Envíanos el dominio afectado y una breve descripción. Revisaremos la actividad y te ayudaremos directamente.
¿Te resulta útil este contenido?