Información transparente del bot

El SEOFUXX Crawler

Nuestro crawler recopila enlaces de acceso público para crear un índice de backlinks independiente de la web alemana. Aquí puedes saber cómo funciona, qué datos guarda y cómo controlar su acceso.

Nombre identificable del bot

seofuxx-crawler

User agent completo

Mozilla/5.0 (compatible; seofuxx-crawler/1.2; +https://www.seofuxx.com/seofuxx-crawler)
.de

Ámbito actual del rastreo

2 s

Intervalo mínimo por host

100

Límite de páginas por host y pasada

0 HTML

Contenido de página guardado permanentemente

Qué hace el crawler

SEOFUXX recopila por sí mismo los datos de su índice de backlinks. El crawler visita sitios web, extrae enlaces y crea con ellos un grafo de enlaces consultable.

Visitar páginas públicas

El crawler visita páginas HTML de acceso público dentro del ámbito autorizado. La primera fase se centra en sitios web .de.

Extraer enlaces

Se extraen enlaces internos y externos, atributos de enlace y textos ancla. Las nuevas URLs internas pueden añadirse a la cola de rastreo.

Crear un grafo de enlaces

Las conexiones encontradas pasan a nuestro propio índice de backlinks, que permite detectar páginas de referencia y cambios a lo largo del tiempo.

Cuidadoso y controlable

El crawler está diseñado para reducir la carga de cada sitio y mantener el control en manos de sus administradores.

Respeta robots.txt

Las reglas para seofuxx-crawler y las reglas generales se evalúan conforme a RFC 9309. Las rutas bloqueadas no se visitan.

Intervalo entre solicitudes

Las solicitudes al mismo host son secuenciales y tienen al menos dos segundos de separación. Un Crawl-delay mayor tiene prioridad.

Límites técnicos fijos

El número de páginas, el tamaño de respuesta y el tiempo de espera están limitados. Un límite global también controla la carga total.

Precaución ante errores

Si robots.txt no puede obtenerse de forma fiable por un error del servidor, el crawler trata el host como bloqueado por precaución.

Qué guardamos

Solo guardamos los datos necesarios para el grafo de enlaces y la gestión técnica del rastreo.

  • URLs de origen y destino de los enlaces encontrados
  • Textos ancla y atributos de enlace como rel
  • Metadatos técnicos como estado y momento de la consulta

Qué no guardamos permanentemente

El contenido se procesa solo en memoria para extraer enlaces y metadatos técnicos.

  • Ninguna copia permanente del contenido HTML
  • Ninguna imagen, vídeo u otro archivo de la página
  • Ningún contenido de áreas bloqueadas o no públicas

Controlar el acceso con robots.txt

Puedes bloquear rutas concretas o todo tu sitio para SEOFUXX Crawler. Añade las líneas mostradas a tu robots.txt para bloquearlo por completo.

Los cambios en robots.txt se aplican en la siguiente visita. Para bloquear un área concreta, sustituye / por la ruta correspondiente.

Bloqueo completo

User-agent: seofuxx-crawler
Disallow: /

¿Tienes preguntas o un problema con nuestro crawler?

Envíanos el dominio afectado y una breve descripción. Revisaremos la actividad y te ayudaremos directamente.

¿Te resulta útil este contenido?

·