Presupuesto de crawl

Actualizado: 3 min de lectura Redacción de SEOFuxx

El presupuesto de crawl es la cantidad de páginas que Google puede y quiere solicitar en tu sitio web. Resulta de dos magnitudes: cuánto aguanta tu servidor (capacidad de rastreo) y cuánto quiere Google solicitar tus páginas (demanda de rastreo). Para la mayoría de los sitios no es un tema, pero en sitios muy grandes ayuda a decidir con qué rapidez llegan al índice las páginas nuevas y modificadas.

Para quién es importante

Google da dos valores orientativos, no límites estrictos:

  • Sitios con más de un millón de páginas únicas cuyo contenido cambia más o menos cada semana
  • Sitios con más de 10.000 páginas únicas cuyo contenido cambia a diario
  • Sitios en los que muchas direcciones figuran en Search Console como «Detectada: actualmente sin indexar»

Los demás normalmente no tienen que ocuparse de ello. Basta un sitemap actualizado y un vistazo al informe de indexación de páginas.

Los dos componentes

MagnitudSignificadoQué la influye
Capacidad de rastreoLímite superior para que Google no sobrecargue tu servidorTiempos de respuesta y errores: respuestas estables y rápidas la aumentan, la lentitud, los errores 5xx y el estado 429 la reducen
Demanda de rastreoCuánto quiere Google solicitar tus páginasTamaño del sitio, frecuencia de cambios, calidad y popularidad de las páginas, además de grandes acontecimientos como un traslado

La capacidad se la reparten todos los rastreadores de Google. Si uno solicita mucho, queda menos para los demás. La demanda la influyes sobre todo con el número de direcciones: muchas direcciones duplicadas o sin importancia atan tiempo de rastreo.

Qué puedes mejorar

  • Reunir contenido duplicado: con un canonical o una redirección (consulta Contenido duplicado)
  • Bloquear direcciones sin importancia: como combinaciones de filtros o ID de sesión mediante robots.txt, si nunca deben rastrearse
  • Responder bien a las páginas eliminadas: con 404 o 410, no con una página vacía y estado 200 (soft 404)
  • Cuidar el sitemap: mantenerlo actualizado y poner lastmod solo en cambios reales
  • Evitar cadenas de redirecciones: Cada paso cuesta una solicitud
  • Acelerar el servidor: tiempos de respuesta más cortos permiten más solicitudes, y ayuda la caché HTTP con el estado 304

Lo que no ayuda

  • noindex como medida de ahorro: Google sigue solicitando la página para comprobar el noindex. Eso no ahorra tiempo de rastreo.
  • robots.txt como redistribución temporal: El presupuesto liberado no pasa automáticamente a otras páginas mientras Google no alcance el límite de capacidad. El robots.txt está pensado para direcciones que nunca quieres que se rastreen.

Cómo comprobarlo

  • El informe «Estadísticas de rastreo» en la configuración de Google Search Console muestra solicitudes por día, tiempos de respuesta y errores.
  • El informe de indexación de páginas indica qué direcciones están detectadas pero sin indexar.
  • Los registros del servidor muestran qué zonas solicitan realmente los bots y con qué frecuencia.

Errores frecuentes

  • Optimizar el presupuesto de crawl aunque el sitio sea pequeño: El problema casi siempre está en otra parte, como el contenido o los enlaces.
  • Espacios de direcciones infinitos: Calendarios, filtros y páginas de búsqueda generan variantes sin fin.
  • Páginas de error con estado 200: Se tratan como páginas reales y se siguen rastreando.
  • Servidor lento: Quien hace esperar mucho a Google recibe menos solicitudes.

Términos relacionados

Fuentes

¿Te resulta útil este contenido?

·