Presupuesto de crawl
El presupuesto de crawl es la cantidad de páginas que Google puede y quiere solicitar en tu sitio web. Resulta de dos magnitudes: cuánto aguanta tu servidor (capacidad de rastreo) y cuánto quiere Google solicitar tus páginas (demanda de rastreo). Para la mayoría de los sitios no es un tema, pero en sitios muy grandes ayuda a decidir con qué rapidez llegan al índice las páginas nuevas y modificadas.
Para quién es importante
Google da dos valores orientativos, no límites estrictos:
- Sitios con más de un millón de páginas únicas cuyo contenido cambia más o menos cada semana
- Sitios con más de 10.000 páginas únicas cuyo contenido cambia a diario
- Sitios en los que muchas direcciones figuran en Search Console como «Detectada: actualmente sin indexar»
Los demás normalmente no tienen que ocuparse de ello. Basta un sitemap actualizado y un vistazo al informe de indexación de páginas.
Los dos componentes
| Magnitud | Significado | Qué la influye |
|---|---|---|
| Capacidad de rastreo | Límite superior para que Google no sobrecargue tu servidor | Tiempos de respuesta y errores: respuestas estables y rápidas la aumentan, la lentitud, los errores 5xx y el estado 429 la reducen |
| Demanda de rastreo | Cuánto quiere Google solicitar tus páginas | Tamaño del sitio, frecuencia de cambios, calidad y popularidad de las páginas, además de grandes acontecimientos como un traslado |
La capacidad se la reparten todos los rastreadores de Google. Si uno solicita mucho, queda menos para los demás. La demanda la influyes sobre todo con el número de direcciones: muchas direcciones duplicadas o sin importancia atan tiempo de rastreo.
Qué puedes mejorar
- Reunir contenido duplicado: con un canonical o una redirección (consulta Contenido duplicado)
- Bloquear direcciones sin importancia: como combinaciones de filtros o ID de sesión mediante robots.txt, si nunca deben rastrearse
- Responder bien a las páginas eliminadas: con 404 o 410, no con una página vacía y estado 200 (soft 404)
- Cuidar el sitemap: mantenerlo actualizado y poner
lastmodsolo en cambios reales - Evitar cadenas de redirecciones: Cada paso cuesta una solicitud
- Acelerar el servidor: tiempos de respuesta más cortos permiten más solicitudes, y ayuda la caché HTTP con el estado 304
Lo que no ayuda
- noindex como medida de ahorro: Google sigue solicitando la página para comprobar el noindex. Eso no ahorra tiempo de rastreo.
- robots.txt como redistribución temporal: El presupuesto liberado no pasa automáticamente a otras páginas mientras Google no alcance el límite de capacidad. El robots.txt está pensado para direcciones que nunca quieres que se rastreen.
Cómo comprobarlo
- El informe «Estadísticas de rastreo» en la configuración de Google Search Console muestra solicitudes por día, tiempos de respuesta y errores.
- El informe de indexación de páginas indica qué direcciones están detectadas pero sin indexar.
- Los registros del servidor muestran qué zonas solicitan realmente los bots y con qué frecuencia.
Errores frecuentes
- Optimizar el presupuesto de crawl aunque el sitio sea pequeño: El problema casi siempre está en otra parte, como el contenido o los enlaces.
- Espacios de direcciones infinitos: Calendarios, filtros y páginas de búsqueda generan variantes sin fin.
- Páginas de error con estado 200: Se tratan como páginas reales y se siguen rastreando.
- Servidor lento: Quien hace esperar mucho a Google recibe menos solicitudes.
Términos relacionados
- Sitemap.xml: notificar direcciones y cambios
- robots.txt: bloquear el rastreo de forma selectiva
- Contenido duplicado: reunir variantes
- Enlaces rotos: ordenar redirecciones y páginas de error
Fuentes
- Google Search Central: Gestionar el presupuesto de rastreo de sitios grandes