robots.txt

Actualizado: 4 min de lectura Redacción de SEOFuxx

El robots.txt es un archivo de texto en el directorio raíz de un sitio web (/robots.txt) con el que indicas a los rastreadores qué zonas pueden solicitar y cuáles no. Controla el rastreo, no la indexación, y suele contener también la referencia al sitemap.

Cómo funciona el archivo

Antes de solicitar una página, un rastreador carga el robots.txt del dominio y comprueba si hay una regla para su nombre. Desde 2022 el formato está normalizado como RFC 9309. El archivo se compone de grupos que empiezan cada uno con una línea User-agent y reúnen debajo las reglas de ese bot.

DirectivaSignificado
User-agentNombre del bot al que se aplica el grupo. * representa a todos los bots que no tienen grupo propio.
DisallowRutas que el bot no debe solicitar. Un valor vacío no bloquea nada.
AllowExcepción dentro de una zona bloqueada
SitemapDirección completa de un sitemap, independiente de los grupos

En las rutas, * representa cualquier número de caracteres y $ el final de la dirección. Si coinciden varias reglas, Google aplica la más específica, es decir, la de la ruta más larga. Las rutas distinguen mayúsculas y minúsculas, los nombres de bot no.

# robots.txt: ejemplo de una configuración habitual
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /tmp/
Disallow: /*?sessionid=

# Añadir el sitemap
Sitemap: https://www.tudominio.es/sitemap.xml

Dónde tiene que estar el archivo

  • Directamente en el directorio raíz, accesible en https://www.tudominio.es/robots.txt. En una subcarpeta no se encuentra.
  • Solo vale para el host, el puerto y el protocolo en los que se sirve. Cada subdominio necesita su propio archivo.
  • El archivo es texto UTF-8. Google lee solo los primeros 500 KiB.
  • Si el servidor responde con 404, todo cuenta como permitido. Con un error de servidor (5xx), Google primero pausa el rastreo del sitio web y después usa durante hasta 30 días la última versión guardada.

Lo que el robots.txt no puede hacer

  • No protege contenidos. El archivo es de lectura pública y no todos los bots lo respetan. Lo confidencial va detrás de un inicio de sesión.
  • No impide la indexación. Una dirección bloqueada puede aparecer igualmente en el índice si otras páginas enlazan a ella, aunque sin descripción.
  • No sustituye a noindex. Quien quiera sacar una página del índice usa la etiqueta noindex. Para ello el rastreador debe poder solicitar la página; si no, nunca ve la instrucción. Google no evalúa desde 2019 una línea noindex en el robots.txt.
  • No regula la velocidad de rastreo en Google. Google ignora Crawl-delay; otros buscadores lo evalúan en parte.

La metaetiqueta robots correspondiente en el HTML:

<!-- Indexar la página y seguir los enlaces (predeterminado) -->
<meta name="robots" content="index, follow">

<!-- NO indexar la página -->
<meta name="robots" content="noindex, nofollow">

robots.txt y rastreadores de IA

Los bots de los proveedores de IA también se rigen por el robots.txt. En la mayoría de los proveedores, el entrenamiento y la búsqueda tienen nombres propios y se pueden permitir o bloquear por separado; más en Rastreadores de IA.

Comprobar y probar

  • Abre el archivo en el navegador y comprueba la dirección, el estado 200 y el contenido.
  • El informe «robots.txt» de Google Search Console muestra qué versión ha cargado Google y si hay errores.
  • Comprueba una por una las direcciones importantes para ver si una regla las bloquea, sobre todo tras cada relanzamiento.

Errores frecuentes

  • Disallow: / heredado del entorno de pruebas: Si se copia el archivo del sistema de staging, todo el sitio web queda bloqueado. Es el error más frecuente y más caro.
  • Bloquear archivos CSS y JavaScript: Google tiene que poder mostrar las páginas como las ve un visitante. Los recursos bloqueados empeoran la comprensión de la página.
  • Bloquear páginas con noindex: El bot no ve el noindex y la dirección puede quedarse en el índice.
  • Pasar por alto mayúsculas y minúsculas: /Admin/ y /admin/ son dos rutas distintas.
  • Patrones demasiado amplios: Un Disallow: /producto bloquea también /productos/ y /produccion.

Términos relacionados

Fuentes

¿Te resulta útil este contenido?

·