Etiqueta noindex
Con la instrucción noindex indicas a los buscadores que una página no debe incluirse en el índice de búsqueda. La colocas como metaetiqueta en la cabecera de la página o como cabecera HTTP. A diferencia del robots.txt, noindex no controla el rastreo, sino si una página solicitada aparece en los resultados.
Cómo establecer noindex
- Metaetiqueta en la cabecera de la página: vale para todos los buscadores que conocen la instrucción.
- Metaetiqueta solo para Google:
googleboten lugar derobotscomo nombre. - Cabecera HTTP
X-Robots-Tag: la solución para archivos sin HTML, como PDF, imágenes y vídeos.
<!-- para todos los buscadores -->
<meta name="robots" content="noindex">
<!-- solo para Google -->
<meta name="googlebot" content="noindex">
<!-- combinar noindex con otras instrucciones -->
<meta name="robots" content="noindex, nofollow">
# Apache: que los archivos PDF no se indexen
<FilesMatch ".pdf$">
Header set X-Robots-Tag "noindex"
</FilesMatch>
La página debe seguir siendo accesible
Google tiene que cargar la página para ver la instrucción. Si la página está bloqueada en el robots.txt, el noindex sigue invisible, y la dirección puede aparecer igualmente en los resultados si otras páginas enlazan a ella. Por eso no bloquees en el robots.txt una página que deba desaparecer del índice.
Google no evalúa una línea noindex en el propio robots.txt. Otros buscadores pueden interpretarla de otro modo y la página puede seguir apareciendo allí.
Cuánto tarda
Google solo se entera del cambio la próxima vez que solicita la página. En páginas poco importantes puede tardar meses. Con la inspección de URL de Google Search Console puedes provocar una nueva solicitud. Para una eliminación rápida, Google remite a la herramienta de eliminaciones de Search Console, que oculta una página temporalmente.
Cuándo encaja noindex
- Páginas sin valor de búsqueda propio: resultados de búsqueda internos, combinaciones de filtros, páginas de confirmación y de agradecimiento
- Zonas para visitantes que no deben aparecer en los resultados, como borradores o versiones para imprimir
- Archivos como PDF que no quieres en la búsqueda
Cuándo no
- Páginas duplicadas: Aquí es mejor un canonical, porque reúne las señales (consulta Contenido duplicado).
- Contenidos confidenciales: Noindex no oculta nada a los visitantes. Protege esas páginas con un inicio de sesión.
- Control del rastreo: Google sigue solicitando la página para comprobar el noindex. No sirve para ahorrar tiempo de rastreo (consulta Presupuesto de crawl).
Errores frecuentes
- noindex y bloqueo en el robots.txt a la vez: La instrucción no se lee nunca.
- Olvidar noindex en la plantilla: Una instrucción del entorno de pruebas que pasa al lanzamiento saca todo el sitio web del índice.
- Página en el sitemap y con noindex: Es contradictorio. En el sitemap solo deben estar las páginas que deben aparecer.
- Instrucciones distintas en móvil y escritorio: Google evalúa la versión móvil (consulta Indexación mobile-first).
- Confiar en el efecto de los enlaces: No está asegurado que los enlaces de una página noindex se sigan evaluando a largo plazo.
Términos relacionados
- robots.txt: controlar el rastreo
- Contenido duplicado: reunir páginas duplicadas
- Sitemap.xml: notificar direcciones a los buscadores
- Google Search Console: comprobar la indexación
Fuentes
- Google Search Central: Bloquear la indexación de la Búsqueda con noindex