Contenido duplicado
Contenido duplicado significa que el mismo contenido, o uno muy parecido, es accesible desde varias direcciones, en el mismo sitio web o en sitios distintos. Casi siempre surge sin querer por la técnica. Google no lo castiga de forma general, pero elige una versión para los resultados de búsqueda, y no tiene por qué ser la que tú quieres.
¿Es una penalización?
No. En la documentación de Google, el contenido duplicado no es en sí una infracción. Las políticas de spam se dirigen contra otras cosas, como el scraping: copiar contenido ajeno sin aportar valor propio, modificarlo solo ligeramente o tomar feeds de otros sitios sin beneficio para los visitantes. También son una infracción las páginas generadas en masa y apenas distinguibles (páginas puerta). Quien no hace nada de eso no tiene un problema de penalización con los duplicados técnicos, sino un problema de selección: Google decide qué dirección muestra.
Causas típicas
- varias grafías de la misma dirección: http y https, con y sin www, con y sin barra final
- parámetros de URL para seguimiento, ordenación, filtros o sesiones, por ejemplo
?gclid= - una página en varias categorías o rutas
- versiones para imprimir y direcciones móviles separadas
- productos con descripciones casi iguales o textos del fabricante
- contenido copiado en otros sitios web
Por qué debes fijar una dirección
Si no indicas ninguna dirección, Google elige la que considera mejor. Si la fijas, obtienes ventajas:
- Decides qué dirección aparece en los resultados de búsqueda, por ejemplo la limpia en lugar de la que lleva un parámetro de seguimiento.
- Las señales, como los backlinks a distintas variantes, se reúnen en una sola dirección.
- Las métricas se leen mejor cuando un contenido tiene una sola dirección.
- El rastreador pierde menos tiempo con duplicados (consulta Presupuesto de crawl).
Comparación de métodos
| Método | Fuerza | Uso |
|---|---|---|
| Redirección 301 | señal fuerte | cuando la página duplicada debe desaparecer |
rel="canonical" en el HTML | señal fuerte | cuando ambas páginas siguen accesibles, solo en páginas HTML |
rel="canonical" como cabecera HTTP | señal fuerte | para archivos sin HTML, como PDF |
| Inclusión en el sitemap | señal débil | como complemento para respaldar la dirección preferida |
Los métodos se pueden combinar. De las dos variantes de canonical deberías usar solo una, porque ambas juntas dan más pie a errores. Google recomienda además un canonical autorreferenciado, es decir, una página que apunta a sí misma.
<!-- en el head de la página duplicada Y de la principal -->
<link rel="canonical" href="https://www.tudominio.es/tu-pagina">
# Apache: redirigir http a https con 301
RewriteEngine On
RewriteCond %{HTTPS} off
RewriteRule ^(.*)$ https://www.tudominio.es/$1 [R=301,L]
Cómo elige Google la dirección
Google evalúa las señales mencionadas y añade características del sitio web. Por lo general prefiere https frente a http, y prefiere las direcciones que forman parte de un clúster de hreflang. Un canonical es, por tanto, una indicación fuerte, pero no una garantía.
Páginas multilingües y casos parecidos
Las páginas en distintos idiomas no son duplicados, aunque se correspondan en contenido. Enlázalas con hreflang. En páginas muy parecidas en el mismo idioma para distintos países, hreflang también ayuda. Las simples variantes que solo genera un filtro, en cambio, deberías reunirlas o, si no tienen valor de búsqueda, marcarlas con noindex. Con un canonical que apunta a otra página, la variante desaparece de los resultados.
Errores frecuentes
- Canonical a una página totalmente distinta: El contenido debe corresponder a la página a la que apuntas.
- Canonical y noindex a la vez: Eso envía señales contradictorias.
- Direcciones duplicadas en el sitemap: El sitemap solo debería contener la dirección principal.
- Canonical en el body en lugar del head: El elemento va en la cabecera de la página.
- Reaccionar ante penalizaciones que no existen: Es más importante que la versión correcta aparezca en los resultados.
Términos relacionados
- Sitemap.xml: notificar direcciones preferidas
- Etiqueta noindex: sacar páginas del índice
- Hreflang: enlazar versiones de idioma
- Paginación: marcar bien las secuencias de páginas
Fuentes
- Google Search Central: Cómo especificar una URL canónica con rel="canonical" y otros métodos
- Google Search Central: Políticas de spam de la Búsqueda de Google (scraping, páginas puerta)