Duplicate content

Bijgewerkt: 3 min. leestijd SEOFuxx-redactie

Duplicate content betekent dat dezelfde of zeer vergelijkbare inhoud op meerdere adressen bereikbaar is, op dezelfde website of op verschillende. Meestal ontstaat het zonder opzet door de techniek. Google straft het niet over de hele linie, maar kiest één versie voor de zoekresultaten, en dat is niet per se degene die jij wilt.

Is het een straf?

Nee. In de documentatie van Google is duplicate content op zich geen overtreding. Het spambeleid richt zich tegen andere dingen, zoals scraping: inhoud van anderen kopiëren zonder eigen meerwaarde, alleen licht aanpassen of feeds van andere sites overnemen zonder nut voor bezoekers. Ook massaal geproduceerde, nauwelijks te onderscheiden pagina's (doorway-pagina's) zijn een overtreding. Wie dat niet doet, heeft bij technische duplicaten geen strafprobleem maar een selectieprobleem: Google beslist welk adres het toont.

Typische oorzaken

  • meerdere schrijfwijzen van hetzelfde adres: http en https, met en zonder www, met en zonder slash aan het eind
  • URL-parameters voor tracking, sortering, filters of sessies, bijvoorbeeld ?gclid=
  • één pagina in meerdere categorieën of paden
  • afdrukversies en aparte mobiele adressen
  • producten met bijna dezelfde beschrijvingen of fabrikantteksten
  • gekopieerde inhoud op andere websites

Waarom je een adres moet vastleggen

Geef je geen adres op, dan kiest Google het adres dat het het beste vindt. Leg je het vast, dan heb je voordelen:

  • Jij bepaalt welk adres in de zoekresultaten verschijnt, bijvoorbeeld het schone in plaats van dat met een trackingparameter.
  • De signalen, zoals backlinks naar verschillende varianten, komen op één adres samen.
  • Meetwaarden zijn gemakkelijker te lezen als een inhoud maar één adres heeft.
  • De crawler besteedt minder tijd aan duplicaten (zie Crawlbudget).

Methoden vergeleken

MethodeSterkteGebruik
301-doorverwijzingsterk signaalals de dubbele pagina moet verdwijnen
rel="canonical" in de HTMLsterk signaalals beide pagina's bereikbaar blijven, alleen bij HTML-pagina's
rel="canonical" als HTTP-headersterk signaalbij bestanden zonder HTML, zoals pdf's
Opname in de sitemapzwak signaalals aanvulling om het gewenste adres te ondersteunen

De methoden kunnen worden gecombineerd. Van de twee canonical-varianten moet je er maar één gebruiken, omdat beide samen foutgevoeliger zijn. Google adviseert bovendien een zelfverwijzende canonical, dus een pagina die naar zichzelf verwijst.

<!-- in de head van de dubbele EN de hoofdpagina -->
<link rel="canonical" href="https://www.jouwdomein.nl/jouw-pagina">
# Apache: http met 301 doorsturen naar https
RewriteEngine On
RewriteCond %{HTTPS} off
RewriteRule ^(.*)$ https://www.jouwdomein.nl/$1 [R=301,L]

Hoe Google het adres kiest

Google weegt de genoemde signalen en betrekt eigenschappen van de website erbij. Het geeft doorgaans de voorkeur aan https boven http, en aan adressen die in een hreflang-cluster staan. Een canonical is dus een sterke aanwijzing, maar geen garantie.

Meertalige pagina's en vergelijkbare gevallen

Pagina's in verschillende talen zijn geen duplicaten, ook al komen ze inhoudelijk overeen. Koppel ze met hreflang. Bij zeer vergelijkbare pagina's in dezelfde taal voor verschillende landen helpt hreflang ook. Pure varianten die alleen een filter maakt, moet je daarentegen bundelen of, als ze geen zoekwaarde hebben, voorzien van noindex. Bij een canonical naar een andere pagina verdwijnt de variant uit de resultaten.

Veelgemaakte fouten

  • Canonical naar een heel andere pagina: De inhoud moet bij de pagina passen waar je naar verwijst.
  • Canonical en noindex tegelijk: Dat geeft tegenstrijdige signalen.
  • Dubbele adressen in de sitemap: De sitemap moet alleen het hoofdadres bevatten.
  • Canonical in de body in plaats van de head: Het element hoort in het hoofd van de pagina.
  • Reageren op straffen die niet bestaan: Belangrijker is dat de juiste versie in de resultaten staat.

Verwante begrippen

Bronnen

Heb je iets aan deze inhoud?

·