Duplicate Content
Duplicate Content bedeutet, dass derselbe oder sehr ähnlicher Inhalt unter mehreren Adressen erreichbar ist, auf derselben Website oder auf verschiedenen. Meist entsteht das ohne Absicht durch die Technik. Google bestraft das nicht pauschal, wählt aber eine Version für die Suchergebnisse aus, und das ist nicht unbedingt die, die du willst.
Ist das eine Strafe?
Nein. In Googles Dokumentation gilt doppelter Inhalt an sich nicht als Verstoß. Die Spam-Richtlinien richten sich gegen andere Dinge, etwa Scraping: fremde Inhalte ohne eigenen Mehrwert zu kopieren, nur leicht zu verändern oder Feeds anderer Seiten ohne Nutzen für die Besucher zu übernehmen. Auch massenhaft erzeugte, kaum unterscheidbare Seiten (Doorway-Seiten) sind ein Verstoß. Wer nichts davon betreibt, hat bei technischen Duplikaten kein Strafproblem, sondern ein Auswahlproblem: Google entscheidet, welche Adresse es zeigt.
Typische Ursachen
- mehrere Schreibweisen derselben Adresse: http und https, mit und ohne www, mit und ohne Schrägstrich am Ende
- URL-Parameter für Tracking, Sortierung, Filter oder Sitzungen, zum Beispiel
?gclid= - eine Seite in mehreren Kategorien oder Pfaden
- Druckversionen und separate mobile Adressen
- Produkte mit fast gleichen Beschreibungen oder Herstellertexten
- kopierte Inhalte auf anderen Websites
Warum du eine Adresse festlegen solltest
Gibst du keine Adresse vor, wählt Google selbst die seiner Ansicht nach beste. Legst du sie fest, bekommst du Vorteile:
- Du bestimmst, welche Adresse in den Suchergebnissen erscheint, zum Beispiel die saubere statt der mit Tracking-Parameter.
- Die Signale, etwa Backlinks auf verschiedene Varianten, laufen auf einer Adresse zusammen.
- Messwerte lassen sich leichter lesen, wenn ein Inhalt nur eine Adresse hat.
- Der Crawler verbringt weniger Zeit mit Duplikaten (siehe Crawl Budget).
Methoden im Vergleich
| Methode | Stärke | Einsatz |
|---|---|---|
| 301-Weiterleitung | starkes Signal | wenn die doppelte Seite wegfallen soll |
rel="canonical" im HTML | starkes Signal | wenn beide Seiten erreichbar bleiben, nur bei HTML-Seiten |
rel="canonical" als HTTP-Header | starkes Signal | bei Dateien ohne HTML wie PDFs |
| Aufnahme in die Sitemap | schwaches Signal | als Ergänzung, um die gewünschte Adresse zu stützen |
Die Methoden lassen sich kombinieren. Von den beiden Canonical-Varianten solltest du nur eine verwenden, weil beide zusammen fehleranfälliger sind. Google empfiehlt außerdem einen selbstreferenzierenden Canonical, also einen Verweis der Seite auf sich selbst.
<!-- im head der doppelten UND der Hauptseite -->
<link rel="canonical" href="https://www.deinedomain.de/deine-seite">
# Apache: http auf https mit 301 weiterleiten
RewriteEngine On
RewriteCond %{HTTPS} off
RewriteRule ^(.*)$ https://www.deinedomain.de/$1 [R=301,L]
Wie Google die Adresse wählt
Google wertet die genannten Signale aus und zieht Eigenheiten der Website hinzu. Es bevorzugt in der Regel https gegenüber http, und es bevorzugt Adressen, die in einem Hreflang-Cluster stehen. Ein Canonical ist daher ein starker Hinweis, aber keine Garantie.
Mehrsprachige Seiten und Ähnliches
Seiten in verschiedenen Sprachen sind keine Duplikate, auch wenn sie sich inhaltlich entsprechen. Verknüpfe sie mit hreflang. Bei sehr ähnlichen Seiten in derselben Sprache für verschiedene Länder hilft ebenfalls hreflang. Reine Varianten, die nur ein Filter erzeugt, solltest du dagegen bündeln oder, wenn sie keinen Suchwert haben, mit noindex versehen. Bei einem Canonical auf eine andere Seite verschwindet die Variante aus den Ergebnissen.
Häufige Fehler
- Canonical auf eine ganz andere Seite: Der Inhalt sollte zu der Seite passen, auf die du verweist.
- Canonical und noindex gleichzeitig: Das sendet widersprüchliche Signale.
- Doppelte Adressen in der Sitemap: Die Sitemap sollte nur die Hauptadresse enthalten.
- Canonical im Body statt im Head: Das Element gehört in den Kopfbereich der Seite.
- Auf Strafen reagieren, die es nicht gibt: Wichtiger ist, dass die richtige Version in den Ergebnissen steht.
Weiterführende Begriffe
- Sitemap.xml: bevorzugte Adressen melden
- Noindex-Tag: Seiten aus dem Index nehmen
- Hreflang: Sprachversionen verknüpfen
- Paginierung: Seitenfolgen richtig auszeichnen
Quellen
- Google Search Central: Doppelte URLs mit Canonicals zusammenführen
- Google Search Central: Richtlinien zu Spam in der Google Suche (Scraping, Doorway-Seiten)