duplicate content issues

Duplicate content: wat het is, wanneer het een probleem is en wat je eraan doet

Duplicate content is een van de meest misverstane onderwerpen in SEO. Er wordt gesproken over “penalties” en “algoritme-straffen”, terwijl de werkelijkheid genuanceerder is. Duplicate content is vrijwel altijd een kwaliteits- of efficiëntieprobleem, zelden een penalty-situatie. Maar dat betekent niet dat je het kunt negeren.

Wat duplicate content eigenlijk is

Duplicate content zijn pagina’s met substantieel identieke of sterk vergelijkbare inhoud, ofwel op dezelfde website, ofwel op meerdere websites. Google heeft geen officiële drempelwaarde — het gaat om de mate waarin een pagina unieke waarde toevoegt ten opzichte van wat al in de index zit. Voorbeelden: een webshop met honderd filtercombinaties die elk dezelfde producten tonen met een andere URL, of een blog die letterlijk gekopieerd wordt op een ander domein.

Wanneer het écht een probleem is

Het grootste concrete effect van duplicate content is crawlbudgetverspilling. Als Googlebot druk is met het crawlen van duizenden URL’s die inhoudelijk identiek zijn, besteedt het minder aandacht aan de pagina’s die er wél toe doen. Bij grote websites is dit een reëel probleem.

Daarnaast kan duplicate content leiden tot rankings die verdeeld worden over meerdere URL’s. Google kiest in zo’n geval welke pagina het meest relevant lijkt. De andere versies concurreren met de eerste. Je verliest controle over welke URL rankt voor welke zoekvraag.

Wanneer je er niet wakker van hoeft te liggen

Kleine overlappen in tekst — een productomschrijving die op meerdere pagina’s staat, een boilerplatetekst in een footer — zijn geen reden voor paniek. Google is goed in het herkennen van gedeelde stukken tekst. De meeste WordPress-sites hebben technisch gezien enige duplicate content via categorie- en tagpagina’s. Dat is normaal zolang de pagina’s die je wilt indexeren correct geconfigureerd zijn.

De oplossingen

De canonieke tag (rel="canonical") is het meest gebruikte middel. Je geeft hiermee aan welke URL de “echte” is, zodat Google PageRank en indexeringswaarde consolideert naar die ene URL. Dit is de juiste aanpak voor filterpagina’s, productpagina’s met varianten en paginering.

Voor websites in meerdere talen of regio’s is hreflang de oplossing. Dit vertelt Google niet alleen welke URL de canonieke is, maar ook voor welke taal en regio elke versie bedoeld is.

De meest onderschatte vorm van duplicate content is thin content: pagina’s die technisch uniek zijn maar inhoudelijk zo weinig te zeggen hebben dat Google ze als non-content beschouwt. Dat los je niet op met een canonieke tag — dat los je op door betere inhoud te schrijven of de pagina samen te voegen met een relevanter stuk.