TakéDuplicita obsahu, Duplicitní stránky, Duplikovaný obsahZákladní
Definice
Duplicitní obsah je stejný nebo velmi podobný text dostupný na více URL adresách, ať už v rámci jednoho webu, nebo napříč doménami. Vyhledávače pak musí vybrat, kterou verzi zaindexují a zobrazí ve výsledcích, zbylé varianty odfiltrují. Typicky vzniká parametry v URL, filtry v e-shopu, tiskovými verzemi stránek nebo přebíráním popisů od dodavatele.
Odkud se duplicity na webu berou
Duplicitní obsah málokdy vzniká úmyslným kopírováním. Většinou je vedlejším produktem toho, jak web generuje adresy. Stejná stránka bývá dostupná přes http i https, s www i bez, s lomítkem na konci i bez něj, s parametrem pro řazení nebo s UTM značkou z kampaně. E-shop navíc často vystaví jeden produkt pod několika cestami podle kategorie, ve které si ho návštěvník otevřel.
Druhým velkým zdrojem je obsah přebíraný odjinud: popisy produktů z katalogu dodavatele, přetištěné tiskové zprávy, agregované inzeráty. Takový text existuje v desítkách kopií a žádná z nich nemá pro vyhledávač zvláštní hodnotu.
Co s duplicitou dělá vyhledávač
Vyhledávač si podobné dokumenty seskupí a z každé skupiny určí jednu reprezentativní adresu, kterou nazývá kanonickou. Ostatní verze zůstanou známé, ale ve výsledcích se běžně neobjeví. Signály, které by jinak posílily jedinou stránku, se přitom tříští: zpětné odkazy vedou na tři různé varianty a každá z nich má sama o sobě slabší postavení.
Druhý náklad je rozpočet na procházení. Robot, který stráví čas stahováním padesáti kombinací filtrů, se nedostane k nově přidaným produktům tak rychle. U malého webu to nevadí, u katalogu s desítkami tisíc URL to zdržuje indexaci reálně.
Interní duplicita
Interní duplicita znamená více adres na téže doméně. Řeší se hlavně prvkem kanonická URL, trvalým přesměrováním 301 na preferovanou variantu a konzistentním odkazováním uvnitř webu i v sitemap.
Externí duplicita
Externí duplicita nastává mezi doménami: syndikace článků, jazykové mutace pro Česko a Slovensko, zkopírovaný text konkurencí. U syndikace pomáhá mezidoménová kanonizace nebo odkaz na originál, u jazykových a regionálních variant anotace hreflang, která říká, komu se má která verze zobrazit.
Existuje trest za duplicitní obsah?
Sankci dostane web jen tehdy, když se duplicitou pokouší manipulovat výsledky: rozmnožené doorway stránky, automaticky přeskládaný cizí text, sítě klonů. Běžná technická duplicita trest nepřináší, jen se projeví tím, že se vaše stránka nezobrazuje tam, kde byste čekali, případně se ve výsledku ukáže jiná adresa, než jakou propagujete.
Postup při úklidu
- Zjistěte skutečný stav: sestava indexovaných adres, porovnání s tím, co má být indexovatelné.
- Rozhodněte, která varianta je hlavní, a držte ji všude stejně.
- Přesměrujte, co má zaniknout; kanonizujte, co musí zůstat dostupné (filtry, stránkování).
- Přepište přebrané texty tak, aby stránka nesla vlastní informaci.
Blokace v robots.txt je pro duplicity špatný nástroj: robot pak stránku nestáhne, kanonický odkaz neuvidí a adresa může v indexu zůstat bez popisu.
Příklady z praxe
E-shop s filtry a řazením
Kategorie „Běžecké boty“ je dostupná i s parametry pro řazení a filtrování, takže stejný výpis existuje pod desítkami adres. Řešení je nechat všechny filtrované varianty ukazovat kanonickým odkazem na čistou adresu kategorie, pokud filtr nevytváří stránku s vlastní poptávkou. Kombinace, které lidé skutečně hledají (například „černé běžecké boty“), naopak dostanou vlastní kanonickou adresu a vlastní text.
<link rel="canonical" href="https://eshop.cz/bezecke-boty">Česká a slovenská mutace se stejným textem
Web běží na doméně .cz a .sk s prakticky totožným českým textem. Kanonizace jedné mutace na druhou by odstranila slovenskou verzi z výsledků, což není cíl. Správným nástrojem je hreflang: obě stránky se navzájem označí, každá si ponechá vlastní kanonickou adresu a vyhledávač zobrazí verzi podle země a jazyka uživatele.
<link rel="alternate" hreflang="cs-CZ" href="https://priklad.cz/produkt"> <link rel="alternate" hreflang="sk-SK" href="https://priklad.sk/produkt"> <link rel="alternate" hreflang="x-default" href="https://priklad.cz/produkt">
Časté omyly
- MýtusZa duplicitní obsah přijde od Googlu penalizace.
- Ve skutečnostiBěžná technická duplicita penalizaci nezpůsobuje. Vyhledávač jen vybere jednu verzi a ostatní ve výsledcích potlačí. Manuální postih hrozí až u záměrné manipulace, tedy u klonovaných webů nebo strojově namíchaného cizího textu.
- MýtusDuplicitní stránky stačí zakázat v robots.txt.
- Ve skutečnostiZákaz procházení znemožní robotu stránku stáhnout, takže neuvidí ani kanonický odkaz, ani přesměrování. Adresa přesto může zůstat v indexu bez titulku a popisu. Vhodnější je kanonizace, přesměrování 301 nebo meta značka noindex na dostupné stránce.
- MýtusKdyž text opíšu a přeházím slova, je to už originální obsah.
- Ve skutečnostiPřeskládaná kopie zůstává pro vyhledávač blízkým duplikátem a navíc spadá do kategorie obsahu bez přidané hodnoty. Rozdíl dělá vlastní informace: parametry, měření, zkušenost, fotografie, kterou nikdo jiný nemá.
Časté dotazy
- Jak zjistím, kolik duplicitních URL můj web má?
- Duplicitní URL odhalíte kombinací tří pohledů. Přehled indexace ve webmasterských nástrojích ukáže adresy vyloučené jako alternativní verze s kanonickou stránkou. Crawler procházející web zvenčí odhalí stejné titulky, meta popisy a shodné texty pod různými adresami. Serverové logy nebo statistiky procházení ukážou, na které parametrické adresy robot skutečně chodí. Praktický první krok je porovnat počet adres v sitemapě s počtem indexovaných stránek: velký rozdíl obvykle znamená buď duplicity, nebo obsah, který vyhledávač vyhodnotil jako slabý.
- Je stránkování výpisu duplicitní obsah?
- Stránkování duplicitním obsahem není, protože každá stránka výpisu obsahuje jiné položky. Chybou naopak bývá kanonizovat všechny stránky výpisu na první stránku: produkty z dalších stránek pak vyhledávač hůř objevuje. Doporučený postup je nechat každé stránce vlastní kanonickou adresu na sebe sama a propojit je běžnými odkazy dalšího a předchozího kroku. Duplicita v seznamech vzniká spíš z parametrů řazení a filtrů, které vracejí stejné položky jen v jiném pořadí.
- Co dělat, když někdo zkopíroval texty z mého webu?
- Při zkopírování textů nejprve doložte, že originál je váš: datum publikace, verze v archivu, záznam v sitemapě, odkazy vedoucí na vaši stránku. Vyhledávače v naprosté většině případů originál rozpoznají samy a kopii do výsledků nepustí. Pokud kopie přesto přebírá pozice, lze podat žádost o odstranění obsahu podle autorského práva u provozovatele vyhledávače nebo hostingu. Souběžně pomáhá posílit vlastní stránku: aktualizovat ji, doplnit unikátní data a získat na ni odkazy.
- Kdy použít noindex místo kanonické URL?
- Noindex použijte tam, kde stránka nemá být ve výsledcích vůbec, ale musí zůstat funkční pro uživatele: interní vyhledávání, košík, děkovací stránky, náhledy tisku. Kanonická URL se hodí, když je obsah v jádru stejný jako u hlavní verze a chcete, aby se signály sloučily do jedné adresy. Rozdíl je zásadní: kanonický odkaz je pouze doporučení, které vyhledávač může ignorovat, zatímco noindex je pokyn, který se dodržuje. Obě značky na téže stránce kombinovat nedoporučuji, dávají protichůdný signál.
Zdroje
- Consolidate duplicate URLs with canonicals(otevře se v novém okně)
- Tell Google about localized versions of your page(otevře se v novém okně)
- rel=canonical(otevře se v novém okně)
- Duplicate content(otevře se v novém okně)