krol badžetTakéCrawl budget SEO, budget procházení, crawlovací rozpočetPokročilý

Definice

Crawl budget je množství URL adres jednoho webu, které vyhledávací robot za dané období skutečně stáhne. Vzniká kombinací dvou věcí: kolik požadavků server bez zpomalení unese (crawl capacity) a kolik stránek považuje vyhledávač za dost zajímavé na stažení (crawl demand). Limituje hlavně weby s desítkami tisíc URL.

Kategorie: SEOAktualizováno

Z čeho se crawl budget skládá

Crawl budget stojí na dvou nezávislých veličinách. První je technický strop: robot sleduje dobu odezvy a chybovost serveru a podle ní zvyšuje nebo snižuje počet paralelních spojení. Pomalý nebo chybující server si sám snižuje frekvenci stahování. Druhá veličina je poptávka: pokud vyhledávač považuje stránku za populární nebo často měněnou, vrací se k ní častěji. Nezajímavá, duplicitní nebo dlouho nezměněná URL adresa klesá ve frontě dolů, i když má server kapacity dost.

Kdy se crawl budget stane reálným problémem

Pro web s několika stovkami stránek je crawl budget prakticky nezajímavý téma: robot takový web projde celý běžně. Problém začíná tam, kde počet dostupných URL adres roste rychleji než počet užitečných stránek. Typicky jde o e-shopy s filtrovanými výpisy, kalendáře s nekonečnou řadou měsíců, vyhledávání uvnitř webu vystavené v odkazech nebo session identifikátory v parametrech. Kombinatorika filtrů dokáže z tisíce produktů vyrobit miliony adres a robot pak tráví čas variantami jednoho výpisu místo nových produktových karet.

Jak se plýtvání pozná

Plýtvání se dá změřit na serverových logách: stačí vzít přístupy robotů za měsíc a rozdělit je podle typu URL. Když polovina požadavků míří na adresy s parametrem řazení, je jasné, kde budget mizí. Sestava statistik procházení v Search Console ukazuje totéž hruběji, zato bez nutnosti sbírat logy.

Čím se plýtvání omezuje

Nejúčinnější je nevytvořit nadbytečné URL vůbec: filtry řešit přes POST nebo fragment, stránkování udržet konečné, interní vyhledávání neodkazovat. Když adresy už existují, blokace v robots.txt zabrání stažení, zatímco noindex nikoli, protože robot musí stránku nejdřív stáhnout, aby značku viděl. Kanonizace duplicitám index vyčistí, ale procházení nezastaví. Rychlé odpovědi, korektní stavové kódy a sitemapa s poctivým lastmod pomáhají robotovi trefit se do toho, co se skutečně změnilo.

Proč crawl budget není hodnocení kvality

Časté procházení neznamená lepší pozice a řídké procházení nemusí znamenat postih. Crawl budget popisuje logistiku stahování, ne relevanci. Nepřímá souvislost tam ovšem je: stránka, kterou robot nestáhne, se neindexuje, a neindexovaná stránka nemá jak hodnotit. U velkých webů se proto crawl budget projeví jako zpoždění, s jakým se nové zboží nebo nové články objeví ve výsledcích.

Rozdíl mezi procházením, indexací a vykreslením

Procházení je stažení dokumentu, indexace je rozhodnutí ho uložit do indexu, vykreslení je spuštění JavaScriptu. Weby, které obsah sestavují až v prohlížeči, spotřebují na jednu stránku podstatně víc zdrojů, protože kromě HTML se stahují skripty, styly a API odpovědi. Serverové vykreslení nebo předgenerování proto crawl budget šetří stejně jako mazání zbytečných adres.

Příklady z praxe

  1. E-shop s kombinovatelnými filtry

    Výpis kategorie s 1 200 produkty nabízí filtry podle barvy, velikosti a značky, každý jako odkaz s parametrem. Kombinace vygenerují přes 300 tisíc unikátních URL, které se v logu objeví jako 70 % přístupů robota. Po převedení filtrů na parametry blokované v robots.txt klesnou přístupy na filtry na jednotky procent a nové produktové karty se začnou indexovat řádově rychleji.

    User-agent: *
    Disallow: /*?barva=
    Disallow: /*?razeni=
    Disallow: /hledat
  2. Analýza logů podle typu URL

    Z access logu se vyfiltrují požadavky Googlebotu a seskupí podle prvního segmentu cesty. Výsledek ukáže, kolik stažení připadá na produkty, kolik na výpisy a kolik na interní vyhledávání. Tahle jedna tabulka nahradí většinu dohadů o tom, kde crawl budget mizí.

    grep -i googlebot access.log \
      | awk '{print $7}' \
      | cut -d/ -f2 \
      | sort | uniq -c | sort -rn | head -20

Časté omyly

MýtusMusíme řešit crawl budget, máme přece web.
Ve skutečnostiCrawl budget je omezením u webů s desítkami tisíc a více URL nebo s velmi častými změnami. Prezentaci o dvou stech stránkách robot projde bez potíží a optimalizace procházení tam nepřinese nic.
MýtusStránku s noindex robot přestane stahovat, takže tím ušetřím budget.
Ve skutečnostiZnačku noindex robot uvidí až po stažení stránky, takže procházení nešetří, jen brání indexaci. Stahování zastaví až zákaz v robots.txt, ten ale zase brání robotovi noindex přečíst.
MýtusKdyž Google prochází web častěji, znamená to, že ho hodnotí líp.
Ve skutečnostiFrekvence procházení odráží kapacitu serveru a odhad, jak často se obsah mění, ne kvalitu ani pozice. Zpravodajský web se přepisuje denně, dokumentace ročně, a přesto může být ve výsledcích výš dokumentace.

Časté dotazy

Od jaké velikosti webu má smysl crawl budget řešit?
Crawl budget se vyplatí řešit zhruba od desítek tisíc URL, u webů s velmi rychlou obměnou obsahu i dřív. Rozhodující není počet stránek v menu, ale počet adres, které robot může objevit včetně filtrů, stránkování, variant a parametrů. Praktický test je jednoduchý: pokud se nová stránka objeví ve vyhledávání za pár hodin či dnů, problém nemáte. Pokud čeká týdny a v logu vidíte, že robot mezitím stahuje stovky variant výpisů, stojí za to zjednodušit strukturu URL.
Zvýší se crawl budget, když zrychlím server?
Zrychlení serveru zvyšuje horní strop procházení, protože robot podle doby odezvy a chybovosti reguluje počet souběžných požadavků. Zvýšení stropu ale samo o sobě neznamená, že vyhledávač bude stahovat víc: pokud nevidí důvod, tedy nový nebo měnící se obsah, poptávka po procházení zůstane nízká. Rychlý server tedy odstraní brzdu, nikoli vytvoří motivaci. Nejlepší efekt má kombinace: rychlé odpovědi, méně zbytečných URL a čerstvý obsah, na který vedou interní odkazy.
Pomůže XML sitemapa proti plýtvání crawl budgetem?
XML sitemapa robotovi pomáhá objevit adresy, na které vedou slabé interní odkazy, a pole lastmod mu naznačuje, co se změnilo. Sitemapa ale nefunguje jako příkaz a neruší adresy, které robot našel odkazy. Přínos má jen tehdy, když je udržovaná: obsahuje výhradně kanonické URL vracející stav 200 a datumy odpovídají skutečné změně obsahu. Sitemapa plná přesměrování, chyb 404 a falešných dat robotovi důvěru snižuje a jako nástroj pro řízení procházení přestane fungovat.
Jak crawl budget ovlivňuje web postavený na JavaScriptu?
Web vykreslovaný až v prohlížeči spotřebuje na jednu stránku výrazně víc prostředků, protože kromě HTML dokumentu musí robot stáhnout skripty, styly a datové odpovědi a stránku vykreslit. Vykreslení navíc často probíhá se zpožděním v samostatné frontě, takže obsah se do indexu dostane později než u serverově vykresleného HTML. U velkých katalogů proto pomáhá server-side rendering nebo statické předgenerování klíčových šablon, zatímco čistě klientské vykreslování se hodí spíš na části webu, které do vyhledávání nemíří.

Zdroje

  1. Google Search Central Documentation(otevře se v novém okně)Google, 2024
  2. Robots Exclusion Protocol(otevře se v novém okně)RFC Editor, 2022
  3. Web crawler(otevře se v novém okně)Wikipedia
  4. Bing Webmaster Tools Help(otevře se v novém okně)Microsoft

Související pojmy

Potřebujete to vyřešit v praxi?

Poradíme, jak na to ve vašem projektu

Vysvětlit pojem je jedna věc, navrhnout kolem něj funkční řešení druhá. Ozvěte se a probereme, co dává smysl u vás.