krol badžetTakéCrawl budget SEO, budget procházení, crawlovací rozpočetPokročilý
Definice
Crawl budget je množství URL adres jednoho webu, které vyhledávací robot za dané období skutečně stáhne. Vzniká kombinací dvou věcí: kolik požadavků server bez zpomalení unese (crawl capacity) a kolik stránek považuje vyhledávač za dost zajímavé na stažení (crawl demand). Limituje hlavně weby s desítkami tisíc URL.
Z čeho se crawl budget skládá
Crawl budget stojí na dvou nezávislých veličinách. První je technický strop: robot sleduje dobu odezvy a chybovost serveru a podle ní zvyšuje nebo snižuje počet paralelních spojení. Pomalý nebo chybující server si sám snižuje frekvenci stahování. Druhá veličina je poptávka: pokud vyhledávač považuje stránku za populární nebo často měněnou, vrací se k ní častěji. Nezajímavá, duplicitní nebo dlouho nezměněná URL adresa klesá ve frontě dolů, i když má server kapacity dost.
Kdy se crawl budget stane reálným problémem
Pro web s několika stovkami stránek je crawl budget prakticky nezajímavý téma: robot takový web projde celý běžně. Problém začíná tam, kde počet dostupných URL adres roste rychleji než počet užitečných stránek. Typicky jde o e-shopy s filtrovanými výpisy, kalendáře s nekonečnou řadou měsíců, vyhledávání uvnitř webu vystavené v odkazech nebo session identifikátory v parametrech. Kombinatorika filtrů dokáže z tisíce produktů vyrobit miliony adres a robot pak tráví čas variantami jednoho výpisu místo nových produktových karet.
Jak se plýtvání pozná
Plýtvání se dá změřit na serverových logách: stačí vzít přístupy robotů za měsíc a rozdělit je podle typu URL. Když polovina požadavků míří na adresy s parametrem řazení, je jasné, kde budget mizí. Sestava statistik procházení v Search Console ukazuje totéž hruběji, zato bez nutnosti sbírat logy.
Čím se plýtvání omezuje
Nejúčinnější je nevytvořit nadbytečné URL vůbec: filtry řešit přes POST nebo fragment, stránkování udržet konečné, interní vyhledávání neodkazovat. Když adresy už existují, blokace v robots.txt zabrání stažení, zatímco noindex nikoli, protože robot musí stránku nejdřív stáhnout, aby značku viděl. Kanonizace duplicitám index vyčistí, ale procházení nezastaví. Rychlé odpovědi, korektní stavové kódy a sitemapa s poctivým lastmod pomáhají robotovi trefit se do toho, co se skutečně změnilo.
Proč crawl budget není hodnocení kvality
Časté procházení neznamená lepší pozice a řídké procházení nemusí znamenat postih. Crawl budget popisuje logistiku stahování, ne relevanci. Nepřímá souvislost tam ovšem je: stránka, kterou robot nestáhne, se neindexuje, a neindexovaná stránka nemá jak hodnotit. U velkých webů se proto crawl budget projeví jako zpoždění, s jakým se nové zboží nebo nové články objeví ve výsledcích.
Rozdíl mezi procházením, indexací a vykreslením
Procházení je stažení dokumentu, indexace je rozhodnutí ho uložit do indexu, vykreslení je spuštění JavaScriptu. Weby, které obsah sestavují až v prohlížeči, spotřebují na jednu stránku podstatně víc zdrojů, protože kromě HTML se stahují skripty, styly a API odpovědi. Serverové vykreslení nebo předgenerování proto crawl budget šetří stejně jako mazání zbytečných adres.
Příklady z praxe
E-shop s kombinovatelnými filtry
Výpis kategorie s 1 200 produkty nabízí filtry podle barvy, velikosti a značky, každý jako odkaz s parametrem. Kombinace vygenerují přes 300 tisíc unikátních URL, které se v logu objeví jako 70 % přístupů robota. Po převedení filtrů na parametry blokované v robots.txt klesnou přístupy na filtry na jednotky procent a nové produktové karty se začnou indexovat řádově rychleji.
User-agent: * Disallow: /*?barva= Disallow: /*?razeni= Disallow: /hledatAnalýza logů podle typu URL
Z access logu se vyfiltrují požadavky Googlebotu a seskupí podle prvního segmentu cesty. Výsledek ukáže, kolik stažení připadá na produkty, kolik na výpisy a kolik na interní vyhledávání. Tahle jedna tabulka nahradí většinu dohadů o tom, kde crawl budget mizí.
grep -i googlebot access.log \ | awk '{print $7}' \ | cut -d/ -f2 \ | sort | uniq -c | sort -rn | head -20
Časté omyly
- MýtusMusíme řešit crawl budget, máme přece web.
- Ve skutečnostiCrawl budget je omezením u webů s desítkami tisíc a více URL nebo s velmi častými změnami. Prezentaci o dvou stech stránkách robot projde bez potíží a optimalizace procházení tam nepřinese nic.
- MýtusStránku s noindex robot přestane stahovat, takže tím ušetřím budget.
- Ve skutečnostiZnačku noindex robot uvidí až po stažení stránky, takže procházení nešetří, jen brání indexaci. Stahování zastaví až zákaz v robots.txt, ten ale zase brání robotovi noindex přečíst.
- MýtusKdyž Google prochází web častěji, znamená to, že ho hodnotí líp.
- Ve skutečnostiFrekvence procházení odráží kapacitu serveru a odhad, jak často se obsah mění, ne kvalitu ani pozice. Zpravodajský web se přepisuje denně, dokumentace ročně, a přesto může být ve výsledcích výš dokumentace.
Časté dotazy
- Od jaké velikosti webu má smysl crawl budget řešit?
- Crawl budget se vyplatí řešit zhruba od desítek tisíc URL, u webů s velmi rychlou obměnou obsahu i dřív. Rozhodující není počet stránek v menu, ale počet adres, které robot může objevit včetně filtrů, stránkování, variant a parametrů. Praktický test je jednoduchý: pokud se nová stránka objeví ve vyhledávání za pár hodin či dnů, problém nemáte. Pokud čeká týdny a v logu vidíte, že robot mezitím stahuje stovky variant výpisů, stojí za to zjednodušit strukturu URL.
- Zvýší se crawl budget, když zrychlím server?
- Zrychlení serveru zvyšuje horní strop procházení, protože robot podle doby odezvy a chybovosti reguluje počet souběžných požadavků. Zvýšení stropu ale samo o sobě neznamená, že vyhledávač bude stahovat víc: pokud nevidí důvod, tedy nový nebo měnící se obsah, poptávka po procházení zůstane nízká. Rychlý server tedy odstraní brzdu, nikoli vytvoří motivaci. Nejlepší efekt má kombinace: rychlé odpovědi, méně zbytečných URL a čerstvý obsah, na který vedou interní odkazy.
- Pomůže XML sitemapa proti plýtvání crawl budgetem?
- XML sitemapa robotovi pomáhá objevit adresy, na které vedou slabé interní odkazy, a pole lastmod mu naznačuje, co se změnilo. Sitemapa ale nefunguje jako příkaz a neruší adresy, které robot našel odkazy. Přínos má jen tehdy, když je udržovaná: obsahuje výhradně kanonické URL vracející stav 200 a datumy odpovídají skutečné změně obsahu. Sitemapa plná přesměrování, chyb 404 a falešných dat robotovi důvěru snižuje a jako nástroj pro řízení procházení přestane fungovat.
- Jak crawl budget ovlivňuje web postavený na JavaScriptu?
- Web vykreslovaný až v prohlížeči spotřebuje na jednu stránku výrazně víc prostředků, protože kromě HTML dokumentu musí robot stáhnout skripty, styly a datové odpovědi a stránku vykreslit. Vykreslení navíc často probíhá se zpožděním v samostatné frontě, takže obsah se do indexu dostane později než u serverově vykresleného HTML. U velkých katalogů proto pomáhá server-side rendering nebo statické předgenerování klíčových šablon, zatímco čistě klientské vykreslování se hodí spíš na části webu, které do vyhledávání nemíří.
Zdroje
- Google Search Central Documentation(otevře se v novém okně)
- Robots Exclusion Protocol(otevře se v novém okně)
- Web crawler(otevře se v novém okně)
- Bing Webmaster Tools Help(otevře se v novém okně)