SEO

Crawl budget

Počet stránek, které Google robot za čas projde

(Crawl Budget)

Co je crawl budget

Crawl budget je počet stránek, které robot vyhledávače na daném webu za určité období projde. Není to hodnota, kterou byste si někde nastavili; vzniká z kapacity, jakou vám vyhledávač přidělí, a z toho, kolik toho váš server v klidu unese.

Koho se to týká

Prakticky jen velkých webů. Rozsáhlý e-shop s filtry, řazením a variantami produktů umí vygenerovat mnohonásobně víc adres, než má reálných stránek, a tam už rozdíl mezi „robot projde všechno“ a „robot projde zlomek“ znamená peníze. Firemní web o dvaceti stránkách tenhle problém nemá a čas strávený jeho řešením je vyhozený.

Kde se rozpočet propálí

  • Kombinace filtrů, které z jedné kategorie udělají tisíce adres s téměř stejným výpisem.
  • Parametry v URL: řazení, stránkování, session ID, zdroj kampaně.
  • Prolinkované výsledky vnitřního vyhledávání.
  • Řetězce přesměrování a chybové stránky, které robot drží ve frontě a vrací se k nim.

Léčba je nudná a účinná: nedávat robotovi odkazy tam, kam nemá chodit, zbytečné parametry zakázat v robots.txt a duplicity srovnat kanonickým odkazem.

Spočítejte adresy, ne produkty

U velkých e-shopů si nechám z crawleru vypsat, kolik unikátních adres web vlastně nabízí, a porovnám to s počtem produktů a kategorií. Když pár tisíc produktů generuje řádově víc adres, vím, kde začít. Report o procházení v Search Console pak ukáže druhou stranu mince: kolik požadavků denně robot posílá a jak rychle mu server odpovídá. Pomalý server je tichý žrout rozpočtu, protože robot sám od sebe přibrzdí, aby web nepoložil.

Časté otázky

Má crawl budget řešit i malý web?

Nemá. U prezentace nebo blogu s několika desítkami stránek robot projde všechno a energie vložená do procházení se lépe vyplatí v obsahu nebo ve zpětných odkazech.

Jak poznám, že robot nestíhá procházet web?

Nové a změněné stránky se ve vyhledávání objevují se zpožděním týdnů, zatímco v reportu o procházení robot stahuje hlavně parametrické adresy a filtry. Souhrn v Search Console ukazuje jak počet požadavků, tak dobu odezvy serveru.

Pomůže zákaz procházení v robots.txt?

U filtrů a parametrů ano, robot za zákaz nevleze a fronta se mu odlehčí. Univerzální nástroj to ale není: adresu zakázanou v robots.txt si vyhledávač nepřečte, takže z ní nezjistí ani to, že ji nemá zařadit do výsledků.