Crawl budget
Počet stránek, které Google robot za čas projde
Co je crawl budget
Crawl budget je počet stránek, které robot vyhledávače na daném webu za určité období projde. Není to hodnota, kterou byste si někde nastavili; vzniká z kapacity, jakou vám vyhledávač přidělí, a z toho, kolik toho váš server v klidu unese.
Koho se to týká
Prakticky jen velkých webů. Rozsáhlý e-shop s filtry, řazením a variantami produktů umí vygenerovat mnohonásobně víc adres, než má reálných stránek, a tam už rozdíl mezi „robot projde všechno“ a „robot projde zlomek“ znamená peníze. Firemní web o dvaceti stránkách tenhle problém nemá a čas strávený jeho řešením je vyhozený.
Kde se rozpočet propálí
- Kombinace filtrů, které z jedné kategorie udělají tisíce adres s téměř stejným výpisem.
- Parametry v URL: řazení, stránkování, session ID, zdroj kampaně.
- Prolinkované výsledky vnitřního vyhledávání.
- Řetězce přesměrování a chybové stránky, které robot drží ve frontě a vrací se k nim.
Léčba je nudná a účinná: nedávat robotovi odkazy tam, kam nemá chodit, zbytečné parametry zakázat v robots.txt a duplicity srovnat kanonickým odkazem.
Spočítejte adresy, ne produkty
U velkých e-shopů si nechám z crawleru vypsat, kolik unikátních adres web vlastně nabízí, a porovnám to s počtem produktů a kategorií. Když pár tisíc produktů generuje řádově víc adres, vím, kde začít. Report o procházení v Search Console pak ukáže druhou stranu mince: kolik požadavků denně robot posílá a jak rychle mu server odpovídá. Pomalý server je tichý žrout rozpočtu, protože robot sám od sebe přibrzdí, aby web nepoložil.