SEO

Crawl

Procházení webu robotem vyhledávače

(Crawling)

Co je crawl

Crawl je procházení webu robotem vyhledávače: program si stáhne obsah stránky, najde na ní odkazy a po nich pokračuje dál. Dokud se robot na adresu nedostane, vyhledávač o ní neví a do výsledků se nemá jak dostat.

Odkud robot ví, kam jít

Hlavní cestou jsou odkazy. Robot zná nějakou stránku vašeho webu, projde ji, vypíše si z ní adresy a zařadí je do fronty. Stránka, na kterou z webu nevede jediný odkaz, tak zůstává stranou i tehdy, když je jinak úplně v pořádku. Druhá cesta vede přes sitemap.xml, kde web sám nabídne seznam adres.

Robot stahuje především HTML. Obsah, který se na stránce vykreslí až JavaScriptem, se zpracovává v dalším kole a s odstupem. Výpis produktů poskládaný jen v prohlížeči pro robota nemusí při první návštěvě vůbec existovat.

Procházení je přitom podmínka, ne záruka. Robot si stránku stáhne, obsah posoudí a klidně ji nechá ležet mimo databázi vyhledávače; kdy a proč se to děje, rozebírám u pojmu indexace.

Když mi klient napíše, že nová sekce webu nechodí z vyhledávání, ptám se nejdřív na procházení, ne na klíčová slova. Pustím přes web crawler a podívám se, kam se z domovské stránky dá vůbec doklikat. Pak si u konkrétní adresy vyžádám kontrolu v Search Console, abych viděl, jestli si ji robot stáhl a s jakým výsledkem. Docela často z toho vyleze banalita: na novou sekci nevede odkaz odnikud kromě e-mailu, kterým mi ji poslali.

Časté otázky

Jak často robot prochází web?

Pevný interval neexistuje. Roboti se vracejí podle toho, jak často se na webu něco mění a nakolik je pro ně web zajímavý. Zpravodajský server procházejí prakticky pořád, u firemní prezentace, kde se rok nic nezměnilo, se robot ukáže zřídka.

Znamená projití stránky, že se objeví ve výsledcích?

Ne. Procházení je první krok, po něm teprve přichází rozhodnutí, jestli stránku zařadit do indexu. Tenký nebo duplicitní obsah robot běžně stáhne a dál s ním nepracuje.

Jak zjistím, jestli robot moji stránku navštívil?

Nejrychleji kontrolou URL v Google Search Console, která ukáže datum posledního procházení. Přesnější pohled dávají logy serveru, kde jsou vidět všechny návštěvy robotů včetně těch, co se zasekly na nesmyslných adresách.