Crawl
Procházení webu robotem vyhledávače
Co je crawl
Crawl je procházení webu robotem vyhledávače: program si stáhne obsah stránky, najde na ní odkazy a po nich pokračuje dál. Dokud se robot na adresu nedostane, vyhledávač o ní neví a do výsledků se nemá jak dostat.
Odkud robot ví, kam jít
Hlavní cestou jsou odkazy. Robot zná nějakou stránku vašeho webu, projde ji, vypíše si z ní adresy a zařadí je do fronty. Stránka, na kterou z webu nevede jediný odkaz, tak zůstává stranou i tehdy, když je jinak úplně v pořádku. Druhá cesta vede přes sitemap.xml, kde web sám nabídne seznam adres.
Robot stahuje především HTML. Obsah, který se na stránce vykreslí až JavaScriptem, se zpracovává v dalším kole a s odstupem. Výpis produktů poskládaný jen v prohlížeči pro robota nemusí při první návštěvě vůbec existovat.
Procházení je přitom podmínka, ne záruka. Robot si stránku stáhne, obsah posoudí a klidně ji nechá ležet mimo databázi vyhledávače; kdy a proč se to děje, rozebírám u pojmu indexace.
Když mi klient napíše, že nová sekce webu nechodí z vyhledávání, ptám se nejdřív na procházení, ne na klíčová slova. Pustím přes web crawler a podívám se, kam se z domovské stránky dá vůbec doklikat. Pak si u konkrétní adresy vyžádám kontrolu v Search Console, abych viděl, jestli si ji robot stáhl a s jakým výsledkem. Docela často z toho vyleze banalita: na novou sekci nevede odkaz odnikud kromě e-mailu, kterým mi ji poslali.