Robots.txt
Soubor říkající robotům, co smí nebo nesmí indexovat
Co je robots.txt
Robots.txt je textový soubor v kořeni domény, ve kterém web robotům určuje, které části nemají procházet. Leží vždy na adrese typu vasedomena.cz/robots.txt, robot ho načítá jako první věc při návštěvě a otevřít si ho může kdokoliv.
Co se do něj píše
Pravidla se skládají z bloku User-agent, kterým vyberete robota, a z řádků Disallow a Allow s cestami. Hvězdička v User-agentu míří na všechny roboty, prázdný Disallow nezakazuje nic. Do souboru se obvykle přidává i odkaz na sitemapu, aby ji robot našel bez ohledu na to, jestli ji někdo odevzdal v Search Console.
Obsah bývá krátký. U e-shopu se zakazuje košík, přihlášení, interní vyhledávání a adresy s parametry řazení. U malé prezentace většinou není co zakazovat a soubor zůstane skoro prázdný.
Co robots.txt neumí
Funguje jako cedule, ne jako zámek. Slušní roboti se jí řídí, ostatní ne, takže citlivé adresy do souboru nepatří ani ve formě zákazu; vypsáním cesty k administraci ji akorát ukážete každému, kdo si soubor otevře.
Zákaz procházení není vyřazení z výsledků
Když na zakázanou adresu vedou odkazy odjinud, Google ji do výsledků zařadit může, jen bez popisku a s poznámkou, že o obsahu nic neví. Za zákazem si navíc nepřečte ani pokyn noindex, takže stránka, kterou chcete dostat z indexu pryč, tam kvůli zákazu zůstane viset. Robots.txt šetří robotovi čas, na viditelnost ve výsledcích je jiná páka.
Jeden řádek položí web
Robots.txt otevírám na každém auditu hned po sitemapě, protože jediný špatný řádek umí položit celý web. Klasika je Disallow na lomítko, které se přenese z vývojového serveru na produkci; web pak setrvačností chvíli drží pozice a potom začne padat. Sám do souboru zasahuju opatrně a změnu si ověřím testerem v Search Console, ať vím, že napsané pravidlo blokuje přesně to, co má.