Vzorkování dat
Když se report počítá jen z části návštěv
Co je vzorkování dat
Vzorkování dat je postup, při kterém nástroj spočítá report jen z části dostupných relací a výsledek dopočítá na celek. Šetří to výpočetní čas, cenou je nepřesnost, která roste s tím, jak úzkou skupinu se v datech snažíte najít.
Kdy na něj narazíte
Standardní přehledy v GA4 běží nad předpočítanými tabulkami a tam vzorkování nehrozí. Objeví se ve chvíli, kdy si vyžádáte něco, co se musí spočítat až na místě:
- explorace přes dlouhé období na účtu s velkým provozem
- report, do kterého přidáte vlastní podmínku či filtr, jaký předpočítaná tabulka nezná
- kombinace dimenzí, kterou standardní přehled nenabízí
- dotazy přes API, kde si rozsah určujete sami
Poznáte to podle ikonky u záhlaví reportu. Po najetí ukáže, z jaké části dat se počítalo, a když tam stojí cokoli jiného než plný rozsah, čtete odhad. (V Universal Analytics to bylo znát mnohem víc, protože se vzorkovalo i v běžných přehledech.)
Proč to bolí u malých skupin
Dopočet funguje tím líp, čím víc případů do vzorku spadne. U velkého celku sedí odhad slušně. Jakmile se ale ptáte na skupinu o pár desítkách relací, může se stát, že do vzorku nepadne skoro nic, a nástroj to přesto vynásobí na celek. Odtud se berou počty konverzí skákající při každém načtení nebo publikum, které podle explorace vydělává a v objednávkách po něm není stopa.
Nejhorší na vzorkování je, že se o něm nemluví nahlas. Report se tváří jako každý jiný, čísla vypadají přesně a jediné varování je drobná ikonka nahoře. Zvykl jsem si na ni kouknout dřív než na graf, kdykoli má z reportu vzejít rozhodnutí. Když vzorkovaný je, beru z něj trend a poměry mezi kanály, nikdy ne konkrétní počty do reportu pro klienta.