Analytika & Měření

Vzorkování dat

Když se report počítá jen z části návštěv

(Data Sampling)

Co je vzorkování dat

Vzorkování dat je postup, při kterém nástroj spočítá report jen z části dostupných relací a výsledek dopočítá na celek. Šetří to výpočetní čas, cenou je nepřesnost, která roste s tím, jak úzkou skupinu se v datech snažíte najít.

Kdy na něj narazíte

Standardní přehledy v GA4 běží nad předpočítanými tabulkami a tam vzorkování nehrozí. Objeví se ve chvíli, kdy si vyžádáte něco, co se musí spočítat až na místě:

  • explorace přes dlouhé období na účtu s velkým provozem
  • report, do kterého přidáte vlastní podmínku či filtr, jaký předpočítaná tabulka nezná
  • kombinace dimenzí, kterou standardní přehled nenabízí
  • dotazy přes API, kde si rozsah určujete sami

Poznáte to podle ikonky u záhlaví reportu. Po najetí ukáže, z jaké části dat se počítalo, a když tam stojí cokoli jiného než plný rozsah, čtete odhad. (V Universal Analytics to bylo znát mnohem víc, protože se vzorkovalo i v běžných přehledech.)

Proč to bolí u malých skupin

Dopočet funguje tím líp, čím víc případů do vzorku spadne. U velkého celku sedí odhad slušně. Jakmile se ale ptáte na skupinu o pár desítkách relací, může se stát, že do vzorku nepadne skoro nic, a nástroj to přesto vynásobí na celek. Odtud se berou počty konverzí skákající při každém načtení nebo publikum, které podle explorace vydělává a v objednávkách po něm není stopa.

Nejhorší na vzorkování je, že se o něm nemluví nahlas. Report se tváří jako každý jiný, čísla vypadají přesně a jediné varování je drobná ikonka nahoře. Zvykl jsem si na ni kouknout dřív než na graf, kdykoli má z reportu vzejít rozhodnutí. Když vzorkovaný je, beru z něj trend a poměry mezi kanály, nikdy ne konkrétní počty do reportu pro klienta.

Časté otázky

Vzorkuje GA4 i běžné přehledy?

Standardní přehledy se počítají z předpočítaných tabulek, takže tam vzorkování nehrozí. Riziko se objevuje u explorací, vlastních podmínek a dotazů přes API, kde se výsledek počítá až v okamžiku dotazu.

Jak vzorkování omezím?

Zkraťte období, snižte počet dimenzí v jednom pohledu a nesnažte se dostat všechno do jediné tabulky. Když ani to nestačí, zbývá export do BigQuery, kde se počítá nad všemi řádky.

Můžu vzorkovaným číslům věřit?

U velkých celků drží trend dobře. U úzkých skupin s malým počtem relací se odhad rozjede natolik, že se podle něj rozhodovat nedá, a čísla si tam ověřte z jiného zdroje.