Za čísly
Najednou Singapur: když boti zkreslují čísla v GA4
Na první pohled vypadají data povzbudivě. Více návštěvníků, více zobrazení stránek, pěkně rostoucí křivka. Že by některý článek právě prorazil?
Bližší pohled už tak jednoznačný není. Velká část návštěvnosti navíc přichází ze Singapuru. Návštěvy jsou rozprostřené mezi staré články, které do dnešního redakčního dění téměř nezasahují. A zatímco GA4 hlásí výrazně vyšší aktivitu, NowMetrix ukazuje mnohem klidnější situaci.
V tu chvíli obvykle zazní otázka: kterému číslu můžeme věřit?
Všímají si toho i další provozovatelé webů
V komunitě r/GoogleAnalytics na Redditu se objevuje několik podobných zkušeností. Provozovatelé webů popisují nečekané návštěvy ze Singapuru a Číny, nezvykle vysoký podíl uživatelů počítačů a návštěvnost, která neodpovídá jejich běžnému publiku.
V diskusi o Singapuru a Lan-čou autor uvádí, že se návštěvy v GA4 objevují i po zablokování těchto zemí v Cloudflare. V serverových logách přitom nenachází odpovídající IP adresy z těchto zemí.
Další uživatel popisuje špičku rozptýlenou mezi tisíce URL. Neobvyklé návštěvy se soustředí na Windows a jednu konkrétní verzi Chromu, s velmi nízkým naměřeným zapojením.
Jde o zkušenosti provozovatelů webů, nikoli o uzavřená technická šetření. Ukazují ale, že kdo si nad podobnou návštěvností láme hlavu, není sám.
Nefiltruje Google Analytics boty automaticky?
Filtruje. Google v dokumentaci k filtrování botů uvádí, že známé boty a prohledávače automaticky vylučuje. Vychází z vlastního výzkumu i ze seznamu, který spravuje oborová organizace IAB.
Důležité je slovo „známé“.
Automatické filtrování neznamená, že každé zaznamenané zobrazení stránky pochází od člověka. Zkušenosti z Redditu tedy nejsou v rozporu s tím, že GA4 už boty odstraňuje. Neobvyklá data mohou přesto zůstat. Dokumentace Googlu také uvádí, že uživatelé nevidí, jak velký objem návštěvnosti známých botů byl vyloučen.
Pro redakci z toho plyne praktický úkol: prověřit neobvyklou špičku dřív, než ji označí za růst publika.
Proč mohou čísla u nejčtenějších článků sedět, zatímco součty se liší
Při porovnávání GA4 a NowMetrix se obvykle začíná úspěšnými články. Dává to smysl. Pokud mají důležité texty v obou systémech podobný počet zobrazení, měření zřejmě v zásadě funguje.
Celkový součet ale zahrnuje i všechny ostatní stránky.
Stačí jedno zobrazení navíc u každého z 20 000 různých článků a výsledkem je 20 000 dodatečných zobrazení. V seznamu 50 nejčtenějších článků nemusí být vůbec nic vidět. V denním reportu už rozdíl působí výrazně.
Proto se vyplatí podívat i na málo navštěvované stránky. Je rozdíl rozptýlený po archivu? Objevuje se velké množství jednotlivých návštěv? Pocházejí převážně z jedné země nebo jedné skupiny prohlížečů?
Takový vzorec může ukazovat na automatizovanou návštěvnost. Zároveň je ale potřeba ověřit, že oba nástroje měří stejné období a stejný web a že jsou oba měřicí skripty správně nasazené.
Proč blokace v Cloudflare nemusí otázku vyřešit
V těchto diskusích se často objevuje pojem „ghost traffic“, tedy zdánlivá návštěvnost v analytickém reportu, které nemusí odpovídat skutečná návštěva webu.
Web a sběr dat v Google Analytics jsou dva odlišné cíle. GA4 například může přijímat události odeslané ze serverů přes Measurement Protocol. Pro takové použití existují legitimní důvody. Zároveň to ukazuje, proč analytická událost sama o sobě nedokazuje, že na server webu dorazil nový požadavek na stránku.
Pokud falešné události přicházejí přímo do analytické služby, firewall před webem takový přenos nezastaví. Zda to vysvětluje konkrétní případ, je nutné prošetřit. Samotná absence záznamů v logu webového serveru nestačí: CDN může stránky poskytovat z mezipaměti a různé služby mohou stejné návštěvnosti přiřazovat různé země.
K neobvyklému číslu tedy může vést několik cest. Změna způsobu, jakým váš vlastní měřicí skript odesílá data, je automaticky nevyřeší všechny.
Kde bychom začali s prověřováním
Užitečné první porovnání nemusí být velký projekt. Jeden přesně vymezený den a několik cílených otázek často přinesou víc než deset dalších reportů.
- Sjednoťte období i web. Porovnejte GA4 a NowMetrix za stejný dokončený den ve stejném časovém pásmu. Zkontrolujte také název hostitele: nezahrnují čísla v GA4 subdomény nebo další weby?
- Začněte zobrazeními stránek. Počet uživatelů závisí také na tom, jak jsou lidé rozpoznáváni a jak nástroj uživatele definuje. Zobrazení stránek bývá pro první kontrolu snazší dohledat.
- Rozdělte neobvyklou návštěvnost. Země, prohlížeč, operační systém, kategorie zařízení a rozlišení obrazovky mohou ukázat, zda se rozdíl soustředí do jedné skupiny. Současně sledujte dotčené články a zapojení.
- Dohledejte několik konkrétních stránek. Porovnejte stejné časové úseky v logách CDN a v logách měření. Požadavek na stránku a zpráva odeslaná do analytického rozhraní jsou dvě různé věci.
Země nebo rozlišení obrazovky samy o sobě nejsou dostatečným důvodem k blokování návštěvníků. Podstatné důkazy vznikají, když se shoduje několik signálů a stejný vzorec lze najít i v technických datech.
Ověřte si data v GA4: země, stránky s jediným zobrazením a prohlížečeSbalit návod
Jako příklad použijeme Singapur. Hledáme stránky, které v konkrétní den získaly z této země přesně jedno zobrazení, a to za všechny prohlížeče dohromady. Návštěvnost najdeme v GA4. K výběru stránek s právě jedním zobrazením pak použijeme export CSV, který zpracujeme v Excelu, ChatGPT nebo Claude.
1. Otevřete přehled stránek
Vyberte příslušnou službu GA4 a v Přehledech otevřete Stránky a obrazovky. Podle uspořádání navigace může být přehled v části Zapojení nebo ve sbírce sestavené podle vašich obchodních cílů. Dostupné cesty vysvětluje návod Googlu k přehledu stránek.
2. Vyberte den a zemi
V pravém horním rohu vyberte jeden celý uplynulý den, například předvčerejšek. Klikněte na + Přidat filtr, zvolte Země, nastavte přesnou shodu a ze seznamu vyberte Singapur. Klikněte na Použít. Pokud služba zahrnuje více webů, přidejte do stejného filtru podmínku pro Název hostitele vašeho webu. Postup popisuje také návod Googlu k filtrům přehledů.
3. Zobrazte články spolu s prohlížeči
Nad prvním sloupcem tabulky vyberte Cesta ke stránce a třída obrazovky. Klikněte na + vedle ní a jako sekundární dimenzi přidejte Prohlížeč. Tabulka teď ukazuje Zobrazení z vybrané země pro každou kombinaci cesty ke stránce a prohlížeče.
4. Exportujte tabulku
Vpravo nahoře vyberte Sdílet tento přehled → Stáhnout soubor → Stáhnout CSV. Teď máte dvě možnosti: použít ChatGPT či Claude podle postupu níže, nebo od kroku 5 pokračovat v Excelu s kontingenční tabulkou. V obou případech počítejte pouze skutečné datové řádky. Komentáře ani případný řádek s celkovým souhrnem nezahrnujte mezi články. GA4 exportuje až 100 000 datových řádků. Pokud export dosáhne tohoto limitu nebo GA4 zobrazí seskupený řádek jako „(other)“, analýza jednotlivých stránek může být neúplná.
Alternativa: nechte analýzu na ChatGPT nebo Claude
Nechce se vám sestavovat kontingenční tabulku? CSV můžete také přiložit do ChatGPT nebo Claude a požádat o analýzu. Tím nahradíte kroky 5 až 7. Přiložte celý export z kroku 4 a do konverzace zkopírujte následující zadání. Nejprve nahraďte údaje v hranatých závorkách.
Zadání ke zkopírování:
Analyzuj přiložený CSV export z GA4. Výsledek spočítej ze všech datových řádků pomocí kódu, například v Pythonu.
V GA4 už mám nastavený tento výběr:
- Den: [datum]
- Časové pásmo služby: [časové pásmo]
- Země: [země, například Singapur]
- Název hostitele: [název hostitele nebo "bez filtru názvu hostitele"]
Najdi cesty ke stránkám, které mají v tomto výběru celkem přesně jedno zobrazení, a rozděl tato zobrazení podle prohlížeče.
1. Prohlédni soubor a jeho metadata. Potřebné sloupce jsou Cesta ke stránce a třída obrazovky, Prohlížeč a Zobrazení, případně jejich názvy v jiném jazyce. Země a název hostitele nemusí mít vlastní sloupce, pokud už byly vyfiltrované v přehledu. Upozorni na rozpory s mými údaji a zeptej se, pokud chybí sloupce nebo není jasný výběr.
2. Převeď zobrazení na čísla a zohledni oddělovače tisíců. Komentářové řádky ani celkové souhrny nepočítej jako stránky. Nejprve sečti zobrazení každé cesty ke stránce přes všechny prohlížeče a datové řádky. Teprve potom ponech cesty s celkovým počtem přesně 1. Článek s jedním zobrazením v Chromu a jedním v Safari má celkem 2 zobrazení a musí být vyřazen. Nepoužívej k tomu počty uživatelů ani relací.
3. Pro vybrané cesty ke stránkám sestav tabulku seřazenou podle počtu zobrazení: prohlížeč, zobrazení a procento ze všech vybraných zobrazení. Neznámé prohlížeče ponech jako samostatnou kategorii. Ověř, že součet zobrazení za prohlížeče odpovídá počtu vybraných cest ke stránkám. Výslovně uveď, pokud výběru neodpovídá žádná cesta.
4. Uveď počet analyzovaných cest ke stránkám, jejich celkový počet zobrazení a počet cest, které mají právě jedno zobrazení. Vybrané cesty poskytni také jako CSV s prohlížečem a počtem zobrazení. Stručně vysvětli výpočet a ukaž tři příkladové řádky, pokud jsou k dispozici.
Upozorni na limity exportu, seskupené řádky jako "(other)" a chybějící cesty ke stránkám; nepovažuj je za jednotlivé články. Závěry vztahuj pouze k tomuto exportu, nedoplňuj smyšlené hodnoty a samotný tento vzorec nevydávej za důkaz aktivity botů.
Potom několik cest z výsledku ověřte v původním exportu. Klíčové je sečíst všechna zobrazení každého článku ještě před filtrováním. Pokud chcete analýzu raději udělat v Excelu, pokračujte takto.
5. Sečtěte zobrazení každého článku
Importujte CSV do Excelu a pracujte s datovou tabulkou včetně záhlaví sloupců. Vyberte ji a zvolte Vložení → Kontingenční tabulka. Přetáhněte Cesta ke stránce a třída obrazovky do Řádků, Prohlížeč do Sloupců a Zobrazení do Hodnot. V nastavení polí hodnot zkontrolujte, že se používá Součet zobrazení. Součet napravo nyní ukazuje zobrazení každého článku ve všech prohlížečích dohromady.
6. Ponechte jen stránky s přesně jedním zobrazením
V kontingenční tabulce otevřete filtr řádkového pole Cesta ke stránce a třída obrazovky, případně Popisky řádků. Zvolte Filtry hodnot → Rovná se, vyberte součet zobrazení a zadejte 1. Článek s jedním zobrazením v Chromu a jedním v Safari se tím vyloučí, protože má celkem dvě zobrazení. Ovládání vysvětluje Microsoft v návodu k filtrování dat v kontingenční tabulce.
7. Přečtěte rozdělení podle prohlížečů
Řádek Celkový součet dole teď ukazuje, kolik těchto jednotlivých zobrazení pochází z Chromu, Safari a dalších prohlížečů. Pokud součty chybějí, zvolte Návrh → Celkové součty → Zapnuto pro řádky a sloupce. Podíl prohlížeče spočítáte vydělením jeho součtu celkovým počtem za všechny prohlížeče. Pro tento výpočet ponechte v tabulce všechny prohlížeče a z celkových součtů vylučte odfiltrované články. Možnosti popisuje návod Microsoftu k celkovým součtům.
Co výsledek znamená: přesně jedno zobrazení na cestu ke stránce ve vybrané zemi a období. Tentýž článek může mít další zobrazení z jiných zemí. Nejde o „jedno zobrazení na uživatele“ ani o „jedno zobrazení na relaci“ a samo o sobě to není důkaz aktivity botů.
Jak k tomu přistupujeme v NowMetrix
Filtrování botů je v NowMetrix součástí průběžného vývoje produktu. Rozpoznanou návštěvnost botů vyřazujeme už při sběru dat a pravidla dál udržujeme. Redakce potřebuje vědět, které články čtou lidé a kde roste zájem publika.
Proto se zabýváme i rozdíly oproti GA4. Porovnáváme články, období a skupiny návštěvnosti a pak hledáme, kde se čísla rozcházejí. Nižší číslo může být výsledkem účinného filtrování botů. Může ale také ukazovat na problém s měřením. Rozlišit tyto případy je součástí spolehlivé analytiky.
Chceme, aby čísla ve vašem přehledu v reálném čase pomáhala po celý redakční den. Špička má upozornit na článek, pomoci upřednostnit aktualizaci nebo podnítit pokračování tématu. To vyžaduje věnovat pozornost i tomu, co se skrývá za grafem.
Pokud se vaše čísla v GA4 náhle změní nebo se výrazně rozcházejí s NowMetrix, ozvěte se nám. Společně se podíváme na konkrétní případ a prozkoumáme příčinu rozdílu.
Chcete vidět, jak NowMetrix funguje s vaší návštěvností? Vyzkoušejte ho zdarma a sledujte v reálném čase, které články získávají pozornost.
Vyzkoušet NowMetrix zdarma →