- autor Redakce
- 07. 10. 2026
Na dashboardu vám vyskočí lepší AI citations, vedle konkurence svítí vyšší visibility share a vy už máte v reportu závěr. Jenže v článku IQRush Rona Sielinskiho, který připomíná i tým ze St. Gallen, se ukazuje opak: jeden snapshot může být jen šum. Zdroj navíc publikuje spoluzakladatel firmy, která měření prodává.
Data o sledování viditelnosti AI nejsou zcela spolehlivá, protože generativní modely často vracejí různé odpovědi. Jedno číslo na panelu proto zachytí jen okamžik z proměnlivého cíle.
Stejný dotaz v SearchGPT, Gemini nebo Perplexity může při každém pokusu přinést jiné zdroje. Rozdíl mezi dvěma weby pak může znamenat skutečný náskok, nebo jen kolísání mezi měřeními.
Podíl citací a hodnocení má smysl jen tehdy, když se opakované výsledky začnou stabilizovat a zároveň mezi top výsledky vznikne dostatečný odstup. Bez toho i rozdíl, který vypadá přesvědčivě, může být jen šum.
Zmíněný preprint IQRush ukazuje, že potřebný počet odpovědí se v testech pohyboval mezi 33 a 94. V části případů nestačilo ani 125 otázek, což přesné pozice mimo špičku posouvá do velmi slabě obhajitelné zóny.
Z dat vyplývá i další důležitá věc: platformy se neliší jen počtem citací, ale množstvím nezávislé informace v odpovědích. Proto stejný rozpočet nemusí u různých systémů dát stejnou jistotu a jednorázový vzorek nás snadno svede k přepjatému závěru.
Odpověď má dvě části a obě musí platit současně. Pořadí se musí přestat měnit a rozdíl mezi nejlepšími stránkami musí převýšit chybu měření.
Na začátku se hodnocení často hýbe, protože přibývají nové odpovědi a žádná stránka ještě nemá jasný náskok. Studie zároveň sleduje, zda se rozdíl mezi nejlepšími výsledky vůbec odliší od šumu.
Když je rozdíl větší než chyba měření, hodnocení ukazuje skutečný rozdíl. Když ne, vidíme spíš statistický šum. Ve 30 testech se potřebný počet odpovědí pohyboval mezi 33 a 94.
Tři z 30 testů se nedostaly k dostatečně odlišenému hodnocení ani po 125 otázkách. Všechny tři běžely na SearchGPT, kde byly nejlepší stránky příliš podobné na to, aby se daly spolehlivě rozlišit.
Žádný jednotný limit proto neplatí všude.
Pro reporting AI viditelnosti platí jednoduché pravidlo: nevybíráme tracker podle sebevědomého čísla, ale podle toho, zda ukáže výpočet a opakování. Čisté číslo na panelu může být varováním, ne uklidněním.
Tracker s opakovaným měřením a rozsahem dává větší hodnotu než jednorázový výstup. Když data nestačí, je férovější přiznat, že zatím nelze říct. Přesné pozice za čelem žebříčku se reportují jen těžko obhajitelně.
Vrchol žebříčku se obhajuje nejlépe, ale i tam chyby zůstávají. S dostatečným počtem odpovědí se lídři oddělují od středu a konce, přesto top 10 není bezchybné. Pod čelními pozicemi se chyba rychle rozšiřuje a přesnost dál slábne.
Do reportů proto patří rozsah, ne falešná desetinná čárka. Dokud Search Console neřekne, která kliknutí přišla z AI, potřebujeme kontrolu opakovat víc než jednou a hlásit, co data unesou.
Nic z toho nepochází z hotové, recenzované studie. Jde o předtisk založený na 30 testech na třech platformách.
Autoři pracovali s otázkami generovanými ChatGPT, ne se skutečnými uživatelskými dotazy, a sběr proběhl během jediného období. Přesná čísla proto bez problému nepřenášíme na jiná témata ani období.
Počty zahrnují jen odpovědi s citacemi. Na SearchGPT část otázek žádné citace nevrací. V jednom tématu 125 otázek přineslo 104 použitelných odpovědí, tedy 17% neúspěch.
Metoda navíc testuje sama sebe: porovnává rané a konečné hodnocení stejné kolekce, ne proti externí pravdě. Autoři z Univerzity v St. Gallen dospěli ve vlastní analýze ke stejnému závěru: jedno měření je nespolehlivé a motor musíme vzorkovat opakovaně.
Na hlavní otázku je odpověď poměrně přímočará: měření AI citací a viditelnosti začíná dávat smysl teprve ve chvíli, kdy se výsledky opakovaně stabilizují a zároveň je mezi prvními pozicemi dost velký odstup na to, aby převážil šum. Pokud nástroj neumí ukázat více běhů, rozptyl a chvíli, kdy už dat není dost, nepůsobí přesněji — působí jen sebejistěji.
To je pro praxi důležitější než jakékoli pěkné pořadí v panelu. Jedno měření nás snadno navede k falešnému závěru, že máme jasného vítěze nebo naopak problém, který ve skutečnosti neexistuje. My bychom proto neměli reportovat snapshot, ale rozpětí a míru nejistoty. Teprve pak se z AI visibility reportingu stává rozhodovací nástroj, ne dekorace do prezentace.
Praktický filtr je jednoduchý: pokud se výsledek po opakování mění, rozdíl mezi weby je menší než chyba měření nebo nástroj neumí říct, že data nestačí, není čas na ostré závěry. V takové chvíli je přesné číslo spíš varování než jistota. A právě to bývá v marketingu nejčastější chyba — zaměníme snadno čitelný výstup za spolehlivý signál.
Až ve chvíli, kdy se po opakovaném měření přestane výrazně měnit pořadí a rozdíl mezi výsledky je větší než chyba měření. Jedno číslo nestačí.
Pro reporting je lepší rozsah, pokud je podložený opakovaným měřením. Přesná hodnota bez kontextu stability často budí větší jistotu, než jakou data skutečně mají.
Brát ho jako orientační výstup, ne jako podklad pro rozhodnutí. Bez rozptylu a opakování nepoznáme, jestli jde o signál, nebo jen náhodný běh.
Každá platforma pracuje s jiným množstvím a typem informace. Proto stejný rozpočet nebo stejný dotaz nemusí dát stejnou míru jistoty ani srovnatelný výsledek.
Když se výsledky ani po opakování nesrovnají a rozdíly mezi nejlepšími pozicemi jsou stále menší než šum. V tu chvíli je poctivější reportovat nejistotu než předstírat přesnost.