Proč jsou benchmarky pro GEO (Generative Engine Optimization) klíčové
GEO – optimalizace pro generativní modely – vyžaduje jiný přístup k měření kvality než klasické SEO. Namísto pozic ve výsledcích vyhledávání sledujeme, jak modely konzumují, citují a transformují náš obsah. Dobře navržené benchmarky a srovnávací tabulky s jasnou metodikou jsou proto základem: pomáhají odlišit skutečné zlepšení od šumu, nastavují trvalé srovnávací linie a umožňují transparentně informovat o pokroku týmu i zainteresované strany.
Typy benchmarků pro GEO a co měří
- Přístupnost pro model (Content Accessibility): technické signály jako
robots, sitemapy, feedy, prvkyschema.orgpro strukturovaná data, rychlost a stabilita. - Konzumace a citování (Consumption & Attribution): zda model čerpá ze zdroje, cituje ho a odkazuje na něj; míra „attributable answers“.
- Ověřitelnost (Grounding & Faithfulness): podíl tvrzení podložených obsahem zdroje; míra halucinací.
- Navigovatelnost (Machine Navigation): schopnost modelu najít správnou sekci, kotvu, graf či tabulku.
- Aktuálnost (Freshness Uptake): doba, za kterou se změna (changelog, aktualizační banner) projeví v odpovědích modelu.
- Extrahovatelnost dat (Data Extractability): úspěšnost při extrakci tabulek, schémat, čísel a jednotek.
- Ekonomika interakcí (Cost/Lag): latence odpovědí modelů na naše dotazy a náklady na evaluaci.
Metodické pilíře: aby byly tabulky srovnatelné
- Jasné definice metrik s jednoznačným výpočtem, jednotkami a rozsahem (0–1 nebo 0–100).
- Reprezentativní testovací sada pokrývající hlavní případy použití (navigační, faktické, strukturované, multimodální).
- Randomizace a zaslepení při manuálním hodnocení (anotátoři nevidí verzi stránky ani experimentální skupinu).
- Reliabilita hodnocení: dvojí hodnocení, výpočet shody (např. Krippendorffovo α) a rozhodnutí o sporných případech.
- Statistická významnost: párové testy (Wilcoxon/t-test), intervaly spolehlivosti (bootstrap) a korekce na vícenásobná porovnání.
- Reprodukovatelnost: pevně stanovené parametry modelů (teplota, seed), verzování datasetů, přesné zaznamenávání jednotlivých kroků.
Referenční metriky: definice, vzorec, interpretace
| Metrika | Definice | Výpočet | Rozsah | Interpretace |
|---|---|---|---|---|
| Attribution Rate | Podíl odpovědí, které jako zdroj uvádějí náš zdroj (URL/brand). | #odpovědí s atribucí / #relevantních odpovědí | 0–1 | Vyšší hodnota je lepší; cíl ≥ 0,7 u klíčových témat. |
| Faithfulness | Podíl tvrzení v odpovědi, která lze podložit textem na naší stránce. | #podložených tvrzení / #tvrzení | 0–1 | Citlivá na kvalitu citací a srozumitelnost zdroje. |
| Freshness Uptake (d) | Počet dní od zveřejnění změny do jejího promítnutí v odpovědích modelu. | median(čas_promítnutí − čas_zveřejnění) | ≥0 | Nižší hodnota je lepší; uvádějte medián i IQR. |
| Table Extractability | Úspěšnost extrakce tabulek (záhlaví, jednotky, poznámky). | #správně extrahovaných polí / #všech polí | 0–1 | Kontrolujte také konzistenci jednotek a typů. |
| Machine Navigation@1 | Zda model najde přesnou sekci/anchor na první pokus. | #úspěchů@1 / #dotazů | 0–1 | U dlouhých stránek sledujte také @K (např. @3). |
Struktura srovnávací tabulky: „metrika × varianta obsahu“
Srovnávací tabulky by měly současně propojovat čísla s kontextem metodiky. Následující šablonu lze použít pro A/B testy (Control vs. Variant) i pro víceramenná srovnání.
| Varianta | Attribution Rate | Faithfulness | Freshness Uptake (d) | Table Extractability | Machine Nav@1 | n (dotazy) | p-hodnota | Metodické poznámky |
|---|---|---|---|---|---|---|---|---|
| Control | 0,52 | 0,74 | 9 | 0,81 | 0,46 | 400 | – | Bez JSON-LD; statické tabulky. |
| Variant | 0,69 | 0,83 | 4 | 0,92 | 0,63 | 400 | < 0,01 | Přidán JSON-LD, aria-describedby, kotvy sekcí. |
Kompozitní skóre a vážení metrik
Pro rychlé sdělení výsledků napříč týmy je praktické sestavit kompozitní skóre. Doporučený postup:
- Normalizace: každou metriku transformujte na škálu 0–100 (min–max nebo z-score → percentil).
- Váhy: stanovte strategické váhy (např. Attribution 30 %, Faithfulness 30 %, Freshness 20 %, Navigation 10 %, Extractability 10 %).
- Výpočet: GeoScore = Σ(wi × mi, norm), uvádějte také 95% CI (bootstrap nad dotazy).
| Metrika | Skóre (0–100) | Váha | Příspěvek |
|---|---|---|---|
| Attribution | 78 | 0,30 | 23,4 |
| Faithfulness | 85 | 0,30 | 25,5 |
| Freshness | 66 | 0,20 | 13,2 |
| Navigation | 59 | 0,10 | 5,9 |
| Extractability | 88 | 0,10 | 8,8 |
| GeoScore | – | 1,00 | 76,8 |
Konstrukce testovací sady: mix dotazů a scénářů
- Navigační dotazy: „Kde je na stránce metodika?“, „Zobrazit srovnávací tabulku“.
- Faktické dotazy: „Jaký je medián Freshness Uptake?“, „Které verze mění Attribution Rate?“
- Extrahovací dotazy: „Vytáhni sloupce z tabulky Benchmark Overview“.
- Multimodální dotazy: „Jak interpretovat graf s intervaly spolehlivosti?“
- Negativní kontroly: dotazy mimo rozsah pokrytí, které umožňují odlišit správnou odpověď od „vymyšlené“.
Protokol manuálního hodnocení (pokud jsou součástí metriky lidé)
- Rubrika s kritérii (faktická správnost, úplnost, citování zdrojů, konzistentní terminologie).
- Kalibrace anotátorů na malém zlatém standardu; opakovaná kalibrace při poklesu shody.
- Shoda hodnotitelů: uvádějte Krippendorffovo α nebo Cohenovo κ; cíl ≥ 0,67 pro výzkumné využití.
- Rozhodnutí o sporných případech: třetí hodnotitel řeší spory a vytváří referenční „gold“ odpovědi.
Statistické testování a intervaly
- Volba testu: u párových metrik s nenormálním rozdělením upřednostněte Wilcoxonův test; u binárních úspěchů McNemarův test.
- CI: bootstrap nad dotazy (≥ 1000 replikací) pro robustní 95% intervaly.
- Vícenásobná porovnání: kontrola FDR (Benjamini–Hochberg) při > 2 variantách.
- Velikost efektu: kromě p-hodnot uvádějte také procentní rozdíl a Cliffovo delta.
Dokumentace metodiky přímo v tabulce
Každá srovnávací tabulka by měla obsahovat metodickou stopu: kdo, kdy, na čem a s jakými parametry měřil. Usnadníte tím audit i opakování testu.
| Položka | Popis |
|---|---|
| Dataset v. | geo-bench-v3 (n=800 dotazů; oblasti: produkt, dokumentace, blog). |
| Modely | Model-A (T=0,2), Model-B (T=0,0); jednotné max_tokens, jednotné nástroje. |
| Parametry | Seed=2025; retries=1; jednotné stop-sekvence; časové okno bez změn na webu. |
| Hodnocení | Zaslepené dvojí hodnocení; α=0,71; rozhodnutí o sporných případech u 12 % případů. |
| Statistika | Bootstrap 2000; párový Wilcoxonův test; BH FDR=5 %. |
Publikování výsledků: srozumitelné pro lidi, strojově extrahovatelné
- Tabulky se záhlavími a vysvětlivkami (poznámky pod čarou, jednotky, odkazy na metodiku).
- Jednoznačné kotvy (
idu sekcí,<caption>u tabulek) pro hluboké odkazy. - ARIA a struktura:
aria-describedbyz tabulek na text metodiky,scope="col"v záhlavích. - Datové atributy: minimálně
data-metric,data-variant,data-sourceu každého prvku buňky pro snadnou extrakci.
Časté chyby a jak se jim vyhnout
- Srovnávání nesrovnatelného: změněné parametry modelu nebo odlišná doba měření.
- Metodika mimo tělo výsledků: tabulky bez jasné „stopy“ se obtížně auditují.
- P-hacking: selektivní vykazování metrik; používejte předem registrované plány měření.
- Nedostatečné n: malá velikost vzorku rozšiřuje CI a činí závěry křehkými.
Karta benchmarku (šablona na stránce)
| Rubrika | Obsah (vyplnit) |
|---|---|
| Název benchmarku | GEO Benchmark – Citování a extrakce tabulek |
| Verze & datum | v3 • 2025-10-22 |
| Dataset | 800 dotazů; 4 oblasti; poměr navigačních/faktických/extrakčních 30/40/30 |
| Metriky | Attribution, Faithfulness, Freshness, Nav@1, Extractability |
| Model/Parametry | Model-A (T=0,2); seed 2025; max_tokens=1024 |
| Metodika | Zaslepené dvojí hodnocení; α=0,71; Wilcoxonův test; BH 5 % |
| Hlavní výsledek | Variant > Control v Attribution (+17 bazických bodů) a Extractability (+11 bazických bodů) |
| Omezení | V této verzi nejsou k dispozici multimodální schémata pro grafy |
Plán zlepšování tabulek a metodiky
- Verzování tabulek: „v1, v2…“ přímo v
<caption>s odkazem na changelog. - Intervaly spolehlivosti v tabulce: zobrazovat ± CI u každé metriky (ne pouze u kompozitního skóre).
- Standardizované poznámky: vzorové formulace pro změněné parametry nebo omezení.
- Strojové tagování:
data-ci-low,data-ci-high,data-nv buňkách pro snadnou extrakci.
Mini-checklist před publikováním benchmarku
- Mají metriky jasnou definici a rozsah (0–1 nebo 0–100)?
- Je zveřejněn dataset a jeho verze?
- Lze parametry modelů a hodnocení reprodukovat?
- Je uvedena statistická metodika (testy, CI, korekce)?
- Obsahují tabulky kotvy, popisy a poznámky?
Shrnutí
Benchmarky a srovnávací tabulky s důslednou metodikou jsou páteří GEO. Zajišťují férová srovnání, odolnost vůči šumu, auditovatelnost a přímou využitelnost pro lidi i stroje. Když jsou navrženy s důrazem na atribuci, ověřitelnost, aktuálnost a extrakci dat – a doplněny transparentní statistikou – stávají se stabilním kompasem při tvorbě obsahu, který generativní modely upřednostňují a důvěryhodně citují.
