Co je „kanonická stránka pro téma“ a proč je v GEO klíčová
Kanonická stránka pro téma (dále jen „CST“) je autoritativní, jednoznačný a stabilní zdroj znalostí pro konkrétní téma, který slouží jako primární uzel pro generativní modely i lidi. V kontextu Generative Engine Optimization (GEO) je cílem CST snížit neurčitost, poskytnout strojově čitelné struktury a zajistit reprodukovatelné odpovědi napříč kanály a modely. CST je optimalizována pro: (a) přesnost a auditovatelnost, (b) skládání odpovědí LLM, (c) vnitřní konzistenci v rámci znalostního grafu.
Hlavní principy návrhu CST
- Jednoznačnost a disambiguace: jasné vymezení hranic tématu, alternativních názvů, souvisejících pojmů a rozlišovacích znaků.
- Stabilita URI: trvalá, verzovaná adresa s politikou přesměrování a bez kolize s jazykovými mutacemi.
- Rozložitelnost: modularizované bloky, které lze spolehlivě citovat a extrahovat do promptů.
- Strojová sémantika: použití schema.org, JSON-LD, mikroformátů a kontrolovaných slovníků.
- Měřitelnost: jasné metriky kvality, úplnosti a aktuálnosti.
Architektura a informační model CST
Doporučená architektura vychází z vrstev:
- Identita tématu (Core Identity): název, definice, rozsah, alternativní názvy (synonyma), odlišení od blízkých témat.
- Vědomostní tvrzení (Claims): doložitelná tvrzení s atributy zdroje, data a míry jistoty.
- Kontext a rámce (Contexts): použití v oborech, příklady, protipříklady, okrajové případy.
- Operacionalizace (Tasks & Prompts): vzory promptů, kontrolní seznamy, rozhodovací stromy.
- Propojení (Graph Links): nadřazená/podřazená témata, příbuzná témata, entity, taxonomie.
- Metadata a governance: verze, kurátoři, SLA, licence, datum poslední revize.
Standardní struktura CST: doporučené sekce
- Definice a rozsah: stručná normativní definice (max. 2–3 věty) a vymezené hranice.
- Disambiguace: tabulka rozdílů oproti příbuzným pojmům, s nejméně třemi rozlišovacími znaky.
- Minimální slovník pojmů: 5–15 termínů s přesnými definicemi.
- Vědomostní tvrzení (kernely): očíslovaná, měřitelná a doložitelná tvrzení s citací a stavem jistoty.
- Procedurální rámce: kroky, kontrolní seznamy, rozhodovací větve.
- Vzorová data a schémata: malé reprezentativní datasety a jejich schémata pro syntézu.
- Testy a protipříklady: jednotkové testy pro určení hranic tématu.
- Metadata a verzování: číslo verze, datum revize, kurátor, zdroje.
Politika URL, kanonikalita a jazykové mutace
Každé téma má jednu kanonickou URL. Jazykové mutace používají hreflang a zachovávají stejný identifikátor tématu. Přesměrování řeší změny názvu, nikoli významu. Verzování doporučujeme prostřednictvím fragmentů nebo parametrů query s immutable obsahem pro audit (např. ?v=2025-10-22).
Metadata pro LLM a vyhledávače
- JSON-LD (schema.org/CreativeWork + Thing): klíče
name,alternateName,about,sameAs,citation,version,dateModified,inLanguage,license. - LLM-hints: vlastní atributy
data-pro extrakci bloků (např.data-claim-id,data-confidence). - Robots a cache: kontrola rozpočtu procházení,
ETagaLast-Modifiedpro zajištění aktuálnosti.
Formát „Claim“: doložitelná tvrzení
Každé tvrzení má identifikátor, text, zdroj, datum, míru jistoty a stav revize. Doporučená struktura:
- ID: stabilní řetězec, např.
claim:topic-slug:0001. - Text tvrzení: jedna věta bez výrazů vyjadřujících nejistotu.
- Zdroj: trvalý odkaz, typ zdroje, citace.
- Datum: datum publikace zdroje a datum posledního ověření.
- Míra nebo interval jistoty: škála (např. 0.0–1.0) a metoda odhadu.
- Stav: confirmed, contested, deprecated.
Blok „Promptability“: připravenost k vložení do promptů
CST by měla obsahovat sekci s krátkými úlohově orientovanými výňatky, které lze přímo použít jako prompt-inserts. Každý výňatek je označen účelem (vysvětlit, porovnat, shrnout, odlišit) a obsahuje zástupná místa pro proměnné.
Obsahové prvky: povinné a volitelné bloky
- Povinné: Definice, Disambiguace, Kernely tvrzení, Citace, Metadata, Verze, Propojení v grafu.
- Volitelné: Use-cases, Protipříklady, FAQ pro modely (krátké otázky a odpovědi), Minidataset, Referenční implementace (pseudokód), Vizualizace.
Šablona CST: kostra sekcí HTML
Doporučená zkrácená kostra, kterou lze přímo zreplikovat:
- Sekce Header: název tématu, verze, datum, kurátor, licence.
- Core: definice, rozsah, alternativní názvy, rozdíly oproti blízkým pojmům.
- Claims: očíslovaná tvrzení s citací a mírou jistoty.
- Contexts & Frames: oblasti použití a okrajové případy.
- Operational: kontrolní seznamy, rozhodovací stromy, vzory promptů.
- Data & Schemas: schémata JSON, příklady záznamů.
- Governance: revize, auditní stopa, kontakt na kurátora.
Minimální schémata a datové struktury
Pro zajištění extrahovatelnosti navrhněte tato schémata:
- ClaimSchema:
{id, text, source.url, source.type, date.published, date.verified, confidence, status} - TermSchema:
{term, definition, aliases[], note} - RelationSchema:
{from, to, type (broader|narrower|related), weight} - PromptSnippetSchema:
{purpose, template, variables[], constraints[]}
Propojení se znalostním grafem a ontologiemi
Každá CST by měla zpřístupňovat odkazy na nadřazená a podřazená témata a alespoň jedním směrem odkazovat na formální ontologii (SKOS, OWL). Minimálně: broader, narrower, related s popisem vztahu a váhou pro navigaci LLM během vyhledávání.
Vnitřní odkazy a sémantické kotvy
Každý obsahový blok by měl mít stabilní atribut id (např. #claim-0003), aby jej agenti mohli citovat. Odkazy musí být zřetelně rozlišeny a doplněny o aria-label pro asistivní technologie.
Schémata značení: JSON-LD a microdata
Implementujte souběžně schema.org/CreativeWork a specializované typy (např. DefinedTerm pro slovník). Pro citace použijte ScholarlyArticle nebo WebPage podle původu. Pro vazby na datasety využijte Dataset s atributy distribution a measurementTechnique.
Příklad obsahu bloků: definice, disambiguace, tvrzení
- Definice: „Kanonická stránka pro téma je autoritativní uzel obsahu a metadat, který jednoznačně reprezentuje konkrétní téma a je optimalizovaný pro extrakci a skládání obsahu v generativních systémech.“
- Disambiguace: Rozlišení „CST“ oproti „landing page“ (marketingový účel), „wiki článku“ (kolaborativní encyklopedie) a „produktové dokumentaci“ (funkční specifikace).
- Tvrzení #0001: „CST musí mít stabilní identifikátor a verzování, aby bylo možné auditovat generované výstupy.“
- Tvrzení #0002: „Zahrnutí JSON-LD výrazně zlepšuje přesnost vyhledávání agentů pracujících s webovým obsahem.“
Operacionalizace: kontrolní seznamy pro kurátory
- Je definice stručná, normativní a bez vágních formulací?
- Jsou všechna tvrzení doložitelná a mají zdroj a datum ověření?
- Existují alespoň tři rozlišovací znaky oproti příbuzným pojmům?
- Obsahuje stránka JSON-LD s požadovanými entitami?
- Jsou bloky opatřeny stabilními identifikátory (
id)? - Je přítomna sekce Promptability s alespoň čtyřmi šablonami?
- Je nastavena politika cache a ETag?
Šablony promptů (Promptability) pro LLM
- Vysvětlení: „Vysvětli téma
{topic}v rozsahu 120–160 slov s použitím definic ze sekce#glossary. Vynech analogie.“ - Porovnání: „Porovnej
{topic}a{nearby_topic}pomocí tří rozlišovacích znaků z#disambiguation. Vrať tabulku.“ - Ověření tvrzení: „Ověř
{claim_id}podle záznamů v#claims. Vrať stav a důvod.“ - Vytvoření kontrolního seznamu: „Sestav kontrolní seznam úloh pro aplikaci
{topic}podle#procedures. Omez jej na 8 bodů.“
Principy přístupnosti a použitelnosti
- Čitelnost: krátké odstavce, maximální šířka textu přibližně 70 znaků, jasné mezititulky.
- ARIA a kontrast: označení vnitřních kotev a přiměřený kontrast textu.
- Klávesová navigace: všechny kotvy a odkazy musí být přístupné bez myši.
Výkonnost a technické požadavky
- Strukturovaná data: vložená jako
<script type="application/ld+json">. - Líné vykreslování vizualizací: grafy načítat až po interakci, nikoli při prvním zobrazení.
- HTTP cachování:
Cache-Control,ETaga přesnéLast-Modified.
Governance: revize, audity, odpovědnosti
Každá CST by měla mít vlastníka (kurátora), cyklus revizí (např. čtvrtletní), sledování změn (changelog) a mechanismus pro označování sporů (contested). Auditní stopa uchovává historii tvrzení, přidaných či odstraněných zdrojů a změn definice.
Metriky kvality CST
- Coverage: podíl pokrytých klíčových aspektů tématu (%).
- Verifiability: podíl tvrzení s platnými citacemi a datem ověření.
- Stability: četnost změn definice (nižší hodnota je lepší).
- Retrieval precision: úspěšnost extrakce bloků agenty (testováno pomocí promptů).
- Latency: doba extrakce JSON-LD při indexování.
Verzování a životní cyklus
Verze jsou explicitní (např. v1.3.0) a navázané na datum revize. Změny definice zvyšují minor verzi; změny rozsahu zvyšují major verzi. Zastaralé sekce se archivují a zůstávají dostupné prostřednictvím stabilních URI s jasným upozorněním.
Bezpečnost, etika a licencování
Ujistěte se, že zdroje jsou licencovány v souladu s právními předpisy, citace jsou úplné a osobní údaje anonymizované. Uveďte licenci (např. CC BY 4.0) a předcházejte riziku halucinací tím, že zakážete zahrnování nepotvrzených tvrzení do „kernelů“.
Implementační kontrolní seznam pro nasazení
- Stabilní URL a správná přesměrování.
- Kompletní JSON-LD s klíčovými schématy.
- Identifikovaná a ohodnocená tvrzení s citacemi.
- Disambiguace vůči nejméně třem příbuzným tématům.
- Výňatky Promptability a procedurální rámce.
- Propojení se znalostním grafem a datovými zdroji.
- Přístupnost, výkon a politika cache.
- Governance: vlastník, kalendář revizí, changelog.
CST je základním stavebním prvkem GEO. Vytváří společný jazyk mezi lidmi, LLM a indexery, snižuje neurčitost a zlepšuje reprodukovatelnost generovaných odpovědí. Dobře navržená CST kombinuje přesný obsah, strojovou sémantiku a procesy kurátorství, a stává se tak spolehlivou kotvou pro generativní systémy i dlouhodobý rozvoj znalostní báze.
