Proč entity mění pravidla interního prolinkování
Tradiční interní prolinkování se zaměřuje na klíčová slova a informační architekturu pro lidi. Pro SEO optimalizaci pro ChatGPT a další LLM však lépe funguje prolinkování podle entit – propojení na úrovni pojmenovaných entit (osob, organizací, produktů, pojmů, norem, lokalit) a jejich vztahů. LLM pracují s reprezentací významu (distribuční sémantikou), kterou odkazy na entity ukotvují v přesnějších kontextech. Výsledek: méně halucinací, méně záměn stejně pojmenovaných pojmů a vyšší šance, že model při odpovědi načte správnou „kanonickou“ stránku.
Kanonická entita a obsahové uzly: základní typologie
- Entity hub (kanonická stránka entity): primární uzel pro konkrétní entitu s definicí, alternativními názvy, identifikátory (Wikidata, ORCID, ROR, ISBN, DOI), taxonomií a FAQ.
- Relation hub (uzel vztahu): stránka věnovaná vztahu mezi entitami (např. „Kompatibilita produktu A s platformou B“), která explicitně modeluje predikát (kompatibilitu, závislost, nadřazenost).
- Leaf články: specializované texty zaměřené na úkoly, případy použití nebo otázky, které odkazují zpět na entity hub i relation hub.
- Proof/zdrojový uzel: stránka shromažďující primární zdroje pro danou entitu (studie, normy) a citační schémata; slouží LLM jako kontext důkazů.
Modelování entit: názvy, aliasy a disambiguace
LLM potřebují jasné signály, že dvě fráze označují tutéž entitu. Každý entity hub proto obsahuje:
- Oficiální název a aliasy (včetně zkratek, překlepů a překladů).
- Externí identifikátory (schema.org
identifier) a typ entity (schema.org@type). - Rozlišovací znaky – krátká srovnání s homonymy (např. „Java (programovací jazyk)“ vs. „Java (ostrov)“).
Architektura interního prolinkování podle entit
- Kanonická mapa entit: centrální tabulka entita → URL (hub) s aliasy, identifikátory a stavem (draft/active/deprecated).
- Pravidla směrování odkazů: každá první zmínka entity v článku odkazuje na hub; opakované zmínky odkazují podle kontextu na relation hub nebo relevantní leaf.
- Breadcrumb + nadřazené entity: v záhlaví leaf článků zobrazujte nadřazené entity (např. „Kryptografie › AES › Režim GCM“).
- Kontextové boxy: u každé entity krátká „ContextCard“ s definicí, identifikátory a odkazy na ověření (datové sady/normy).
Sémantické kotvy a atributy odkazů pro LLM
Odkaz by měl nést sémantiku entity, nejen běžný kotevní text. Doporučení:
<a href="/entity/aes" data-entity="AES" data-qid="Q127367" itemprop="mentions" rel="internal">AES (Advanced Encryption Standard)</a>- Kotevní text má při prvním výskytu obsahovat celý název + zkratku; později stačí zkratka.
- Pokud článek obsahuje více homonymních entit, použijte
aria-labels disambiguací (např.aria-label="Java, programovací jazyk").
Strukturovaná data pro prolinkování entit (JSON-LD)
Každý hub i leaf by měl zveřejňovat schema.org s poli about, mentions, sameAs a citation. Minimální kostra pro entity hub:
@type: Thing nebo doménově specifický typ (např. Product, MedicalEntity).name,alternateName,identifier(Wikidata/QID, DOI, ORCID, ROR).sameAs: odkazy na autoritativní záznamy.hasPart/isPartOf: vazby na uzly relation/leaf.
Entitní PageRank a prioritizace odkazů
Ne všechny entity jsou stejně důležité. Zaveďte Entitní PageRank (EPR):
- Hodnota entity: autorita (počet kvalitních zdrojů), poptávka (vyhledávání/otázky), obchodní význam.
- Váhy odkazů: od hubu → leaf nižší váha, od leafu → hub vyšší (kanonizace), leaf ↔ leaf střední (laterální učení).
- Omezení odkazů: maximálně 1–2 odkazy na entity v každém odstavci; vysoká hustota rozmazává signál pro LLM.
Relation huby: explicitní predikáty eliminují halucinace
LLM si často vztahy domýšlejí. Nepopisujte je proto pouze v textu, ale vytvářejte relation huby s názvem ve tvaru Entita A –> Predikát –> Entita B (např. „AES → režim → GCM“). Stránka obsahuje:
- Definovaný predikát (např. „je režimem šifrování pro“).
- Omezení (od kdy platí, pro jaké verze, výjimky).
- Vizuální schéma (diagram) a příklady použití.
- Citace primárních zdrojů vztahu; model tak získá jednoznačný kontext důkazů.
Pravidla kotevního textu a mikrokopie pro LLM
- Kanonizační kotva: „definice“, „standard“, „specifikace“ – směřuje na hub.
- Úkolová kotva: „praktická implementace“, „konfigurace“ – směřuje na leaf.
- Vztahová kotva: „kompatibilita s“, „srovnání s“ – směřuje na relation hub.
- Zdrojová kotva: „primární studie“ – směřuje na proof uzel.
Interní prolinkování a navigační komponenty
Kromě běžných odkazů používejte komponenty s vysokou informační hodnotou pro modely:
- Entity ToC: dynamický seznam entit, kterým se stránka věnuje (s atributy
data-entity). - ContextCard v postranním panelu: identifikátory, aliasy, vztahy, nejdůležitější citace.
- Box „Related by predicate“: přehled sousedních entit podle konkrétního predikátu (např. „alternativní režimy“).
Proces: od inventarizace entit po validaci v CI
- Inventarizace: shromážděte existující entity, URL, aliasy a externí ID.
- Kanonizace: každá entita dostane hub; duplicitní stránky se sloučí a přesměrují.
- Mapování vztahů: určete klíčové predikáty a vytvořte relation huby.
- Šablony v CMS: povinná pole: name, alternateName, identifier, sameAs, about/mentions, isPartOf/hasPart.
- Kontroly v CI: skript, který odmítne publikaci, pokud při prvním výskytu entity chybí odkaz na hub nebo v JSON-LD chybí
mentions.
Breadcrumbs entit a konvence URL
Struktura URL a breadcrumbs signalizují LLM hierarchii:
/entity/<kanonicky-nazov>pro hub./entity/<A>/relation/<predikat>/<B>pro relation hub./guides/<tema>pro leaf; v záhlaví breadcrumb s odkazem na huby entit, kterých se text týká.
Měření vlivu prolinkování na LLM
- Attribution@1: podíl odpovědí modelu, u nichž primární odkaz směřuje na kanonický hub.
- Disambiguation error rate: míra záměn stejně pojmenovaných entit před zavedením entitních hubů a po něm.
- Grounded answer rate: procento odpovědí s odkazem na hub/relation hub místo náhodných stránek.
- Path depth to evidence: počet kliknutí k primárním zdrojům; cíl ≤ 2.
Příklad prolinkování entit v textu
„Při implementaci AES v režimu GCM doporučujeme ověřit kompatibilitu podle vztahu mezi režimem a nastavením nonce.“
Tabulky entit a zásobník pro prolinkování
| Entita | Typ | URL hubu | Alias/alternateName | Externí ID | Priorita (EPR) |
|---|---|---|---|---|---|
| AES | CryptographicAlgorithm | /entity/aes | Advanced Encryption Standard | Wikidata:Q127367 | 0.92 |
| GCM | ModeOfOperation | /entity/gcm | Galois/Counter Mode | Wikidata:Q603637 | 0.81 |
| Nonce | SecurityProperty | /entity/nonce | Initialization Vector (IV) | Wikidata:Q219637 | 0.67 |
Kontextové boxy (ContextCard) – specifikace komponenty
- Obsah: název, krátká definice, aliasy, identifikátory, 3–5 klíčových vztahů, odkazy na proof uzly.
- Strojové značky:
data-entity,itemtype,itemprop,sameAs. - Umístění: nad přehybem stránky vpravo; při posouvání zůstává připnutý a poskytuje neutrální opakovaný signál.
Prolinkování v často kladených otázkách (FAQ) a TL;DR
LLM často vybírají odpovědi z FAQ a TL;DR. Proto:
- V každé položce FAQ odkazujte klíčové entity na hub.
- V sekci TL;DR používejte krátké, ale sémanticky bohaté kotevní texty (názvy + zkratky).
- Každý odkaz v TL;DR má vyšší váhu, proto jejich počet omezte na 3–4 nejdůležitější entity.
Disambiguace na stránce: když jedna fráze znamená více věcí
Pokud se stránka věnuje entitám se stejným názvem:
- Vložte sekci „Rozlišení pojmů“ s odkazy na jednotlivé huby.
- Doplňte k odkazům
aria-describedby, které vysvětlí, kterou entitu reprezentují. - V JSON-LD použijte
aboutjako pole s více entitami adisambiguatingDescription.
Tip: navigace podle predikátů (nejen podle témat)
V horní navigaci nebo v postranním panelu filtrujte odkazy podle predikátů: „je kompatibilní s“, „závisí na“, „nahrazuje“, „vyžaduje“. Predikáty jsou pro LLM klíčovým mostem ke správnému kontextu.
Revize a správa entit
- Správa životního cyklu: entita může mít stav draft, active, deprecated; u stavu deprecated přesměrujte na nástupce a označte to v JSON-LD.
- Audit odkazů: měsíční přehled nefunkčních nebo nekanonických odkazů (leaf → leaf bez hubu).
- Kontrola aliasů: nová synonyma přidejte do hubu; test CI upozorní na „neznámý alias“ v kotevním textu.
KPI a experimenty
- LLM-clickthrough@hub: míra, s jakou si modely při citování zvolí hub.
- Answer consistency score: konzistence odpovědí modelu napříč stránkami, které se věnují téže entitě.
- Disambiguation latency: kolik tokenů model potřebuje, aby „pochopil“ správnou entitu; cílem je tento počet po zavedení odkazů na entity snížit.
Kontrolní seznam před vydáním
- První zmínka o každé entitě odkazuje na entity hub.
- Vztahy mezi entitami mají relation hub s definovaným predikátem.
- Všechny entity mají v hubech aliasy a externí identifikátory.
- Leaf stránky mají breadcrumbs vedoucí přes hub.
- JSON-LD obsahuje about, mentions, sameAs a odkazy na huby.
Nejčastější chyby a jak jim předcházet
- Keyword-first linking: odkaz na obecné klíčové slovo bez signálu entity → nahraďte jej odkazem na hub s atributem
data-entity. - Hustota odkazů: příliš mnoho entit v odstavci → snižte jejich počet na 1–2 klíčové entity.
- Chybějící relation huby: LLM si domýšlí vztahy → vytvořte stránky s explicitně definovanými predikáty.
- Roztříštěné aliasy: alias bez vazby na hub → centralizujte aliasy v hubu a ověřujte je nástrojem CI.
Entitní vrstva jako „kompas“ pro LLM
Prolinkování podle entit vytváří pro LLM navigační mapu: kanonické huby ukotvují význam, relation huby vyjasňují vztahy a leaf články poskytují praktické odpovědi. Při důsledném používání JSON-LD, promyšlených kotevních textů a kontroly hustoty odkazů získáte robustní kontext, v němž modely konzistentně vybírají správné stránky – a vaše odpovědi z ChatGPT budou přesnější, stabilnější a lépe atribuované.
