Interní prolinkování podle entit: navádění LLM ke správnému kontextu

Interné prelinkovanie podľa entít: Navádzanie LLM na správny kontext

Proč entity mění pravidla interního prolinkování

Tradiční interní prolinkování se zaměřuje na klíčová slova a informační architekturu pro lidi. Pro SEO optimalizaci pro ChatGPT a další LLM však lépe funguje prolinkování podle entit – propojení na úrovni pojmenovaných entit (osob, organizací, produktů, pojmů, norem, lokalit) a jejich vztahů. LLM pracují s reprezentací významu (distribuční sémantikou), kterou odkazy na entity ukotvují v přesnějších kontextech. Výsledek: méně halucinací, méně záměn stejně pojmenovaných pojmů a vyšší šance, že model při odpovědi načte správnou „kanonickou“ stránku.

Kanonická entita a obsahové uzly: základní typologie

  • Entity hub (kanonická stránka entity): primární uzel pro konkrétní entitu s definicí, alternativními názvy, identifikátory (Wikidata, ORCID, ROR, ISBN, DOI), taxonomií a FAQ.
  • Relation hub (uzel vztahu): stránka věnovaná vztahu mezi entitami (např. „Kompatibilita produktu A s platformou B“), která explicitně modeluje predikát (kompatibilitu, závislost, nadřazenost).
  • Leaf články: specializované texty zaměřené na úkoly, případy použití nebo otázky, které odkazují zpět na entity hub i relation hub.
  • Proof/zdrojový uzel: stránka shromažďující primární zdroje pro danou entitu (studie, normy) a citační schémata; slouží LLM jako kontext důkazů.

Modelování entit: názvy, aliasy a disambiguace

LLM potřebují jasné signály, že dvě fráze označují tutéž entitu. Každý entity hub proto obsahuje:

  • Oficiální název a aliasy (včetně zkratek, překlepů a překladů).
  • Externí identifikátory (schema.org identifier) a typ entity (schema.org @type).
  • Rozlišovací znaky – krátká srovnání s homonymy (např. „Java (programovací jazyk)“ vs. „Java (ostrov)“).

Architektura interního prolinkování podle entit

  1. Kanonická mapa entit: centrální tabulka entita → URL (hub) s aliasy, identifikátory a stavem (draft/active/deprecated).
  2. Pravidla směrování odkazů: každá první zmínka entity v článku odkazuje na hub; opakované zmínky odkazují podle kontextu na relation hub nebo relevantní leaf.
  3. Breadcrumb + nadřazené entity: v záhlaví leaf článků zobrazujte nadřazené entity (např. „Kryptografie › AES › Režim GCM“).
  4. Kontextové boxy: u každé entity krátká „ContextCard“ s definicí, identifikátory a odkazy na ověření (datové sady/normy).

Sémantické kotvy a atributy odkazů pro LLM

Odkaz by měl nést sémantiku entity, nejen běžný kotevní text. Doporučení:

  • <a href="/entity/aes" data-entity="AES" data-qid="Q127367" itemprop="mentions" rel="internal">AES (Advanced Encryption Standard)</a>
  • Kotevní text má při prvním výskytu obsahovat celý název + zkratku; později stačí zkratka.
  • Pokud článek obsahuje více homonymních entit, použijte aria-label s disambiguací (např. aria-label="Java, programovací jazyk").

Strukturovaná data pro prolinkování entit (JSON-LD)

Každý hub i leaf by měl zveřejňovat schema.org s poli about, mentions, sameAs a citation. Minimální kostra pro entity hub:

  • @type: Thing nebo doménově specifický typ (např. Product, MedicalEntity).
  • name, alternateName, identifier (Wikidata/QID, DOI, ORCID, ROR).
  • sameAs: odkazy na autoritativní záznamy.
  • hasPart/isPartOf: vazby na uzly relation/leaf.

Entitní PageRank a prioritizace odkazů

Ne všechny entity jsou stejně důležité. Zaveďte Entitní PageRank (EPR):

  1. Hodnota entity: autorita (počet kvalitních zdrojů), poptávka (vyhledávání/otázky), obchodní význam.
  2. Váhy odkazů: od hubu → leaf nižší váha, od leafu → hub vyšší (kanonizace), leaf ↔ leaf střední (laterální učení).
  3. Omezení odkazů: maximálně 1–2 odkazy na entity v každém odstavci; vysoká hustota rozmazává signál pro LLM.

Relation huby: explicitní predikáty eliminují halucinace

LLM si často vztahy domýšlejí. Nepopisujte je proto pouze v textu, ale vytvářejte relation huby s názvem ve tvaru Entita A –> Predikát –> Entita B (např. „AES → režim → GCM“). Stránka obsahuje:

  • Definovaný predikát (např. „je režimem šifrování pro“).
  • Omezení (od kdy platí, pro jaké verze, výjimky).
  • Vizuální schéma (diagram) a příklady použití.
  • Citace primárních zdrojů vztahu; model tak získá jednoznačný kontext důkazů.

Pravidla kotevního textu a mikrokopie pro LLM

  • Kanonizační kotva: „definice“, „standard“, „specifikace“ – směřuje na hub.
  • Úkolová kotva: „praktická implementace“, „konfigurace“ – směřuje na leaf.
  • Vztahová kotva: „kompatibilita s“, „srovnání s“ – směřuje na relation hub.
  • Zdrojová kotva: „primární studie“ – směřuje na proof uzel.

Interní prolinkování a navigační komponenty

Kromě běžných odkazů používejte komponenty s vysokou informační hodnotou pro modely:

  • Entity ToC: dynamický seznam entit, kterým se stránka věnuje (s atributy data-entity).
  • ContextCard v postranním panelu: identifikátory, aliasy, vztahy, nejdůležitější citace.
  • Box „Related by predicate“: přehled sousedních entit podle konkrétního predikátu (např. „alternativní režimy“).

Proces: od inventarizace entit po validaci v CI

  1. Inventarizace: shromážděte existující entity, URL, aliasy a externí ID.
  2. Kanonizace: každá entita dostane hub; duplicitní stránky se sloučí a přesměrují.
  3. Mapování vztahů: určete klíčové predikáty a vytvořte relation huby.
  4. Šablony v CMS: povinná pole: name, alternateName, identifier, sameAs, about/mentions, isPartOf/hasPart.
  5. Kontroly v CI: skript, který odmítne publikaci, pokud při prvním výskytu entity chybí odkaz na hub nebo v JSON-LD chybí mentions.

Breadcrumbs entit a konvence URL

Struktura URL a breadcrumbs signalizují LLM hierarchii:

  • /entity/<kanonicky-nazov> pro hub.
  • /entity/<A>/relation/<predikat>/<B> pro relation hub.
  • /guides/<tema> pro leaf; v záhlaví breadcrumb s odkazem na huby entit, kterých se text týká.

Měření vlivu prolinkování na LLM

  • Attribution@1: podíl odpovědí modelu, u nichž primární odkaz směřuje na kanonický hub.
  • Disambiguation error rate: míra záměn stejně pojmenovaných entit před zavedením entitních hubů a po něm.
  • Grounded answer rate: procento odpovědí s odkazem na hub/relation hub místo náhodných stránek.
  • Path depth to evidence: počet kliknutí k primárním zdrojům; cíl ≤ 2.

Příklad prolinkování entit v textu

„Při implementaci AES v režimu GCM doporučujeme ověřit kompatibilitu podle vztahu mezi režimem a nastavením nonce.“

Tabulky entit a zásobník pro prolinkování

Entita Typ URL hubu Alias/alternateName Externí ID Priorita (EPR)
AES CryptographicAlgorithm /entity/aes Advanced Encryption Standard Wikidata:Q127367 0.92
GCM ModeOfOperation /entity/gcm Galois/Counter Mode Wikidata:Q603637 0.81
Nonce SecurityProperty /entity/nonce Initialization Vector (IV) Wikidata:Q219637 0.67

Kontextové boxy (ContextCard) – specifikace komponenty

  • Obsah: název, krátká definice, aliasy, identifikátory, 3–5 klíčových vztahů, odkazy na proof uzly.
  • Strojové značky: data-entity, itemtype, itemprop, sameAs.
  • Umístění: nad přehybem stránky vpravo; při posouvání zůstává připnutý a poskytuje neutrální opakovaný signál.

Prolinkování v často kladených otázkách (FAQ) a TL;DR

LLM často vybírají odpovědi z FAQ a TL;DR. Proto:

  • V každé položce FAQ odkazujte klíčové entity na hub.
  • V sekci TL;DR používejte krátké, ale sémanticky bohaté kotevní texty (názvy + zkratky).
  • Každý odkaz v TL;DR má vyšší váhu, proto jejich počet omezte na 3–4 nejdůležitější entity.

Disambiguace na stránce: když jedna fráze znamená více věcí

Pokud se stránka věnuje entitám se stejným názvem:

  • Vložte sekci „Rozlišení pojmů“ s odkazy na jednotlivé huby.
  • Doplňte k odkazům aria-describedby, které vysvětlí, kterou entitu reprezentují.
  • V JSON-LD použijte about jako pole s více entitami a disambiguatingDescription.

Tip: navigace podle predikátů (nejen podle témat)

V horní navigaci nebo v postranním panelu filtrujte odkazy podle predikátů: „je kompatibilní s“, „závisí na“, „nahrazuje“, „vyžaduje“. Predikáty jsou pro LLM klíčovým mostem ke správnému kontextu.

Revize a správa entit

  1. Správa životního cyklu: entita může mít stav draft, active, deprecated; u stavu deprecated přesměrujte na nástupce a označte to v JSON-LD.
  2. Audit odkazů: měsíční přehled nefunkčních nebo nekanonických odkazů (leaf → leaf bez hubu).
  3. Kontrola aliasů: nová synonyma přidejte do hubu; test CI upozorní na „neznámý alias“ v kotevním textu.

KPI a experimenty

  • LLM-clickthrough@hub: míra, s jakou si modely při citování zvolí hub.
  • Answer consistency score: konzistence odpovědí modelu napříč stránkami, které se věnují téže entitě.
  • Disambiguation latency: kolik tokenů model potřebuje, aby „pochopil“ správnou entitu; cílem je tento počet po zavedení odkazů na entity snížit.

Kontrolní seznam před vydáním

  • První zmínka o každé entitě odkazuje na entity hub.
  • Vztahy mezi entitami mají relation hub s definovaným predikátem.
  • Všechny entity mají v hubech aliasy a externí identifikátory.
  • Leaf stránky mají breadcrumbs vedoucí přes hub.
  • JSON-LD obsahuje about, mentions, sameAs a odkazy na huby.

Nejčastější chyby a jak jim předcházet

  • Keyword-first linking: odkaz na obecné klíčové slovo bez signálu entity → nahraďte jej odkazem na hub s atributem data-entity.
  • Hustota odkazů: příliš mnoho entit v odstavci → snižte jejich počet na 1–2 klíčové entity.
  • Chybějící relation huby: LLM si domýšlí vztahy → vytvořte stránky s explicitně definovanými predikáty.
  • Roztříštěné aliasy: alias bez vazby na hub → centralizujte aliasy v hubu a ověřujte je nástrojem CI.

Entitní vrstva jako „kompas“ pro LLM

Prolinkování podle entit vytváří pro LLM navigační mapu: kanonické huby ukotvují význam, relation huby vyjasňují vztahy a leaf články poskytují praktické odpovědi. Při důsledném používání JSON-LD, promyšlených kotevních textů a kontroly hustoty odkazů získáte robustní kontext, v němž modely konzistentně vybírají správné stránky – a vaše odpovědi z ChatGPT budou přesnější, stabilnější a lépe atribuované.