Proč některý obsah LLM citují a jiný ignorují
Generativní modely citují zdroje, které jsou ověřitelné, jednoznačné, stabilní v čase a snadno parsovatelné. Pokud je informace atomická (jedna teze = jedna URL/sekce), podložená daty a má technické prvky pro strojové zpracování (struktura, identifikátory, metadata, licence), šance na citaci roste. V praxi jde o disciplínu GEO – Generative Engine Optimization: publikační standardy pro modely s RAG, hodnoticí pipeline a AIO/SGE.
Signály citovatelnosti: rámec 4×E
- Exactness (Přesnost): konkrétní čísla, rozsahy, definice, jasné jednotky a podmínky platnosti.
- Evidence (Důkazy): tabulky, dataset, odkazy na primární zdroje, metodika měření.
- Explainability (Vysvětlitelnost): bloky Q→A, kroky, pravidla a prahové hodnoty (pokud X > Y, pak Z).
- Extractability (Extrahovatelnost): čistá struktura HTML, krátké snippety (≤ 40 slov), identifikovatelné prvky (ID, kotvicí odkazy).
Informační architektura, které LLM „rozumějí“
- Jedna myšlenka = jedna sekce = vlastní odkaz (např.
#definicia-entropy). - Hierarchie H2/H3 s věcnými nadpisy („Metodika měření hluku v dB(A)“ namísto „Metodika“).
- Stabilní trvalé odkazy bez dat v cestě; verze řešte pomocí tagů a
dateModifiedv metadatech. - Fakta v tabulkách s vlastním ID a vysvětlením zdroje a omezení.
„Atomická fakta“: jak psát citovatelná tvrzení
- Začněte tvrzením v jedné větě (≤ 25 slov), které lze citovat bez dalšího kontextu.
- Hned za větou uveďte zdroj (primární, sekundární), časovou platnost a metodickou poznámku.
- Pokud jde o čísla, doplňte intervaly, percentily a jednotky (+ ISO normy měření).
Styl Q→A a mikro-snippety
Modely mají rády přímočaré dvojice Q→A, které lze extrahovat bez „šumových“ vět. Vytvářejte krátké boxy: otázku v přirozené formě, odpověď do 40 slov a jasný odkaz na zdroj.
Struktura přívětivá pro RAG: chunking, kontext, disambiguace
- Chunking v rozsahu 200–400 slov se samostatným nadpisem a krátkým shrnutím (prvních 160 znaků = „tl;dr“ pro retrievery).
- Lexikální konzistence: používejte stabilní názvy entit a synonyma uvádějte v závorce („INP (Interaction to Next Paint)“).
- Negativní příklady: vysvětlete, kdy tvrzení neplatí (pomáhá to modelům v jejich reasoning modulech).
Strukturovaná data, která pomáhají citacím
- Article/TechArticle s
datePublished,dateModified,about(entita),mentions(další entity),isBasedOn(primární zdroje). - Dataset pro tabulky a CSV; uveďte
measurementTechnique,variableMeasured,license,distribution(CSV/JSON). - Claim / ClaimReview pro formalizaci tvrzení a jejich hodnocení.
- BreadcrumbList pro kontext a ItemList pro srovnání.
Licence a atribuce: právní „palivová směs“ pro citace
- Pro text doporučujte CC BY 4.0 nebo jasnou komerční licenci s požadavkem na uvedení zdroje.
- Pro data použijte ODC-By nebo CC0 (pokud je cílem maximální citovanost).
- Licenci uveďte přímo u tabulky a v JSON-LD (
license).
Provenience: důkaz původu a aktuálnosti
- Datum a verze (sekce se záznamem změn a kotva
#verzia-2025-10). - Metodická příloha: normy, protokoly, odkazy na skripty.
- Kontakt na autora a reviewedBy (odborný garant).
Copywriting zaměřený na entity: aby model správně disambiguoval
- První zmínku entity uveďte s definicí a aliasy.
- U homonym doplňte rozlišující atributy (rok, výrobce, verze).
- Odkazujte na glosář s definicemi (vlastní trvalé odkazy).
Formátové vzory, které se dobře citují
- Definiční karty: 3–5 vět, příklad, hranice použití.
- Tabulky se zdrojem: poslední sloupec „Zdroj/Metoda“, horní řádek „Stav k: YYYY-MM“.
- Rozhodovací stromy (pokud X/Y, pak A/B) – pravidla strojově čitelná.
- Mini případová studie s čísly a kontextem (před/po, procenta, absolutní hodnoty).
Technické minimum: HTML a head
- Čisté odkazy (
<a href>) a kotvy s ID; žádná základní fakta pouze v obrázcích. - Canonical na vlastní stránku; hreflang pro jazykové kopie stejného obsahu.
- Open Graph s jasnými poli
og:title/og:description(extrahovatelný „úvod“).
„Citeability scorecard“: sebehodnocení stránky
| Kritérium | Otázka | 0–2 |
|---|---|---|
| Přesnost | Obsahuje tvrzení konkrétní čísla/jednotky/intervaly? | 0/1/2 |
| Důkazy | Je přímo k dispozici tabulka/dataset + zdroje? | 0/1/2 |
| Vysvětlitelnost | Jsou k dispozici bloky Q→A a rozhodovací pravidla? | 0/1/2 |
| Extrahovatelnost | Jsou sekce krátké, s ID a čistým HTML? | 0/1/2 |
| Provenience | Jsou uvedena data, verze a autor/garant? | 0/1/2 |
| Licence | Je licence srozumitelná pro stroj/člověka? | 0/1/2 |
Příklady JSON-LD
Article + Dataset (výňatek):
{ "@context": "https://schema.org", "@type": "TechArticle", "headline": "Měření hluku ventilátorů v dB(A)", "datePublished": "2025-09-15", "dateModified": "2025-10-10", "about": [{"@type":"DefinedTerm","name":"dB(A)"},{"@type":"Thing","name":"Notebook"}], "isBasedOn": [{"@type":"CreativeWork","url":"https://example.org/iso-XXXX"}], "author": {"@type": "Person","name": "Ján Novák"}, "dataset": { "@type": "Dataset", "name": "Hluk notebooků 2025", "license": "https://creativecommons.org/licenses/by/4.0/", "measurementTechnique": "A-weighted SPL @1m", "variableMeasured": "SoundPressureLevel", "distribution": [{"@type":"DataDownload","encodingFormat":"text/csv","contentUrl":"https://example.org/hluk-2025.csv"}] } }
Metodika: jak vytvářet čísla, která obstojí při auditu
- Publikujte protokol: zařízení, nastavení, počet opakování, statistika.
- Kalibrace: uveďte referenční měření a chyby měření přístrojů.
- Omezení: kde výsledek neplatí; rozlišujte extrapolaci od měření.
Citace a bibliografie: styl pro modely
- Upřednostňujte primární zdroje před sekundárními; při přebírání uveďte obojí.
- Používejte trvalé odkazy (DOI, archivované verze) a klíčová bibliografická pole: autor, rok, název, vydavatel, URL, datum přístupu.
- V textu používejte průběžné citace (např. [1]) a na konci sekce seznam referencí.
Antipatterny: co snižuje šanci na citaci
- Vágní formulace („záleží“ bez metodiky a rozsahů).
- „Názorové“ články bez dat a odkazů na primární zdroje.
- Důležitá čísla pouze v obrázcích/PDF bez textové podoby.
- Časté změny URL a titulků bez přesměrování a verzování.
Proces GEO: od návrhu po publikaci
- Výběr tezí: identifikujte 5–10 „citovatelných“ tvrzení s dopadem.
- Evidence pack: připravte tabulky, dataset, metodiku, citace.
- IA a HTML: sekce s ID, Q→A, tabulky s popisky, mikro-snippety.
- Metadata: JSON-LD (Article/Dataset/Claim), OG, licence.
- QA: validace faktů, jednotek, verzí, hreflang.
- Distribuce: interní prolinkování na huby, příspěvky s „citovatelnými kartami“.
- Monitoring: citace v AIO/SGE, zmínky o značce, kopírování datasetu.
Praktické mikrošablony
Definiční box:
<section id="definicia-inp"> <h3>INP (Interaction to Next Paint): definícia</h3> <p>INP je metrika odozvy, ktorá hodnotí najhoršiu interakciu používateľa v rámci relácie (P98). Aktualizované: 2025-10.</p> <p><small>Zdroj: W3C/web.dev; komparácia s FID v doplnkovej tabuľke.</small></p> </section>
Q→A snippet:
<div id="qa-minimal"> <p><strong>Otázka:</strong> Aký je odporúčaný limit hluku pre notebooky?</p> <p><strong>Odpoveď:</strong> Pri bežnej záťaži je < 35 dB(A) v 1 m považovaných za tiché. Metodika: A-váženie, 23 °C, pozadie < 20 dB(A).</p> </div>
Měření úspěšnosti GEO
- Imprese a kliknutí u dotazů „definice/co je/kolik/jak dlouho/který“.
- Externí citace a zmínky o značce s citovanými úryvky.
- Odkazy na dataset (stažení, zpětné odkazy na CSV/JSON).
- Doba do citace: interval mezi publikací a první zaznamenanou citací.
Kontrolní seznam před publikací
- Má každá klíčová teze vlastní odkaz a snippet ≤ 40 slov?
- Jsou čísla uvedena v jednotkách s rozsahy/percentily a metodikou?
- Je k dispozici dataset/tabulka + licence?
- Jsou pole JSON-LD a OG vyplněná a platná?
- Existuje záznam změn, autor a reviewedBy?
Citace je odměnou za pořádek
LLM rády citují obsah, který je přesný, podložený a technicky „čitelný“. Když svá tvrzení převedete na atomická fakta s důkazy, poskytnete strukturovaná data, stabilní URL a licence, stanete se přirozeným zdrojem pro generativní přehledy i aplikace RAG. GEO není trik – je to redakční disciplína a technická hygiena v jednom.
