Tvorba obsahu, který velké jazykové modely (LLM) upřednostňují při citování

Tvorba obsahu, ktorý Large Language Modely (LLM) preferujú citovať

Proč některý obsah LLM citují a jiný ignorují

Generativní modely citují zdroje, které jsou ověřitelné, jednoznačné, stabilní v čase a snadno parsovatelné. Pokud je informace atomická (jedna teze = jedna URL/sekce), podložená daty a má technické prvky pro strojové zpracování (struktura, identifikátory, metadata, licence), šance na citaci roste. V praxi jde o disciplínu GEO – Generative Engine Optimization: publikační standardy pro modely s RAG, hodnoticí pipeline a AIO/SGE.

Signály citovatelnosti: rámec 4×E

  • Exactness (Přesnost): konkrétní čísla, rozsahy, definice, jasné jednotky a podmínky platnosti.
  • Evidence (Důkazy): tabulky, dataset, odkazy na primární zdroje, metodika měření.
  • Explainability (Vysvětlitelnost): bloky Q→A, kroky, pravidla a prahové hodnoty (pokud X > Y, pak Z).
  • Extractability (Extrahovatelnost): čistá struktura HTML, krátké snippety (≤ 40 slov), identifikovatelné prvky (ID, kotvicí odkazy).

Informační architektura, které LLM „rozumějí“

  1. Jedna myšlenka = jedna sekce = vlastní odkaz (např. #definicia-entropy).
  2. Hierarchie H2/H3 s věcnými nadpisy („Metodika měření hluku v dB(A)“ namísto „Metodika“).
  3. Stabilní trvalé odkazy bez dat v cestě; verze řešte pomocí tagů a dateModified v metadatech.
  4. Fakta v tabulkách s vlastním ID a vysvětlením zdroje a omezení.

„Atomická fakta“: jak psát citovatelná tvrzení

  • Začněte tvrzením v jedné větě (≤ 25 slov), které lze citovat bez dalšího kontextu.
  • Hned za větou uveďte zdroj (primární, sekundární), časovou platnost a metodickou poznámku.
  • Pokud jde o čísla, doplňte intervaly, percentily a jednotky (+ ISO normy měření).

Styl Q→A a mikro-snippety

Modely mají rády přímočaré dvojice Q→A, které lze extrahovat bez „šumových“ vět. Vytvářejte krátké boxy: otázku v přirozené formě, odpověď do 40 slov a jasný odkaz na zdroj.

Struktura přívětivá pro RAG: chunking, kontext, disambiguace

  • Chunking v rozsahu 200–400 slov se samostatným nadpisem a krátkým shrnutím (prvních 160 znaků = „tl;dr“ pro retrievery).
  • Lexikální konzistence: používejte stabilní názvy entit a synonyma uvádějte v závorce („INP (Interaction to Next Paint)“).
  • Negativní příklady: vysvětlete, kdy tvrzení neplatí (pomáhá to modelům v jejich reasoning modulech).

Strukturovaná data, která pomáhají citacím

  • Article/TechArticle s datePublished, dateModified, about (entita), mentions (další entity), isBasedOn (primární zdroje).
  • Dataset pro tabulky a CSV; uveďte measurementTechnique, variableMeasured, license, distribution (CSV/JSON).
  • Claim / ClaimReview pro formalizaci tvrzení a jejich hodnocení.
  • BreadcrumbList pro kontext a ItemList pro srovnání.

Licence a atribuce: právní „palivová směs“ pro citace

  • Pro text doporučujte CC BY 4.0 nebo jasnou komerční licenci s požadavkem na uvedení zdroje.
  • Pro data použijte ODC-By nebo CC0 (pokud je cílem maximální citovanost).
  • Licenci uveďte přímo u tabulky a v JSON-LD (license).

Provenience: důkaz původu a aktuálnosti

  • Datum a verze (sekce se záznamem změn a kotva #verzia-2025-10).
  • Metodická příloha: normy, protokoly, odkazy na skripty.
  • Kontakt na autora a reviewedBy (odborný garant).

Copywriting zaměřený na entity: aby model správně disambiguoval

  • První zmínku entity uveďte s definicí a aliasy.
  • U homonym doplňte rozlišující atributy (rok, výrobce, verze).
  • Odkazujte na glosář s definicemi (vlastní trvalé odkazy).

Formátové vzory, které se dobře citují

  • Definiční karty: 3–5 vět, příklad, hranice použití.
  • Tabulky se zdrojem: poslední sloupec „Zdroj/Metoda“, horní řádek „Stav k: YYYY-MM“.
  • Rozhodovací stromy (pokud X/Y, pak A/B) – pravidla strojově čitelná.
  • Mini případová studie s čísly a kontextem (před/po, procenta, absolutní hodnoty).

Technické minimum: HTML a head

  • Čisté odkazy (<a href>) a kotvy s ID; žádná základní fakta pouze v obrázcích.
  • Canonical na vlastní stránku; hreflang pro jazykové kopie stejného obsahu.
  • Open Graph s jasnými poli og:title/og:description (extrahovatelný „úvod“).

„Citeability scorecard“: sebehodnocení stránky

Kritérium Otázka 0–2
Přesnost Obsahuje tvrzení konkrétní čísla/jednotky/intervaly? 0/1/2
Důkazy Je přímo k dispozici tabulka/dataset + zdroje? 0/1/2
Vysvětlitelnost Jsou k dispozici bloky Q→A a rozhodovací pravidla? 0/1/2
Extrahovatelnost Jsou sekce krátké, s ID a čistým HTML? 0/1/2
Provenience Jsou uvedena data, verze a autor/garant? 0/1/2
Licence Je licence srozumitelná pro stroj/člověka? 0/1/2

Příklady JSON-LD

Article + Dataset (výňatek):

{ "@context": "https://schema.org", "@type": "TechArticle", "headline": "Měření hluku ventilátorů v dB(A)", "datePublished": "2025-09-15", "dateModified": "2025-10-10", "about": [{"@type":"DefinedTerm","name":"dB(A)"},{"@type":"Thing","name":"Notebook"}], "isBasedOn": [{"@type":"CreativeWork","url":"https://example.org/iso-XXXX"}], "author": {"@type": "Person","name": "Ján Novák"}, "dataset": { "@type": "Dataset", "name": "Hluk notebooků 2025", "license": "https://creativecommons.org/licenses/by/4.0/", "measurementTechnique": "A-weighted SPL @1m", "variableMeasured": "SoundPressureLevel", "distribution": [{"@type":"DataDownload","encodingFormat":"text/csv","contentUrl":"https://example.org/hluk-2025.csv"}] } }

Metodika: jak vytvářet čísla, která obstojí při auditu

  • Publikujte protokol: zařízení, nastavení, počet opakování, statistika.
  • Kalibrace: uveďte referenční měření a chyby měření přístrojů.
  • Omezení: kde výsledek neplatí; rozlišujte extrapolaci od měření.

Citace a bibliografie: styl pro modely

  • Upřednostňujte primární zdroje před sekundárními; při přebírání uveďte obojí.
  • Používejte trvalé odkazy (DOI, archivované verze) a klíčová bibliografická pole: autor, rok, název, vydavatel, URL, datum přístupu.
  • V textu používejte průběžné citace (např. [1]) a na konci sekce seznam referencí.

Antipatterny: co snižuje šanci na citaci

  • Vágní formulace („záleží“ bez metodiky a rozsahů).
  • „Názorové“ články bez dat a odkazů na primární zdroje.
  • Důležitá čísla pouze v obrázcích/PDF bez textové podoby.
  • Časté změny URL a titulků bez přesměrování a verzování.

Proces GEO: od návrhu po publikaci

  1. Výběr tezí: identifikujte 5–10 „citovatelných“ tvrzení s dopadem.
  2. Evidence pack: připravte tabulky, dataset, metodiku, citace.
  3. IA a HTML: sekce s ID, Q→A, tabulky s popisky, mikro-snippety.
  4. Metadata: JSON-LD (Article/Dataset/Claim), OG, licence.
  5. QA: validace faktů, jednotek, verzí, hreflang.
  6. Distribuce: interní prolinkování na huby, příspěvky s „citovatelnými kartami“.
  7. Monitoring: citace v AIO/SGE, zmínky o značce, kopírování datasetu.

Praktické mikrošablony

Definiční box:

<section id="definicia-inp"> <h3>INP (Interaction to Next Paint): definícia</h3> <p>INP je metrika odozvy, ktorá hodnotí najhoršiu interakciu používateľa v rámci relácie (P98). Aktualizované: 2025-10.</p> <p><small>Zdroj: W3C/web.dev; komparácia s FID v doplnkovej tabuľke.</small></p> </section>

Q→A snippet:

<div id="qa-minimal"> <p><strong>Otázka:</strong> Aký je odporúčaný limit hluku pre notebooky?</p> <p><strong>Odpoveď:</strong> Pri bežnej záťaži je < 35 dB(A) v 1 m považovaných za tiché. Metodika: A-váženie, 23 °C, pozadie < 20 dB(A).</p> </div>

Měření úspěšnosti GEO

  • Imprese a kliknutí u dotazů „definice/co je/kolik/jak dlouho/který“.
  • Externí citace a zmínky o značce s citovanými úryvky.
  • Odkazy na dataset (stažení, zpětné odkazy na CSV/JSON).
  • Doba do citace: interval mezi publikací a první zaznamenanou citací.

Kontrolní seznam před publikací

  • Má každá klíčová teze vlastní odkaz a snippet ≤ 40 slov?
  • Jsou čísla uvedena v jednotkách s rozsahy/percentily a metodikou?
  • Je k dispozici dataset/tabulka + licence?
  • Jsou pole JSON-LD a OG vyplněná a platná?
  • Existuje záznam změn, autor a reviewedBy?

Citace je odměnou za pořádek

LLM rády citují obsah, který je přesný, podložený a technicky „čitelný“. Když svá tvrzení převedete na atomická fakta s důkazy, poskytnete strukturovaná data, stabilní URL a licence, stanete se přirozeným zdrojem pro generativní přehledy i aplikace RAG. GEO není trik – je to redakční disciplína a technická hygiena v jednom.