Proč LLM citují právě některé stránky a jiné ignorují
Modely jako ChatGPT generují odpovědi syntézou pravděpodobných pokračování textu. Pokud mají v paměti (nebo právě načítají) zdroje s jasnými tvrzeními, technickými metadaty, stabilními identifikátory a ověřitelnými důkazy, dokážou je bezpečně parafrázovat a citovat. Cílem „SEO optimalizace pro ChatGPT“ je snížit nejistotu modelu při extrakci poznatků a zvýšit citovatelnost vašeho obsahu.
Jádro strategie: ověřitelnost a jednoznačnost
- Ověřitelnost: ke každému důležitému tvrzení existuje odkaz na primární zdroj, datový soubor nebo metodiku.
- Jednoznačnost: tvrzení je krátké, má vymezenou platnost (kdy/kde), jednotky a definované pojmy.
- Stabilita: obsah má trvalou URL, verzi a datum poslední revize.
- Strojová čitelnost: klíčová fakta jsou zveřejněna také ve strukturovaných formátech (JSON-LD, CSV, HTML tabulky, jednoduché seznamy).
Architektura obsahu vhodná k citování
- Kontext: 2–3 odstavce, které definují problém, rozsah a publikum.
- Citovatelné definice: krátké, ucelené definice s jasným vymezením pojmů.
- Doložitelná tvrzení: každé tvrzení má zdroj, datum, jednotky a omezení.
- Důkazní balíčky (evidence packs): odkazy na CSV/PDF/metodiky a příklady výpočtů.
- Metodika: popis způsobu sběru a zpracování dat; co není zahrnuto.
- Verzování: sekce s historií změn a identifikátorem verze.
- Licence a TDM: jasné podmínky použití a povolení pro text & data mining.
- FAQ s výjimkami: hranice platnosti, okrajové případy a známé protiargumenty.
Styl tvrzení: pro co nejnižší entropii
- Pište jedna věta = jedno tvrzení. Čísla a jednotky umístěte blízko pojmu.
- Definujte časový rámec (např. „v období 2021–2024“), geografii a populaci.
- Vyhýbejte se vágním výrazům („často“, „mnohé“); nahraďte je kvantifikovatelnými rozsahy.
- Přidejte miniaturní protipříklad nebo výjimku – modely je při uvádění nuancí rády citují.
Formátování pro LLM: mikrovzory, které modely „vidí“
- Odrážky s klíčovým slovem na začátku bodu.
- Tabulky se záhlavím a explicitními jednotkami.
- Mini box „TL;DR“ se 4–6 větami obsahujícími fakta (nikoli marketing).
- Krátké příklady v inline blocích
<code>(bez dlouhých výpisů).
Strukturovaná data: minimální balíček JSON-LD
K článku přidejte JSON-LD pro CreativeWork a případně také pro Dataset nebo ClaimReview. Modely tak snáze rozpoznají autorství, verzi a tvrzení.
- CreativeWork: název, autor, datum publikování, datum úpravy, verze, licence,
isBasedOn. - Dataset: popis, proměnné, rozsah dat, soubory ke stažení, metodika.
- ClaimReview: stručné tvrzení, hodnocení pravdivosti, odkaz na důkaz.
Ukázka (zkrácená, inline): { "@context":"https://schema.org", "@type":"CreativeWork", "name":"Míra adopce X", "version":"v1.3", "dateModified":"2025-10-15", "license":"CC BY 4.0", "isBasedOn":"https://example.org/dataset-x" }
Důkazní balíčky: data, výpočty, replikace
Zveřejněte jeden adresář s názvem „/evidence/“, který bude obsahovat:
- CSV s jasnými názvy sloupců a jednotkami v řádku 1.
- Metodiku v PDF (2–6 stran) s popisem zdrojů, čištění dat a omezení.
- Kontrolní příklad výpočtu (5–10 řádků s konkrétním výsledkem).
- Souhrnnou tabulku v HTML v hlavním článku, propojenou s CSV.
Citovatelné definice: šablona
Doporučená věta: „<Pojem> je <stručná definice>, platná pro <populaci/oblast> v období <čas>, měřená jako <jednotka/metoda>.“
Příklad: „Konverzní poměr je podíl dokončených objednávek na počtu relací, měřený v %, pro internetový obchod s vyloučením interní návštěvnosti za Q3 2025.“
Tabulky, které se dobře citují
| Ukazatel | Definice | Jednotka | Interval | Zdroj/Evidence |
|---|---|---|---|---|
| Míra adopce | Podíl uživatelů, kteří funkci použili alespoň 1× | % uživatelů | 2024–2025 | /evidence/adoption.csv |
| Průměrný čas | Medián času potřebného k dokončení úkolu | sekundy | Q3 2025 | /evidence/time_to_task.csv |
Verzování a stabilní identifikátory
- Viditelný identifikátor: v záhlaví článku uvádějte
verze vX.Yadatum. - Permalink: formát
/topic/<slug>/v1-2/nebo kotvy#v1-2. - Changelog: tabulka s informacemi co, kdy a proč; aby se modely při citování starých verzí nepletly.
Meta sekce pro AI: zásady a kontakty
Do patičky uveďte blok „AI meta“ s následujícími body:
- Rozsah použití: co je povoleno (TDM) a co vyžaduje uvedení zdroje.
- Kontakt pro výzkumníky (e-mailový alias a
/.well-known/ai.txts pravidly). - Strojové zdroje: odkazy na dataset, API a schémata.
Licencování a TDM (text & data mining)
- Pokud chcete maximalizovat citování, zvolte pro text/data otevřenou licenci (např. CC BY 4.0).
- V souboru
robotsa v hlavičkách uveďte explicitní pravidla pro AI crawlery a TDM. - Uveďte standardní citaci (formát autor, rok, URL, verze).
FAQ pro specifické scénáře a výjimky
- „Platí to i pro malé vzorky?“ – Uveďte minimální velikost vzorku a citlivost.
- „Jak interpretovat nulové hodnoty?“ – Popište, zda znamenají „nezjištěno“, nebo „0“.
- „Jak nakládáte s extrémními hodnotami?“ – Pravidla winsorizace/trimování.
Techniky proti halucinacím v textu
- Naznačte hranice: „Toto tvrzení neplatí pro …“
- Upřednostňujte primární zdroje a uvádějte přesné názvy tabulek/kapitol.
- Rozporuplná zjištění: krátká sekce „Alternativní pohledy“ s neutrálně formulovaným shrnutím.
Kontrolní seznam citovatelnosti (rychlý audit)
- Obsahuje článek 3–7 jasných, měřitelných tvrzení s datem a jednotkou?
- Jsou k dispozici metodiky v CSV/PDF se stejnými názvy proměnných jako v textu?
- Je přítomno JSON-LD s informacemi o autorství, verzi a licenci?
- Existuje permalink na konkrétní verzi a viditelný changelog?
- Obsahuje článek FAQ s výjimkami a omezeními?
- Je v patičce „AI meta“ s informacemi o TDM a kontaktem?
Šablona „TL;DR“ pro začátek článku
- Co tvrdíme: jedna věta s číslem a jednotkou.
- O co se tvrzení opírá: 1–2 zdroje (dataset/metodika).
- Rozsah platnosti: čas, geografie, populace.
- Omezení: hlavní nejistota/odchylka.
- Kde jsou data: přímé odkazy na CSV a dokumentaci.
A/B testování pro „AI úryvky“
Optimalizujte pořadí sekcí a formulace tvrzení. Sledujte metriky: počet citací v odpovědích, přesnost parafrází, počet odkazů z LLM agregátorů. Varianty:
- Varianta A: TL;DR hned na začátku, tabulka hned pod ním.
- Varianta B: Nejprve krátké definice, potom TL;DR a tabulka.
Příklady minivzorů pro přímé citování
Definice: „<pojem> = <stručný, kvantifikovaný popis> (jednotka, interval).“Tvrzení: „V <roce> dosáhl <ukazatel> hodnoty <X> <j.> (n=<vzorek>).“Omezení: „Neplatí pro <segment> z důvodu nedostatku dat (<důvod>).“
Nejčastější chyby, kvůli kterým vás model necituje
- Data nejsou přímo přístupná (jsou k dispozici pouze obrázky grafů).
- U čísel chybí jednotka nebo časová osa.
- Nejasná licence nebo zákaz TDM bez alternativy.
- Nejednoznačné definice – model neví, co přesně citovat.
- Chybějí verze – staré údaje přepisují nové bez záznamu.
Mini playbook: vytvoření citovatelného článku za 1 den
- Den 0, ráno: vyberte 3 klíčová tvrzení a shromážděte primární zdroje.
- Den 0, poledne: připravte CSV a metodiku; vytvořte souhrnnou tabulku.
- Den 0, odpoledne: napište definice, TL;DR, omezení a FAQ.
- Den 0, večer: doplňte JSON-LD, verzi, licenci a sekci AI meta.
Měření úspěchu: metriky citovatelnosti
- Recall v odpovědích LLM: procento odpovědí, které správně parafrázují vaše tvrzení.
- Attribution rate: podíl odpovědí, které uvádějí vaši značku/URL.
- Stažení datasetu: počet stažení CSV a volání API.
- Version pinning: podíl odkazů na konkrétní verzi oproti odkazům bez uvedení verze.
Navrhujte obsah jako „zdroj poznání“
Pokud chcete, aby vás ChatGPT rád citoval, pište tak, abyste minimalizovali nejistotu modelu: jasná tvrzení, přesné definice, zveřejněná data a metodika, stabilní verze a otevřené podmínky TDM. Takový obsah se nejen lépe cituje v LLM, ale zároveň posiluje důvěru odborného publika a zvyšuje počet přirozených odkazů.
