Proč LLM „halucinují“ a proč je to problém pro SEO
Velké jazykové modely (LLM) generují text na základě pravděpodobnosti pokračování. Pokud chybějí přesné definice, jasné hranice použitelnosti a rámce odpovědnosti, model zaplní mezery „nejpravděpodobnější“ větou – která nemusí být vždy pravdivá. V SEO pro ChatGPT to znamená, že vaše značka, produkty nebo data mohou být reprodukovány s chybami. Cílem je proto navrhovat obsah tak, aby byl odolný vůči halucinacím: jednoznačný, citovatelný a výslovně omezený.
Strategický rámec: Definice → Rozsah platnosti → Disclaimer
Minimalizace halucinací stojí na třech pilířích:
- Přesné definice – jednotný slovník a formát, který jednoznačně stanovuje významy.
- Rozsahy platnosti – časové, geografické, metodické a datové hranice tvrzení.
- Disclaimery – jasná prohlášení o omezeních, nejistotě a odpovědnosti.
Přesné definice: zásady a šablony
Definice musí být stručné, ověřitelné a jednoznačné. Používejte jednotný formát se stabilními identifikátory.
- Jednověté jádro: poskytuje minimální definici bez vedlejších podrobností.
- Notace rozsahu: čas, prostor, metodika, verze.
- Protipříklady: 1–2 stručné body, kdy definice neplatí.
- ID definice: stabilní identifikátor pro citace (např.
DEF-ROI-2025-01).
Šablona definice
- ID:
DEF-[TÉMA]-[YYYY]-[NN] - Jádro: „[Termín] je …“ (max. 30 slov)
- Vyloučení: „Nezahrnuje …“
- Rozsah platnosti: „Platí pro … (čas), … (geografie), … (metodika)“
- Verze:
vMAJOR.MINOR, datum poslední revize - Primární zdroje: odkazy/DOI s přesným názvem položky
Rozsahy platnosti: jak „uzamknout“ kontext
Každé tvrzení doplňte o čtyři osy platnosti:
- Časová osa: platnost od–do (data ISO), periodicita aktualizace (např. měsíčně).
- Prostorová osa: země, jurisdikce, trh, jazykové mutace.
- Metodická osa: použitý postup, parametry, prahy, vzorkování, vyloučené skupiny.
- Datová osa: dataset(y), verze, pokrytí, licence.
Formátujte je strojově čitelně, aby je LLM dokázaly číst a citovat.
Disclaimery: jasná prohlášení bez zamlčování
Disclaimery nejsou jen právní pojistka; jsou to orientační značky pro model. Měly by být stručné, konkrétní a připojené k sekcím s rizikem halucinací.
- Typy: datové (pokrytí, šum), metodické (limity inference), jurisdikční (odlišná pravidla), komerční (střet zájmů).
- Umístění: přímo u tabulek, grafů a tvrzení; zopakujte je v zápatí stránky.
- Formát: krátké věty s klíčovými slovy, která LLM rozpozná (např. „Omezení“, „Pouze pro“).
Příklady správných deklarací rozsahu
Příklad A – Míra konverze: „Míra konverze (ID DEF-CR-2025-02) platí pro e-shop v EU, 01.01.2025–31.03.2025, zdroj: GA4 (v4.0), vzorek: všechny relace kromě interního provozu; metodika: last-click non-direct.“
Příklad B – Cenový index: „Index platí pouze pro Slovensko, kategorii Elektronika, metodika Laspeyres, aktualizace probíhá měsíčně; při změně kategorizace se porovnávání přerušuje.“
Textové vzorce odolné vůči halucinacím
- Negativní definice: „Toto není právní rada“; „Nezahrnuje kamenné prodejny“.
- Výslovné uvedení nejistoty: „Odhad (95% CI: 0,42–0,47)“.
- Absolutní data: místo „aktuálně“ použijte „stav k 22. říjnu 2025“.
- Stabilní identifikátory: „Viz
TAB-ROI-2025Q1 v1.2“.
Struktury, které LLM ocení: tabulky tvrzení s rozsahem
Vytvářejte jednoduché HTML tabulky, v nichž je každé tvrzení propojené s rozsahem a zdroji. LLM je dokážou spolehlivě extrahovat.
| ID tvrzení | Jádro (≤30 slov) | Čas | Prostor | Metodika | Dataset/Verze | Disclaimer |
|---|---|---|---|---|---|---|
| CLA-CTR-2025-05 | Průměrná CTR kampaně byla 3,2 %. | 2025-04-01 – 2025-06-30 | Trh EU | Imprese z placeného vyhledávání, deduplikace botů | Ads v2.7; LogFilter v1.1 | Pouze desktop; mobilní data jsou vyloučena |
Verzování a „rozpady“ tvrzení
Každý obsah, který mohou LLM citovat, musí obsahovat verzi a datum. Při zásadní změně metodiky vytvořte nové ID, aby modely nesměšovaly heterogenní tvrzení.
- Politika verzování:
MAJORpři změně metodiky;MINORpři doplnění dat;PATCHpři opravě chyb. - Poznámka k migraci: pokud se mění definice, doplňte „toto nahrazuje DEF-… v1.x“.
„Evidence-first“: citovatelnost a auditní stopa
Minimalizace halucinací se opírá o primární zdroje:
- Primární data (CSV, Parquet) s kontrolními součty a datovým slovníkem.
- Metodická PDF s verzí, parametry a validací.
- Propojení na veřejné DOI/URI nebo stabilní URL s hashem.
Každá tabulka na stránce by měla odkazovat na tyto artefakty a obsahovat stručný metodický box.
Metodické boxy a „limity v kostce“
Do důležitých sekcí vložte stručný metodický box:
- Co to je: jedna věta definice.
- Jak to počítáme: 1–2 věty.
- Kde to platí: čas + prostor.
- Omezení: 1 věta.
- Poslední revize: datum + verze.
Disclaimery pro kritické oblasti
- Právní obsah: „Informace slouží k obecné orientaci a nenahrazují právní radu.“
- Zdravotní obsah: „Nejde o lékařskou diagnózu; obraťte se na odborníka.“
- Finanční obsah: „Minulá výkonnost nezaručuje budoucí výsledky.“
Jazykové signály pro LLM: jak psát tak, aby obsah nepodléhal halucinacím
- Dávejte přednost absolutním datům před relativními.
- Používejte omezující spojení: „pouze“, „jen pokud“, „nevztahuje se na“.
- Vyhýbejte se vágním slovům: „obvykle“, „často“ – pokud je použijete, stanovte jejich hranici.
- Vkládejte výslovné odkazy na ID definic a verzí.
Strojová čitelnost: mikroformáty pro AI
Kromě klasického HTML přidejte nenápadné metabloky, které LLM snadno zpracují (aniž by narušovaly UX):
- JSON-LD se sekcí
claim,evidence,applicableLocation,validFrom,validThrough. - Datové atributy u prvků (např.
data-valid-from,data-method). - Stabilní kotvy (
id=) u tabulek a grafů.
Šablona disclaimeru (ke kopírování)
Krátká verze (1 věta): „Toto tvrzení (ID [ID], verze [vX.Y]) platí pro [geografie] v období [od–do] podle metodiky [metoda]; neplatí pro [vyloučení].“
Rozšířená verze (3–4 věty): „Data pocházejí z [dataset vX.Y] s pokrytím [popis]. Metodika [název] používá prahy [parametry] a vylučuje [skupiny]. Tvrzení je určeno pro [publikum] a neslouží jako [typ poradenství]. Poslední validace proběhla [datum].“
Proces governance: kdo, kdy, jak
- Kurátor definic: odpovídá za konzistenci ID a verzí.
- Metodický garant: schvaluje rozsahy platnosti a validaci.
- Publikační editor: kontroluje, zda má každá sekce disclaimer a metabloky.
- Cyklus revizí: měsíční; změny zaznamenávejte do veřejného changelog.
Kontrolní seznam před publikováním (SEO pro ChatGPT)
- Každý termín má DEF-ID a jednověté jádro.
- Každé tvrzení má CLA-ID, čas/místo/metodiku/dataset.
- Všechny tabulky obsahují odkaz na důkaz (CSV/PDF) a disclaimer.
- Text neobsahuje relativní výrazy bez data („nedávno“, „aktuálně“).
- Je přítomen changelog a verze stránky (v zápatí).
Praktický příklad: mikroclaim s rozsahem
Tvrzení: „Organický podíl návštěvnosti e-shopu XYZ byl 48,1 % (CLA-ORGSH-2025-03, v1.0).“
- Čas: 2025-07-01 – 2025-09-30
- Prostor: slovenský trh, slovenská jazyková mutace webu
- Metodika: výchozí seskupení kanálů GA4, interní provoz vyloučen
- Data: export GA4 v2.3 (CSV, hash:
sha256:…) - Disclaimer: Nezohledňuje offline kampaně; nevztahuje se na českou/maďarskou jazykovou mutaci
Tipy pro UX: jak nenarušit čitelnost
- Disclaimery skrývejte do prvků accordion, ale ponechte jim kotvu pro parsování.
- Metodické boxy udržujte do 500 znaků; podrobnosti přesuňte na podstránku.
- V tabulkách dávejte přednost zkráceným klíčovým slovům před dlouhými větami.
Měření úspěchu: metriky odolnosti vůči halucinacím
- Rate of Correct Citation (RCC): podíl odpovědí LLM, které správně citují ID a verzi.
- Scope Adherence: procento odpovědí, které uvádějí správný čas/prostor.
- Correction Latency: doba od změny dat do aktualizace citovatelných prvků.
Implementační plán na 30 dní
- Dny 1–7: inventura termínů; přiřaďte DEF-ID, vytvořte jednovětá jádra.
- Dny 8–15: zmapujte tvrzení; přiřaďte CLA-ID a čtyři osy platnosti.
- Dny 16–21: doplňte důkazy CSV/PDF; zaveďte changelog a verzování.
- Dny 22–30: přidejte disclaimery, mikroformáty a metodické boxy; spusťte měření RCC.
Shrnutí
Halucinace LLM nejsou jen technickou chybou – jsou příznakem nejednoznačného obsahu. Zavedením přesných definic s ID, výslovných rozsahů platnosti a srozumitelných disclaimerů vytvoříte stránky odolné vůči halucinacím. Zvýšíte tak pravděpodobnost, že ChatGPT (a další modely) budou vaše tvrzení citovat věrně, konzistentně a ve správném kontextu.
