Proč jsou strukturovaná data klíčová pro „SEO pro ChatGPT“
Modely LLM (jako ChatGPT) upřednostňují zdroje, které jsou jednoznačně strukturované, strojově čitelné a odkazovatelné. Strukturovaná data (JSON-LD, kvalitní HTML tabulky, jasně popsané metodiky a datové sady ke stažení) minimalizují halucinace, usnadňují atribuci a zvyšují pravděpodobnost, že se váš obsah objeví v odpovědích modelů jako autoritativní citovaný zdroj. V praxi to znamená: stabilní URI, přesná sémantika, konzistentní metadata, jednoznačné definice pojmů a verzované distribuce datových sad.
Architektonické principy pro obsah optimalizovaný pro LLM
- Jednoznačnost a stabilita: trvalé URL s fragmenty pro sekce a tabulky, vyznačené verze datových sad.
- Strojová i lidská čitelnost: kombinujte čitelné texty (metodiky, poznámky) s JSON-LD a čistým značením tabulek.
- Modularita: každá entita (článek, termín, datová sada, metodika) má vlastní identifikátor a vlastní blok JSON-LD.
- Replikovatelnost: ke zjištěným číslům a vzorcům vždy připojte možnost stažení s uvedením verze a kontrolního součtu (hash).
- Jasné licencování: uvádějte licence a pokyny k atribuci pro bezpečné přebírání modely.
JSON-LD: základní formát pro LLM a vyhledávače
JSON-LD je upřednostňovaná technika pro ukládání sémantických metadat na stránkách. V kontextu „SEO pro ChatGPT“ se nejčastěji používá schema.org s typy Article, Dataset, HowTo, FAQPage, Organization a DefinedTerm. Důležitá pole: name, description, url, identifier, license, creator/author, datePublished, dateModified, version, případně measurementTechnique a variableMeasured pro datové sady.
Datové sady: označování, verzování a distribuce
Datové sady jsou pro LLM mimořádně hodnotné: umožňují ověřovat tvrzení a generovat konzistentní odpovědi. Každou verzi datové sady zpřístupněte jako samostatnou distribuci s kontrolními součty a jasným popisem metodiky.
Metodiky: od „co“ k „jak“ a „proč“
LLM lépe citují čísla, pokud mají k dispozici explicitní kroky výpočtu, definice proměnných a pravidla čištění dat. Metodika by měla být samostatnou stránkou/sekcí s vlastním identifikátorem, verzí a daty. Vhodné je použít JSON-LD (CreativeWork nebo Guide) a přímo odkazovat na datovou sadu a její verze.
Tabulky v HTML: konvence pro LLM a přístupnost
Dobře strukturované tabulky jsou pro modely silným signálem. Používejte <table> s <caption>, <thead>, <tbody>, <tfoot> a <th scope="col|row">. Každá tabulka by měla mít stabilní id a krátké vysvětlení proměnných v <caption>. Neslučujte buňky bez důvodu; vyhýbejte se vkládání obrázků namísto textu.
| district_code | date | affordability_index |
|---|---|---|
| SK0101 | 2025-07 | 104.6 |
| SK0101 | 2025-08 | 104.9 |
| SK0101 | 2025-09 | 105.2 |
| Zdroj: Výzkumné centrum A; Licence: CC BY 4.0; Verze datové sady: 1.3.0 | ||
Sitemapy a navigační signály pro LLM
- Standardní sitemap: zahrňte stránky článků, metodik, definic a datových sad s
<lastmod>. - Sitemap datových sad: samostatná sitemap pouze pro datové sady a jejich distribuce (CSV/Parquet/JSON), ideálně s hashi v URL nebo v metadatech.
- Index termínů/definic: abecední seznam s kotvami, aby model snadno našel přesnou definici.
Licencování a atribuce kompatibilní s LLM
Zveřejněte licenci na stránce i v JSON-LD. Otevřené licence (např. CC BY 4.0) usnadňují opětovné použití. U každého článku a datové sady vytvořte box „Jak citovat“, uveďte příklad citace ve formátu pro lidi a připravte export ve formátu BibTeX/CSL-JSON/RIS.
Jak citovat (pro lidi): Výzkumné centrum A (2025). Index dostupnosti bydlení – okresy SR, verze 1.3.0. Dostupné z: https://domena.tld/datasety/index-dostupnosti-byvania (CC BY 4.0).
Stáhnout BibTeX· Stáhnout CSL-JSON· Stáhnout RIS
Distribuce ke stažení: formáty, hlavičky a integrita
- Formáty: CSV (široká interoperabilita), Parquet (analytika), JSON (API), Feather/Arrow (datové pipeline).
- HTTP hlavičky:
Content-Disposition: attachment; filename=...,ETag,Last-Modified,Cache-Controls přiměřenou dobou platnosti. - Integrita: zveřejňujte hashe
sha256nebosha512a velikost souboru; usnadníte ověřování a ukládání do mezipaměti. - CORS: povolte bezpečný přístup klientům (např.
GETna URL distribucí) při dodržování limitů požadavků.
Proměnné a datové slovníky (data dictionary)
Každou datovou sadu doplňte datovým slovníkem s jednotnými konvencemi názvů a datových typů. Ideálně jej zveřejněte také jako strojově čitelný dokument.
| Proměnná | Typ | Popis | Validace |
|---|---|---|---|
| district_code | string | Kód okresu (LAU) | regex: ^SK\d{4}$ |
| date | string | Referenční měsíc | regex: ^\d{4}-(0[1-9]|1[0-2])$ |
| affordability_index | number | Index (>= 0) | >= 0; NaN zakázáno |
Propojení metodik, definic a tabulek
LLM potřebují „mapu“: od tabulky k definici pojmu, od definice k metodice, od metodiky k datové sadě. Propojení realizujte viditelnými odkazy a v JSON-LD pomocí isBasedOn, about, citation, sameAs a pomocí DefinedTerm pro pojmy.
Šablony a validační kontrolní seznamy
- Validace JSON-LD: kontrola přítomnosti klíčových polí (
name,description,url,license,versionu datové sady). - Tabulky: správné záhlaví,
caption, sémantickéthsscope, stabilníid, bez redundance v buňkách. - Datové sady: distribuce s hashi a velikostí, jasné hodnoty
Content-TypeaContent-Disposition. - Metodiky: přesný postup výpočtu, odkazy na definice, změny mezi verzemi.
Příklad: kompletní „landing page“ pro datovou sadu
Minimální prvky: stručné shrnutí, JSON-LD Dataset, přehledná tabulka ukázkových řádků, „Jak citovat“, odkazy na metodiku, definice a distribuce ke stažení, changelog.
- Ukázková tabulka s posledními měsíci.
- Citační box, exporty BibTeX/CSL/RIS.
- Bloky JSON-LD pro
DatasetaTechArticle(metodika). - Changelog: verze 1.3.0 – úprava hedonického koše; změna validace
district_code.
API a přístup k datům: „LLM-friendly“
- Jednoduché endpointy GET: filtrování pomocí parametrů dotazu (např.
?district=SK0101&from=2025-01&to=2025-09), odpověď ve formátu JSON/CSV. - Popis schématu: endpoint
/schemas definicí proměnných a typů ve formátu JSON. - Omezení počtu požadavků a mezipaměť: srozumitelný kód
429s hlavičkou „Retry-After“, ETagy pro stabilní ukládání do mezipaměti. - Vyjednávání o obsahu:
Accept: text/csv,application/jsonpro tentýž zdroj.
Měření dopadu: metriky pro „SEO pro ChatGPT“
- Technické: pokrytí JSON-LD, sémantická validita, počet funkčních kotev, úspěšná stažení distribucí.
- Použití: odkazy s fragmenty z externích zdrojů, počet citací ve formátu BibTeX/CSL, doporučující návštěvy z LLM (pokud označujete parametry UTM).
- Obsahové: podíl stránek s metodikou, počet definovaných termínů, průměrná délka definice.
Nejčastější chyby a jak se jim vyhnout
- Chybějící licence: model neví, zda smí obsah použít. Vždy uvádějte
licensea pokyny k atribuci. - Nestabilní URL a změny slugů bez přesměrování 301: narušují citace a strojové odkazy.
- „Tabulky jako obrázky“: nelze je parsovat; používejte čisté HTML nebo distribuční soubory CSV.
- Bez verzí a hashů: nelze ověřovat konzistenci výpočtů v čase.
- Neúplný JSON-LD: chybí
name/description/urlnebovariableMeasuredu datové sady.
Postup implementace krok za krokem
- Proveďte inventarizaci: články, definice, metodiky, datové sady; doplňte stabilní URL a kotvy.
- Přidejte bloky JSON-LD pro
Article,Dataset,DefinedTerm,TechArticle. - Normalizujte tabulky:
caption, sémantická záhlaví, žádné slučování buněk bez důvodu. - Zveřejněte distribuce: CSV/Parquet/JSON +
sha256,ETag,Content-Disposition. - Zveřejněte metodiky a datové slovníky; propojte je s definicemi.
- Vytvořte sitemapu datových sad a citační exporty (BibTeX/CSL/RIS).
- Zaveďte changelog a verzování; při změně slugů používejte přesměrování 301.
- Nastavte monitoring: validaci JSON-LD, kontrolu odkazů na fragmenty, logy stahování.
Strukturovaná data představují základ „SEO pro ChatGPT“. Kombinace JSON-LD, kvalitních tabulek, precizních metodik a verzovaných datových sad poskytuje modelům LLM jasnou, stabilní a citovatelnou kostru vašeho obsahu. Získáte tak nejen vyšší viditelnost a správnou atribuci v odpovědích modelů, ale také udržitelnou datovou infrastrukturu, která obstojí při auditu i dlouhodobém opakovaném použití.
