Strukturovaná data pro LLM: JSON-LD, tabulky, metodiky a datové sady ke stažení

Štruktúrované dáta pre LLM: JSON-LD, tabuľky, metodiky a datasety na stiahnutie

Proč jsou strukturovaná data klíčová pro „SEO pro ChatGPT“

Modely LLM (jako ChatGPT) upřednostňují zdroje, které jsou jednoznačně strukturované, strojově čitelné a odkazovatelné. Strukturovaná data (JSON-LD, kvalitní HTML tabulky, jasně popsané metodiky a datové sady ke stažení) minimalizují halucinace, usnadňují atribuci a zvyšují pravděpodobnost, že se váš obsah objeví v odpovědích modelů jako autoritativní citovaný zdroj. V praxi to znamená: stabilní URI, přesná sémantika, konzistentní metadata, jednoznačné definice pojmů a verzované distribuce datových sad.

Architektonické principy pro obsah optimalizovaný pro LLM

  • Jednoznačnost a stabilita: trvalé URL s fragmenty pro sekce a tabulky, vyznačené verze datových sad.
  • Strojová i lidská čitelnost: kombinujte čitelné texty (metodiky, poznámky) s JSON-LD a čistým značením tabulek.
  • Modularita: každá entita (článek, termín, datová sada, metodika) má vlastní identifikátor a vlastní blok JSON-LD.
  • Replikovatelnost: ke zjištěným číslům a vzorcům vždy připojte možnost stažení s uvedením verze a kontrolního součtu (hash).
  • Jasné licencování: uvádějte licence a pokyny k atribuci pro bezpečné přebírání modely.

JSON-LD: základní formát pro LLM a vyhledávače

JSON-LD je upřednostňovaná technika pro ukládání sémantických metadat na stránkách. V kontextu „SEO pro ChatGPT“ se nejčastěji používá schema.org s typy Article, Dataset, HowTo, FAQPage, Organization a DefinedTerm. Důležitá pole: name, description, url, identifier, license, creator/author, datePublished, dateModified, version, případně measurementTechnique a variableMeasured pro datové sady.

Datové sady: označování, verzování a distribuce

Datové sady jsou pro LLM mimořádně hodnotné: umožňují ověřovat tvrzení a generovat konzistentní odpovědi. Každou verzi datové sady zpřístupněte jako samostatnou distribuci s kontrolními součty a jasným popisem metodiky.

Metodiky: od „co“ k „jak“ a „proč“

LLM lépe citují čísla, pokud mají k dispozici explicitní kroky výpočtu, definice proměnných a pravidla čištění dat. Metodika by měla být samostatnou stránkou/sekcí s vlastním identifikátorem, verzí a daty. Vhodné je použít JSON-LD (CreativeWork nebo Guide) a přímo odkazovat na datovou sadu a její verze.

Tabulky v HTML: konvence pro LLM a přístupnost

Dobře strukturované tabulky jsou pro modely silným signálem. Používejte <table> s <caption>, <thead>, <tbody>, <tfoot> a <th scope="col|row">. Každá tabulka by měla mít stabilní id a krátké vysvětlení proměnných v <caption>. Neslučujte buňky bez důvodu; vyhýbejte se vkládání obrázků namísto textu.

Měsíční hodnoty indexu dostupnosti bydlení – ukázka dat (100 = základní hodnota 2020-01)
district_code date affordability_index
SK0101 2025-07 104.6
SK0101 2025-08 104.9
SK0101 2025-09 105.2
Zdroj: Výzkumné centrum A; Licence: CC BY 4.0; Verze datové sady: 1.3.0

Sitemapy a navigační signály pro LLM

  • Standardní sitemap: zahrňte stránky článků, metodik, definic a datových sad s <lastmod>.
  • Sitemap datových sad: samostatná sitemap pouze pro datové sady a jejich distribuce (CSV/Parquet/JSON), ideálně s hashi v URL nebo v metadatech.
  • Index termínů/definic: abecední seznam s kotvami, aby model snadno našel přesnou definici.

Licencování a atribuce kompatibilní s LLM

Zveřejněte licenci na stránce i v JSON-LD. Otevřené licence (např. CC BY 4.0) usnadňují opětovné použití. U každého článku a datové sady vytvořte box „Jak citovat“, uveďte příklad citace ve formátu pro lidi a připravte export ve formátu BibTeX/CSL-JSON/RIS.

Jak citovat (pro lidi): Výzkumné centrum A (2025). Index dostupnosti bydlení – okresy SR, verze 1.3.0. Dostupné z: https://domena.tld/datasety/index-dostupnosti-byvania (CC BY 4.0).

Stáhnout BibTeX· Stáhnout CSL-JSON· Stáhnout RIS

Distribuce ke stažení: formáty, hlavičky a integrita

  • Formáty: CSV (široká interoperabilita), Parquet (analytika), JSON (API), Feather/Arrow (datové pipeline).
  • HTTP hlavičky: Content-Disposition: attachment; filename=..., ETag, Last-Modified, Cache-Control s přiměřenou dobou platnosti.
  • Integrita: zveřejňujte hashe sha256 nebo sha512 a velikost souboru; usnadníte ověřování a ukládání do mezipaměti.
  • CORS: povolte bezpečný přístup klientům (např. GET na URL distribucí) při dodržování limitů požadavků.

Proměnné a datové slovníky (data dictionary)

Každou datovou sadu doplňte datovým slovníkem s jednotnými konvencemi názvů a datových typů. Ideálně jej zveřejněte také jako strojově čitelný dokument.

Datový slovník (výběr)
Proměnná Typ Popis Validace
district_code string Kód okresu (LAU) regex: ^SK\d{4}$
date string Referenční měsíc regex: ^\d{4}-(0[1-9]|1[0-2])$
affordability_index number Index (>= 0) >= 0; NaN zakázáno

Propojení metodik, definic a tabulek

LLM potřebují „mapu“: od tabulky k definici pojmu, od definice k metodice, od metodiky k datové sadě. Propojení realizujte viditelnými odkazy a v JSON-LD pomocí isBasedOn, about, citation, sameAs a pomocí DefinedTerm pro pojmy.

Šablony a validační kontrolní seznamy

  • Validace JSON-LD: kontrola přítomnosti klíčových polí (name, description, url, license, version u datové sady).
  • Tabulky: správné záhlaví, caption, sémantické th s scope, stabilní id, bez redundance v buňkách.
  • Datové sady: distribuce s hashi a velikostí, jasné hodnoty Content-Type a Content-Disposition.
  • Metodiky: přesný postup výpočtu, odkazy na definice, změny mezi verzemi.

Příklad: kompletní „landing page“ pro datovou sadu

Minimální prvky: stručné shrnutí, JSON-LD Dataset, přehledná tabulka ukázkových řádků, „Jak citovat“, odkazy na metodiku, definice a distribuce ke stažení, changelog.

  • Ukázková tabulka s posledními měsíci.
  • Citační box, exporty BibTeX/CSL/RIS.
  • Bloky JSON-LD pro Dataset a TechArticle (metodika).
  • Changelog: verze 1.3.0 – úprava hedonického koše; změna validace district_code.

API a přístup k datům: „LLM-friendly“

  • Jednoduché endpointy GET: filtrování pomocí parametrů dotazu (např. ?district=SK0101&from=2025-01&to=2025-09), odpověď ve formátu JSON/CSV.
  • Popis schématu: endpoint /schema s definicí proměnných a typů ve formátu JSON.
  • Omezení počtu požadavků a mezipaměť: srozumitelný kód 429 s hlavičkou „Retry-After“, ETagy pro stabilní ukládání do mezipaměti.
  • Vyjednávání o obsahu: Accept: text/csv, application/json pro tentýž zdroj.

Měření dopadu: metriky pro „SEO pro ChatGPT“

  • Technické: pokrytí JSON-LD, sémantická validita, počet funkčních kotev, úspěšná stažení distribucí.
  • Použití: odkazy s fragmenty z externích zdrojů, počet citací ve formátu BibTeX/CSL, doporučující návštěvy z LLM (pokud označujete parametry UTM).
  • Obsahové: podíl stránek s metodikou, počet definovaných termínů, průměrná délka definice.

Nejčastější chyby a jak se jim vyhnout

  • Chybějící licence: model neví, zda smí obsah použít. Vždy uvádějte license a pokyny k atribuci.
  • Nestabilní URL a změny slugů bez přesměrování 301: narušují citace a strojové odkazy.
  • „Tabulky jako obrázky“: nelze je parsovat; používejte čisté HTML nebo distribuční soubory CSV.
  • Bez verzí a hashů: nelze ověřovat konzistenci výpočtů v čase.
  • Neúplný JSON-LD: chybí name/description/url nebo variableMeasured u datové sady.

Postup implementace krok za krokem

  1. Proveďte inventarizaci: články, definice, metodiky, datové sady; doplňte stabilní URL a kotvy.
  2. Přidejte bloky JSON-LD pro Article, Dataset, DefinedTerm, TechArticle.
  3. Normalizujte tabulky: caption, sémantická záhlaví, žádné slučování buněk bez důvodu.
  4. Zveřejněte distribuce: CSV/Parquet/JSON + sha256, ETag, Content-Disposition.
  5. Zveřejněte metodiky a datové slovníky; propojte je s definicemi.
  6. Vytvořte sitemapu datových sad a citační exporty (BibTeX/CSL/RIS).
  7. Zaveďte changelog a verzování; při změně slugů používejte přesměrování 301.
  8. Nastavte monitoring: validaci JSON-LD, kontrolu odkazů na fragmenty, logy stahování.

Strukturovaná data představují základ „SEO pro ChatGPT“. Kombinace JSON-LD, kvalitních tabulek, precizních metodik a verzovaných datových sad poskytuje modelům LLM jasnou, stabilní a citovatelnou kostru vašeho obsahu. Získáte tak nejen vyšší viditelnost a správnou atribuci v odpovědích modelů, ale také udržitelnou datovou infrastrukturu, která obstojí při auditu i dlouhodobém opakovaném použití.