Web připravený pro RAG a SEO optimalizaci pro ChatGPT: principy, architektura a implementační vzory
„Web připravený pro RAG“ znamená, že vaše webová stránka je od základu navržena pro retrieval-augmented generation (RAG) – tedy pro scénář, kdy generativní model (jako ChatGPT) cíleně vyhledává, cituje a používá vaše data při odpovídání. Cílem není jen klasická indexace, ale také přesné adresování odstavců, strojově čitelné citace, exportovatelné datasety a stabilní trvalé odkazy na každou logickou část obsahu.
Proč přístup „RAG-ready“ patří do SEO pro ChatGPT
- Zvýšení šance na citaci: Modely upřednostňují zdroje s jasnou strukturou, možností odkazování a metadaty pro atribuci.
- Kontrola kontextu: Díky jemné granularitě (ID sekcí, odstavce) model přebírá přesné pasáže namísto volné parafráze.
- Měřitelnost: Trvalé odkazy a manifesty datasetů umožňují přesně sledovat, co se používá.
- Škálování: Jednotný formát exportů (CSV/JSONL/Parquet) zkracuje dobu integrace kurátory a nástroji RAG.
Informační architektura: od dokumentu po odstavec
Vytvořte konzistentní hierarchii: korpus → dokument → sekce → odstavec → věta. Každá úroveň musí mít stabilní identifikátor a ukotvení v URL.
- Dokument: trvalá kanonická URL, verzování a metadata souboru (autor, licence, data).
- Sekce:
idu nadpisu druhé (a nižší) úrovně a vnitřní odkaz#id-sekce. - Odstavec: krátké, sémanticky soudržné bloky s vlastním
ida kotvou (ikona trvalého odkazu).
ID sekcí a trvalé odkazy na odstavce: pravidla generování
- Deterministické vytváření: Slug z nadpisu/obsahu (např. kebab-case), bez diakritiky a s kontrolou kolizí.
- Stabilita v čase: Neměňte ID při drobných úpravách textu; při zásadním refaktoringu použijte
data-prev-ids přesměrováním. - Stručnost: Upřednostněte jednoduchá, čitelná ID (např.
sekce-navrh-rag,ods-citacie-format). - Ikona kotvy: U každého nadpisu/odstavce zobrazte malou ikonu odkazu s přímou URL na dané
#id.
Perex a metadata pro vyhledávání i RAG
Každý dokument by měl mít krátký abstrakt a kompaktní metadata přímo v HTML i v JSON-LD. Perex vytváří kontext, metadata nesou strojově čitelné signály pro sběr a citování.
- HTML microdata:
articles atributyitemscope,itemtype(např. CreativeWork/Article). - JSON-LD:
headline,datePublished,version,isPartOf,about,license,citation,identifier. - Granularita: Doplňujte seznam sekcí/odstavců v
hasParts jejichurla hashemtext.
Datasety pro RAG: formáty, pole a granularita
Publikujte exporty, které kopírují vaši hierarchii. Minimální pole pro každý řádek (chunk):
doc_id: stabilní identifikátor dokumentu (např. UUID nebo deterministický hash kanonické URL).section_id: identifikátor sekce (slug/hash).para_id: identifikátor odstavce.url: úplný trvalý odkaz až na odstavechttps://…/dokument#para_id.titleasection_title: pro snadné zobrazení kontextu.text: čistý text bez HTML; ideálně s normalizovanými bílými znaky.tokens: volitelně počet tokenů; vhodné při plánování segmentace.lang: jazykový tag (BCP-47, např.sk).licenseaattribution: strojově čitelná licenční pravidla a text atribuce.hash: otisk obsahu (např. SHA-256 z normalizovanéhotext).updated_at: čas poslední změny chunku ve formátu ISO 8601.
Formáty: CSV (čitelný pro lidi, pozor na uvozovky), JSONL (standard pro příjem dat do RAG), Parquet (efektivní ukládání, vhodné pro rozsáhlé korpusy).
Segmentace pro RAG: strategie a limity
- Přirozené hranice: Základní chunk = odstavec; sekundárně slučujte několik krátkých odstavců do bloku s limitem tokenů.
- Limit tokenů: 256–512 tokenů na chunk je běžným kompromisem mezi přesností a kontextem.
- Překryvy: 10–15% překrytí mezi sousedními chunky zlepšuje soudržnost odpovědí modelu.
- Vyloučení: Oddělte navigační a právní pasáže (cookies, patičky), aby nezkreslovaly vyhledávání.
Strojově čitelné citace: jak zajistit atribuci
Citace musí být konzistentní v HTML, JSON-LD i datasetech. Základní prvky citace:
- Autor/organizace s trvalým identifikátorem (
identifier,sameAsodkazující na profil, např. ORCID/ISNI). - Datum vydání a aktualizace:
datePublished,dateModified. - Trvalá URL na konkrétní odstavec nebo sekci.
- Licence (URI) a předepsaný text atribuce.
Udržujte také blok „Doporučená citace“ s přesnou citací a tlačítkem „Kopírovat“ – pro lidi i nástroje.
Pravidla pro trvalé odkazy: kanonická URL, verze a přesměrování
- Kanonické URL: Od začátku nastavte konečnou a stabilní URL;
rel="canonical"v HTML i v HTTP hlavičkách. - Verzování: Parametry
?v=pro obsah nepoužívejte. Upřednostněte metadata verze v JSON-LD adateModified. Při velkých změnách můžete zveřejnit nový dokument se vztahemisBasedOnnebohasVersion. - Přesměrování: 301 na nové umístění při změně struktury; zachovejte fragmenty
#id.
Značky HTML a atributy, které pomáhají RAG
idadata-*: Každý<h2..h4>a<p>by měl mítid. Doplňkové atributydata-chunk-hash,data-updated-at,data-license.link rel="canonical"a volitelněrel="cite-as"(neoficiálně používané vzory) odkazující na trvalou URL.- Drobečková navigace: Strukturovaná data pro kontext v hierarchii.
Manifesty a kontrolní součty: důvěra a deduplikace
Zpřístupněte manifest korpusu (např. /dataset/manifest.json) s položkami pro každý dokument a jeho sekce:
- Hash obsahu (např. SHA-256) dokumentů, sekcí a odstavců – usnadňují detekci změn.
- Časová razítka:
published_at,modified_at. - Mapování starých→nových ID při refaktoringu.
XML sitemapy a feedy optimalizované pro RAG
- Standardní sitemap s granularitou na úrovni dokumentů a podrobným údajem
<lastmod>. - Index dokumentů pro datasety: odkaz na export CSV/JSONL, manifest a licenci.
- Atom/RSS feedy
- Odkazy na sekce v jednotlivých záznamech (pokud změníte konkrétní sekci, publikujte záznam s
linkna dané#id).
Licencování a pravidla atribuce pro bezpečné použití
- Strojově čitelná licence (URI), stručné podmínky (např. CC BY 4.0) a předepsaná citace v datasetech i HTML.
- Právní minimum: Jasně definujte omezení (např. zákaz redistribuce surového korpusu bez souhlasu).
- Pole v datasetu:
license,attribution,terms_url.
Příprava na embeddingy: čistota textu a normalizace
- Odstranění šumu: Navigaci, skripty a reklamy označte a v exportech vynechejte.
- Normalizace: Sjednoťte uvozovky, mezery a odrážky; zachovejte konzistentní diakritiku.
- Jazykové tagy:
langu elementu i v datasetech – důležité pro vícejazyčné korpusy.
Překlady a paralelní korpusy
- Propojení mezi jazyky:
inLanguage,translationOfWork,workTranslationv JSON-LD. - Stejná granularita: Zrcadlete strukturu sekcí/odstavců – usnadníte vícejazyčné vyhledávání.
Verzování dokumentů a odstavců: auditovatelnost
- Pole
versionv JSON-LD ve stylu semver; při zásadní změně nové trvalé URL nebo explicitníhasVersion. - Protokol změn dostupný přes
link rel="alternate" type="application/json"s rozdíly v hashech odstavců.
Monitoring a metriky „RAG-readiness“
- Pokrytí: % dokumentů se sekčními a odstavcovými
ida trvalými odkazy. - Aktuálnost datasetu: průměrný rozdíl mezi hodnotou
modified_atna webu a v exportu. - Kvalita chunků: rozložení délek, počtu tokenů a míry překrytí.
- Míra citování: počet externích citací odkazujících na fragmenty
#id.
Bezpečnost a ochrana proti scrapování při zachování funkčnosti RAG
- Omezení počtu požadavků a pravidla pro roboty: Chraňte server, ale neblokujte legitimní nástroje pro sběr exportů a sitemap.
- Hash obsahu: Usnadňují deduplikaci a prokazování původu; hodí se také pro partnery.
- Digitální podpisy: Volitelné podepisování exportů (např. oddělený podpis) pro zajištění integrity.
UX vzory pro trvalé odkazy a citace
- Zobrazení ikony kotvy při najetí myší nebo zaměření u nadpisů a odstavců.
- Tlačítko kopírování u citace a ID odstavce; zkopíruje přesnou URL
#para_id. - Akce „Odkaz na tento obsah“ po výběru textu – vygeneruje URL s
#para_ida případně?q=pro zvýraznění.
Praktický exportní balíček
/dataset/manifest.json: index dokumentů, verze, hashe pro jednotlivé dokumenty a sekce./dataset/corpus.jsonl: jeden řádek = chunk (odstavec), pole popsaná výše./dataset/corpus.parquet: stejné schéma pro rozsáhlé datové pipeline./dataset/LICENSE: podmínky použití, atribuce, kontaktní místo.
On-page SEO pro ChatGPT a RAG
- Hierarchie H2/H3 s jednoznačnými názvy sekcí.
- Text bohatý na entity: pojmenované entity s odkazy na autoritativní zdroje (
sameAsv JSON-LD). - Interní prolinkování: seznam „Související odstavce“ s přímými odkazy na
#id.
Implementační plán na 30–60–90 dní
- 0–30 dní: Audit kanonických URL, generování
idpro sekce/odstavce, kotvy v uživatelském rozhraní, základní JSON-LD a sitemap. - 31–60 dní: Datasety (JSONL/Parquet), manifest s hashi, citace na úrovni sekcí, exportní koncové body a monitoring.
- 61–90 dní: Optimalizace segmentace, překlady/paralelní korpusy, podpisy exportů, šablony atribuce a funkce „Odkaz na tento obsah“.
Kontrolní seznam „RAG-ready“ před nasazením
- Každá sekce a odstavec mají stabilní
ida funkční kotvu/trvalý odkaz. - Existuje JSON-LD s
hasParta odkazy na úrovni#id. - K dispozici je manifest a export datasetu (JSONL/Parquet) s poli
doc_id,section_id,para_id,url,text,hash,license,updated_at. - Blok „Doporučená citace“ pro každou sekci a tlačítko kopírování fungují.
- Sitemap a feedy odkazují na nové/aktualizované sekce.
- Monitoring pokrývá rozsah, aktuálnost, kvalitu chunků a míru citování.
Web připravený pro RAG je mostem mezi klasickým SEO a světem generativních modelů. Stabilní identifikátory sekcí a odstavců, strojově čitelné citace, kvalitní datasety a promyšlené trvalé odkazy zvyšují pravděpodobnost, že se právě váš obsah stane zdrojem pravdy v odpovědích ChatGPT a dalších asistentů. Takto vybudovaná infrastruktura snižuje informační šum, posiluje atribuci a přináší měřitelné přínosy autorům i uživatelům.
