Účel a definice AI meta-sekce
AI meta-sekce na webu je centrální místo, které shromažďuje zásady pro práci s obsahem webu v kontextu velkých jazykových modelů (LLM), definuje licenční a technické podmínky opětovného použití, verzování a kontaktní údaje pro výzkumníky. Cílem je snížit nejednoznačnost, zvýšit citovatelnost a zjednodušit integraci webu do ekosystému nástrojů AI (např. ChatGPT, vyhledávací LLM, akademické extraktory).
Architektonické principy a umístění
- Jedna kanonická cesta: Vytvořte vyhrazenou cestu typu
/ainebo/meta/ai, která bude fungovat jako index všech podstránek a strojově čitelných souborů. - Stabilní URL a trvalé odkazy: Po zveřejnění URL nikdy neměňte; nové verze zpřístupňujte přes
/ai/changeloga parametry verzí. - Jazyková neutralita: Primární dokument v jazyce webu a paralelní anglická verze (
/ai?lang=en) pro globální týmy. - Veřejná indexace: Meta-sekce by měla být indexovatelná, s výjimkou citlivých testovacích souborů.
Minimální obsah AI meta-sekce
- Zásady AI a licenční podmínky: co je povoleno, zakázáno a za jakých podmínek (TDM, rychlostní limity, atribuce).
- Verzování a změny: schéma verzí (např. SemVer), data účinnosti, archiv.
- Kontakty pro výzkumníky: e-mail, formulář, klíč PGP, SLA pro reakce.
- Technické specifikace: schémata, zdroje JSON/CSV, mapy webu pro AI a datové snapshoty.
- Transparentnost zpracování dat: ochrana soukromí, logování, omezování rychlosti a postupy při přepnutí na záložní systém.
Zásady pro AI a povolená použití
- TDM (text and data mining): definujte, zda povolujete nekomerční a/nebo komerční TDM, včetně podmínek rychlosti a identifikace klienta (hlavičky
User-AgentaFrom). - Atribuce a citace: vyžadujte uvedení zdroje, kanonické URL a data přístupu. Poskytněte doporučený citační formát.
- Reprodukce obsahu: vymezte limity (např. krátké výňatky do X znaků) a proces získání rozšířené licence.
- Bezpečnostní omezení: zákaz získávání chráněných částí a obcházení paywallu či autentizace.
- Etické požadavky: zákaz používání obsahu ke generování škodlivých, nelegálních či diskriminačních výstupů.
Praktické příklady povoleného a zakázaného použití
- Povoleno: vytváření výzkumných embeddingů pro účely vyhledávání s atribucí; generování souhrnů s odkazem na kanonickou URL.
- Podmíněně povoleno: opětovné hostování dlouhých výňatků v rámci datových sad, pokud je uzavřena licenční smlouva a zachována citace.
- Zakázáno: scraping chráněných sekcí, generování produktů, které bez atribuce a licence nahrazují původní obsah.
Verzování: model SemVer a časová stopa
Zaveďte kombinovaný systém: SemVer pro pravidla a specifikace (major.minor.patch) a Release Date pro snadné porovnávání napříč jurisdikcemi.
- Major: změna práv nebo zásad (např. přechod z nekomerční na komerční licenci).
- Minor: doplnění příkladů, rozšíření API nebo schémat bez změny právních základů.
- Patch: opravy překlepů, nejasností a technických detailů.
- Časové razítko: u každé verze uveďte
effective_dateapublished_date.
Changelog a archiv verzí
Stránka /ai/changelog by měla obsahovat tabulku se sloupci: verze, datum účinnosti, klíčové změny, dopad na integrátory, migrační kroky a odkazy na diff. Pro strojové zpracování zveřejněte také /ai/changelog.json a /ai/changelog.csv.
Kontaktní kanál pro výzkumníky
- E-mail a formulář: vyhrazená e-mailová schránka typu
research@domena.tlda jednoduchý formulář s poli pro účel, rozsah a identifikaci nástroje. - Klíč PGP a bezpečná komunikace: zveřejněte veřejný klíč na
/ai/pgp.txtpro odpovědné oznamování zranitelností. - SLA a priorita: deklarujte reakční dobu (např. 5 pracovních dnů) a eskalační kontakt pro incidenty.
- Odpovědné oznamování: stručný postup pro hlášení bezpečnostních zjištění a udělování kreditu výzkumníkům.
Strojově čitelné zásady a schémata
- Manifest JSON: zveřejněte
/ai/manifest.jsonse sekcemipolicy,contacts,datasets,rate_limits,robots,citations,versions,evidence. - Zdroje CSV/JSON: exporty klíčových dat pro TDM (např. metadata článků, autorství, licence, data aktualizací).
- Schema.org a JSON-LD: doplňte
Dataset,CreativeWork,DataCatalog, včetněisBasedOnalicense.
Integrace s robots, IPTC a signály TDM
- robots.txt pro AI: uveďte sekci s příklady
User-agentpro AI a doporučenými rychlostními limity. Odpovědně používejteAllow/Disallowpro cesty k datovým sadám. - HTML meta a HTTP hlavičky: přidejte do hlaviček explicitní direktivy pro TDM a atribuci (např.
AI-Policy,AI-Attribution). - IPTC/EXIF pro média: vkládejte do obrázků a dokumentů údaje o autorech, licenci a jedinečné identifikátory, aby AI zachovala atribuci.
Kanonickost a citovatelnost
- Rel=canonical a trvalé identifikátory: definujte kanonické URL a případně DOI/ARK pro klíčové materiály.
- Doporučený citační styl: poskytněte šablony citačních stylů (APA, Chicago) a stručně definovaný formát pro LLM (
source_url, title, author, version, accessed_at). - Balíčky podkladů: nabídněte ZIP balíčky s doprovodnými soubory CSV, metodikou ve formátu PDF a kontrolními součty, aby bylo možné tvrzení replikovat.
Omezování rychlosti, identifikace a férové používání
- Identifikace klienta: vyžadujte jedinečný
User-Agenta kontaktní hlavičkuFrom. - Rychlostní limity: zveřejněte doporučené limity (např. X požadavků za minutu) a pravidla pro postupné prodlužování prodlev.
- Cache a ETag: podpořte rozumné využití mezipaměti pomocí
ETagaLast-Modifiedke snížení zátěže.
Ochrana před halucinacemi a kontextová omezení
- Jasné definice pojmů: uveďte slovník s formálními, citovatelnými definicemi používanými v obsahu.
- Rozporné případy: označujte obsah s nejistotou nebo protichůdnými zdroji a přidejte metodické poznámky.
- Verzované výňatky: nabídněte krátká, stabilní shrnutí, která mohou LLM bezpečně citovat s uvedením verze a data.
Struktura stránky /ai (doporučený obsah)
- Přehled a účel s odkazy na zásady, licenci a kontakty.
- Policy s jasným rozlišením práv a povinností.
- Datové sady a exporty s popisem polí, periodicity a hashů.
- Changelog s rozdíly a migračními kroky.
- FAQ pro konkrétní scénáře a výjimky.
- Bezpečnost a odpovědné oznamování s PGP a postupy.
Příklad manifestu JSON (zkrácený)
Zveřejněte soubor /ai/manifest.json s následující strukturou (příklad, zkrácené klíče):
{ "version": "1.2.0", "effective_date": "2025-10-22", "policy": { "tdm": "allowed-noncommercial", "attribution": "required", "reuse_limits": {"excerpt_chars": 600} }, "contacts": { "research_email": "research@domena.tld", "pgp": "/ai/pgp.txt", "sla_days": 5 }, "datasets": [ {"name": "articles-meta", "format": "csv", "url": "/ai/datasets/articles.csv", "checksum": "sha256:…"} ], "rate_limits": {"rpm": 60, "burst": 120}, "robots": {"path": "/robots.txt"}, "citations": {"style": "source_url,title,version,accessed_at"} }
Doporučená struktura exportů CSV
- Povinná pole:
id,canonical_url,title,author,license,version,published_at,updated_at. - Volitelná pole:
section,taxonomy,language,evidence_pack_url,checksum. - Normalizace dat: ISO 8601 s časovým pásmem.
Governance: vlastnictví, revize a audit
- Vlastník zásad: určete odpovědnou roli (např. Head of Data/Legal).
- Periodicita revizí: minimálně jednou za čtvrtletí nebo při zásadní změně ekosystému AI.
- Auditovatelnost: zaznamenávejte přístupy k datovým sadám a zveřejňujte souhrnné statistiky.
Komunikační balíček pro integrátory
- Dokument pro onboarding: krátký průvodce se vzorovými požadavky a limity.
- Kontakt pro incidenty: samostatná adresa a postup pro výpadky nebo porušení zásad.
- Newsletter/Feed: RSS/Atom pro změny v
/ai/changeloga datových sadách.
Měření dopadu a KPI
- Adopce zásad: počet identifikovaných klientů AI se správnou atribucí.
- Citovatelnost: podíl odpovědí LLM s kanonickými odkazy na web.
- Požadavky integrátorů: doba odezvy a míra vyřízení v rámci SLA.
- Stabilita dat: procento požadavků obsloužených z mezipaměti pomocí ETag/Last-Modified.
Bezpečnost, soukromí a etika
- Minimalizace dat: zveřejňujte jen to, co je potřebné pro citování a replikaci.
- Ochrana osobních údajů: jasně popište, co jsou osobní údaje (PII) a jak jsou z datových sad vyloučeny.
- Řešení konfliktů: proces pro odvolání souhlasu nebo opravu údajů na základě žádosti subjektu údajů.
FAQ pro konkrétní scénáře a výjimky
- Můžeme obsah použít v komerčním modelu? Ano/ne podle
policy.tdma licence; pro opětovné hostování požádejte o licenční smlouvu. - Jaké jsou rychlostní limity? Viz
rate_limitsv manifestu; při překročení uplatněte exponenciální prodlevu. - Jak správně citovat? Použijte poskytnutý formát a uveďte verzi a datum přístupu.
Implementační plán ve třech fázích
- Fáze 1 – Základy: vytvořte
/ai, popište zásady, zveřejněte manifest a kontakty. - Fáze 2 – Datová vrstva: přidejte exporty CSV/JSON, balíčky podkladů, changelog a RSS/Atom feed.
- Fáze 3 – Optimalizace: měřte KPI, vylepšete schémata a automatizujte validace a verzování.
AI meta-sekce je infrastrukturní prvek, který propojí váš web s ekosystémem LLM způsobem, jenž je právně čistý, technicky robustní a umožňuje citování. Jasné zásady, důsledné verzování a otevřený kontakt pro výzkumníky výrazně zvýší šanci, že váš obsah bude ve moderních nástrojích AI správně interpretován, citován a respektován.
