Licencování obsahu pro AI: pravidla robots.txt, IPTC a politiky TDM

Licencovanie obsahu pre AI: Robots, IPTC a TDM politiky

Přehled: proč licencování obsahu pro AI patří do strategie GEO

Generative Engine Optimization (GEO) není jen „SEO pro LLM“. Aby se obsah bezpečně a výhodně dostal do trénovacích a inferenčních pipeline modelů, musí být jasně licencovaný, strojově čitelně označený a technicky chráněný. Tato kapitola podrobně pokrývá tři pilíře: kontrolu indexace a extrakce prostřednictvím robots a HTTP hlaviček, práva a metadata prostřednictvím IPTC a práva na text a data mining (TDM) včetně mechanismů opt-out. Cílem je, aby byl váš obsah zároveň nalezen, správně interpretován, spravedlivě zpeněžen a právně obhajitelný.

Taxonomie použití: trénink, fine-tuning, retrieval a inference

Při navrhování licenční politiky rozlišujte čtyři hlavní scénáře: plošné trénování (foundation model), cílený fine-tuning (adaptace na doménu), retrieval-augmented generation (RAG) s dočasným vektorovým indexem a přímou inferenci (citování nebo parafrázování). Každý scénář může mít odlišné licenční podmínky (např. zákaz trvalého ukládání vs. povolení dočasných embeddingů; povinné citování; revenue share při výpisech nad určitou délkou).

Právní rámec ve zkratce: EU TDM, autorské právo a databáze

V EU upravuje text and data mining (TDM) směrnice DSM (2019/790). Článek 3 zavádí výjimku pro neziskové výzkumné organizace a kulturní instituce; článek 4 umožňuje širší TDM, pokud nositel práv nevyjádří strojově čitelný opt-out. Databázová práva podle směrnice 96/9/ES mohou poskytnout další vrstvu ochrany významným investicím do souborů dat. V USA hraje klíčovou roli fair use, jehož uplatnění však závisí na kontextu; v případě GEO proto doporučujeme explicitní licence a technické signály, aby byly záměr a podmínky nepřehlédnutelné.

Licenční modely pro AI: otevřené, podmíněné a komerční

Praktická nabídka sahá od otevřených licencí (např. CC BY s omezeními pro trénink) přes podmíněné (povolené RAG a citování, zakázaný trénink) až po komerční smlouvy (předplatné datasetu, zpoplatněné API, revenue share). Pro GEO je vhodné zveřejnit „licenční matici“: které činnosti AI jsou allowed, allowed with conditions a prohibited, s odkazem na kontaktní místo a strojově čitelný manifest.

Robots.txt jako signál pro crawlery včetně AI botů

Robots.txt zůstává první obrannou linií i vyjádřením preferencí. Moderní AI crawlery (např. specializovaní agentní boti) obvykle respektují své user-agenty a pravidla Disallow. Doporučení pro GEO:

  • Definujte segmentovaná pravidla: obecné vyhledávače vs. boti specificky pro AI (samostatné bloky User-agent).
  • Zakázat extrakci z API a soukromých částí; specifikujte crawl-delay, pokud platforma botů tuto možnost podporuje.
  • Přidejte kontaktní URL a politiku ve formě komentáře, aby lidští operátoři snadno našli licenční podmínky.

Příklad bez použití předformátovaného bloku: User-agent: *
Allow: /public/
Disallow: /account/
Disallow: /api/

User-agent: AIBot
Disallow: /
# Licensing: https://example.com/ai-licensing

Meta robots a X-Robots-Tag: strojově čitelný opt-out a granularita

Kromě robots.txt je důležité používat meta a serverové hlavičky X-Robots-Tag pro konkrétní URL, typy souborů a odpovědi. Pro konzumaci obsahu AI se osvědčuje kombinace klasických direktiv se značkami specifickými pro AI, pokud je bot podporuje.

  • Na úrovni HTML: <meta name="robots" content="index,follow,noarchive">
  • Na úrovni HTTP: X-Robots-Tag: noindex, noarchive (lze použít pro PDF, CSV a obrázky)
  • Větší explicitnost pro AI: doplňkové signály, jako například <meta name="ai" content="noai, norag, notrain"> nebo X-Robots-Tag: notrain pro klienty, kteří tyto klíče respektují.

Ačkoli neexistuje univerzální norma pro klíčová slova noai/notrain, několik AI crawlerů je začalo respektovat. V kontextu GEO je používejte souběžně s právními texty a metadaty IPTC.

Sitemapy a manifesty: kde zveřejňovat licence a politiky

Do sitemap.xml přidejte doplňkové prvky s odkazy na licenci a verze datasetů. U statických datasetů použijte také sitemapindex s hashi (integrita) a atributem lastmod pro zajištění transparentnosti změn. V těle HTML každého obsahu odkazujte na „AI Licensing Policy“ a strojově čitelný manifest (např. JSON-LD se schématem CreativeWork a vlastním rozšířením pro použití AI).

Metadata IPTC: důkaz původu, práv a omezení

IPTC Photo/Video/News Metadata poskytuje robustní pole pro vyjádření autorství a licenčních stavů. Klíčové položky, které by měly být vyplněny a zachovány v průběhu celého pipeline:

  • Creator/Byline, Credit Line, Copyright Notice
  • Licensor a kontaktní údaje, Web Statement of Rights (URL licenční politiky)
  • Rights Usage Terms (konkrétní podmínky pro AI: povolený/zakázaný trénink, požadované citování, omezení RAG)
  • Digital Source Type (pro rozlišení originálního, syntetického nebo kompozitního obsahu)
  • Linked Rights Expressions (např. odkazy RightsML/ODRL na strojově čitelná pravidla)

U obrázků a videí kombinujte IPTC s manifestem C2PA pro kryptografické prokázání původu a „policy hints“ v řetězci zpracování. V GEO to zvyšuje šanci, že LLM budou respektovat vaši politiku a při citování zachovají atribuci.

TDM opt-out: jak splnit požadavek na „strojovou čitelnost“

Na úrovni práva EU je opt-out vůči TDM platný, pokud je vyjádřen strojově čitelným způsobem. Praktický balíček opatření pro GEO:

  • Robots a X-Robots-Tag s direktivami notrain/noai a noarchive.
  • IPTC/JSON-LD s odkazem na licenci a explicitními podmínkami pro AI.
  • Podmínky používání na stabilní URL politiky (permalink), na kterou odkazujete z každého dokumentu a ze sitemap.
  • Hashované otisky datasetů (integrita) a changelog pro doložení toho, které verze byly kdy dostupné.

HTTP hlavičky a kontrola distribuce souborů

Kromě X-Robots-Tag zaveďte hlavičky, které ztěžují hromadnou redistribuci a usnadňují audit:

  • Content-Disposition s rozumným názvem souboru a verzí (např. dataset-v2025-10.csv)
  • ETag pro spolehlivou identifikaci verze
  • Volitelně hlavičky „policy hint“ (např. X-AI-Use-Policy: notrain;norag;contact=https://example.com/ai-licensing)

Schema.org a JSON-LD: licence jako součást datového modelu

Do stránky vložte entitu JSON-LD CreativeWork nebo Dataset s atributy license, creator, isAccessibleForFree, usageInfo a vlastními rozšířeními pro použití AI. U CSV a PDF zveřejněte také odkaz na distribution s položkami contentUrl, encodingFormat a sha256. LLM indexéry z těchto polí dokážou odvodit, zda mohou obsah bezpečně používat a jak jej citovat.

Ochrana proti scrapování a rate limiting vs. „dobří“ AI partneři

Technickou ochranu nastavte selektivně: blokujte neidentifikované scrapery (ASN, fingerprinting požadavků), ale umožněte whitelisted partnerům přístup prostřednictvím podepsaných URL, firemních IP adres a jasné smlouvy. GEO tak dosáhne rovnováhy – obsah bude využitelný v seriózních modelech, ale nebude volně extrahovatelný bez dohody.

Licenční manifest pro AI: doporučený formát

Udržujte na stabilní adrese dokument s politikou, na který odkazují robots, meta, IPTC a JSON-LD. Minimální položky:

  • Název a verze politiky, datum účinnosti a changelog.
  • Matice povolení: training, fine-tuning, RAG, inference-quoting, embedding-persistence, derivative-works.
  • Podmínky atribuce a zpětného odkazu; pravidla pro citace delší než X znaků.
  • Kontakt pro komerční licence a podmínky reportování (např. měsíční agregované záznamy o použití).

Changelog a verzování: prokazatelnost v čase

Každá změna licence musí být auditovatelná. Vytvořte changelog (ideálně na samostatné URL) a verzujte také manifest a datasety. Doporučuje se styl semver (např. 1.2.0) a podepisování verzí (PGP nebo v manifestu C2PA). V případě sporů můžete doložit, jaká pravidla platila k určitému datu.

Příklady implementace bez předformátovaných bloků

HTML meta: <meta name="robots" content="index,follow,noarchive"> <meta name="ai" content="norag,notrain">

HTTP hlavička pro PDF: X-Robots-Tag: noindex, noarchive, notrain

JSON-LD (zkráceně): { "@context":"https://schema.org", "@type":"Dataset", "name":"Ceníky 2025", "license":"https://example.com/ai-licensing#policy-v1-2", "creator":{"@type":"Organization","name":"Acme"}, "usageInfo":"AI: pouze RAG, citace povinná", "distribution":{"@type":"DataDownload","contentUrl":"https://example.com/datasets/cenniky-2025-10.csv","encodingFormat":"text/csv","sha256":"..."} }

Klíčová pole IPTC v XMP: dc:rights="© 2025 Acme"; xmpRights:WebStatement="https://example.com/ai-licensing"; photoshop:Credit="Acme Data"; plus:Licensor="Acme"; Iptc4xmpCore:CreatorContactInfo="..."

Měření a audit: jak zjistit, kdo váš obsah používá

Zavádějte nenápadné značky (např. drobné identifikátory v datasetech nebo v komentáři HTML), které nezpůsobují škody, ale pomohou zpětně identifikovat zdroj v případě úniků. Zaznamenávejte vzorce přístupu, podepisujte vydání a pravidelně vyhledávejte citace a parafráze ve výstupech modelů. U komerčních partnerů vyžadujte měsíční agregované reporty.

Řešení sporů a vymáhání

Definujte proces „notice and negotiation“: rychlé kontaktování poskytovatele modelu, dočasný bezpečnostní režim (omezení přístupu), návrh licenční dohody nebo odstranění materiálů. Připravte důkazní balíčky (hashe, verze, exporty záznamů, kopie robots a manifestů platné k datu incidentu).

Best practices GEO: jak sladit dohledatelnost a kontrolu

  • Jasně oddělte veřejné části určené k indexaci od soukromých částí určených k prodeji či partnerstvím.
  • Na veřejné články aplikujte licence umožňující atribuci a RAG; u datasetů použijte registraci a klíče API.
  • Každý obsah sděluje totéž: meta/hlavičky, JSON-LD, IPTC/C2PA, interní odkazy na politiku.
  • Partnerům nabídněte „compliance kit“: whitelist user-agentů, rozsahy IP adres, frekvenci crawlů, rozhraní pro citace.

Kontrolní seznam implementace

  • Robots.txt s bloky pro AI a odkazem na politiku.
  • Meta a X-Robots-Tag pro stránky a soubory; klíče specifické pro AI jako doplňkový signál.
  • JSON-LD s položkami license/usageInfo; hash a verze souborů.
  • Vyplněné IPTC zachované v exportech; manifest C2PA u médií.
  • Sitemapy s položkou lastmod a odkazy na licenci; changelog veřejně dostupný.
  • Monitorování crawlerů, reporting partnerů, připravené vzory smluv a oznámení.

Licencování obsahu pro AI v kontextu GEO propojuje právo, standardy metadat a signály infrastruktury. Vybudujete-li konzistentní řetězec od robots až po IPTC/C2PA a manifesty JSON-LD, získáte trojí hodnotu: modely váš obsah správně „vidí“, respektují vaše podmínky a v případě sporu máte měřitelné důkazy. To je základ udržitelné spolupráce mezi vydavateli a vývojáři generativních systémů.