Co je TDM (Text and Data Mining) a proč na něj myslet při AI/LLM a moderním SEO
Text and Data Mining (TDM) označuje techniky automatizovaného získávání poznatků, struktur a vzorců z rozsáhlých souborů textových a datových zdrojů. V kontextu optimalizace webů pro AI/LLM, AIO/AEO a moderního SEO je TDM základem: modely potřebují data, jejich sběr a použití však musí respektovat právní, technické a etické zásady – od licenčních omezení přes autorské právo a práva k databázím až po ochranu osobních údajů, integritu obsahu a kvalitu datasetů.
Terminologie a rámec: obsah, práva, povolení
- Obsah: texty, obrázky, videa, zvuk, metadata, strukturovaná data (JSON-LD, schema.org), logy a další signály.
- Právní titul: licence, zákonná výjimka/povolení, souhlas nebo jiný oprávněný důvod použití.
- Přístup vs. použití: to, že se k obsahu dokážete dostat (technicky), neznamená, že jej smíte vytěžovat (právně).
- Výstup: odvozené dílo, váhy modelu, embeddingy, statistiky; každý z nich představuje jiná rizika z hlediska práv a citlivosti.
TDM a autorské právo: obecné zásady
- Respektujte licence: otevřené licence (CC BY, CC BY-SA, CC0) mají odlišné požadavky (např. uvedení autora, sdílení za stejných podmínek).
- Rozlišujte díla a fakta: fakta a myšlenky nejsou chráněny jako díla, ale konkrétní výběr/uspořádání (např. databáze) chráněny být mohou.
- Práva k databázím: zvláštní ochrana databází (sui generis) se může uplatnit i mimo klasická autorská díla.
- Dobrá víra a proporcionalita: minimalizujte objem kopírovaného materiálu a uchovávejte záznamy o původu (data lineage).
Výjimky a omezení pro TDM (obecný přehled, bez specifik jednotlivých jurisdikcí)
Různé jurisdikce rozlišují mezi výjimkami pro výzkumníky a obecnými výjimkami, které platí za určitých podmínek. Praktický důsledek pro týmy AI/LLM:
- Ověřte status „kdo jsme“: akademický výzkum, kulturní instituce, komerční subjekt – mohou pro ně platit jiná pravidla.
- Ověřte „opt-out/výhradu práv“: pokud má držitel práv možnost vyhradit si právo na TDM (strojově čitelným způsobem), respektujte ji.
- Implementujte „vynucování zásad“: crawler a pipeline musí číst signály (robots/meta/headers) a řídit se jimi.
Strojově čitelné výhrady a signály pro TDM
V praxi se k vyjádření přání držitelů práv používají kombinace webových signálů. Nejsou plně univerzální, představují však de facto standardy chování odpovědných crawlerů a systémů TDM:
- robots.txt: pravidla
User-agentaDisallowpro crawlery; nejde o licenci, ale o signál přístupu. Pro TDM je vhodné číst také pravidla pro konkrétní agenty (např. dedikované řetězce User-Agent AI crawlerů). - Meta tagy v HTML:
<meta name="robots">(indexování/snippety) a také neformální dohody pro AI (např. signály typu „noai“), které by „slušní“ crawleři měli respektovat – dokud nebude zaveden formální standard, záleží to na zásadách jednotlivých dodavatelů. - HTTP hlavičky (X-Robots-Tag): lze je použít pro soubory, které nejsou v HTML (PDF, obrázky), i pro globální pravidla.
- Sitemapy a licenční příznaky: u mediálních webů a katalogů je vhodné uvádět licenční podmínky u URL (také ve feedech/API).
Princip „opt-out“ a jeho důsledky
Pokud držitel práv vyjádří strojově čitelnou výhradu proti TDM (opt-out), robustní systém TDM musí:
- Neshromažďovat obsah z dotčených URL/domén (vynucování pravidel crawlerem).
- Odstranit již shromážděná data z datasetů (zpětná náprava).
- Znovu ověřit sady modelů/embeddingy, pokud hrozí únik chráněného vyjádření.
Licenční modely a due diligence
- Licence „open content“: ověřte přesné znění, uvedení autora, podmínky komerčního použití a povinnosti u odvozených děl.
- Komerční licence / smluvně poskytnutá data: doložitelný souhlas s TDM, definovaná povolená použití (trénink, inference, rešerše), závazek k odstranění na žádost.
- Podmínky používání API: mnoho API výslovně zakazuje TDM/trénink LLM; respektujte podmínky služby (ToS) a nastavte limity ukládání.
Ochrana osobních údajů při TDM
- Minimalizace údajů: shromažďujte jen to, co potřebujete k dosažení cíle (právní základ, omezení účelu).
- Pseudonymizace / anonymizace: odstraňujte identifikátory, používejte detekci PII a filtrační pravidla.
- Práva subjektů údajů: vyřizujte žádosti o opravu/vymazání v datasetech i odvozených systémech (např. retrievery).
- Geografická omezení: při přenosu údajů dodržujte pravidla pro předávání údajů a smluvní doložky.
Integrita a kvalita datasetu
- Provenience (data lineage): zaznamenávejte původ zdroje, čas, licenci, signály přístupu a verzi obsahu.
- Deduplikace a odstranění kontaminace: omezujte únik zapamatovaných pasáží a přesných kopií testovacích sad; chraňte se před únikem dat.
- Bias a reprezentativnost: auditujte zastoupení domén, jazyků a stylů; korigujte zkreslení.
- Obsahové filtry: vylučujte malware, spam, pornografii, nenávistný obsah a nezákonné materiály.
Technické zásady pro TDM crawler a pipeline
- Identifikace agenta: používejte jasný
User-Agents kontaktem a URL zásad; respektujterobots.txt. - Omezování rychlosti a etiketa: nepřetěžujte weby, respektujte
Crawl-delay(pokud se používá) a zásady ohleduplného procházení. - Vynucování zásad: před stahováním čtěte a ukládejte do mezipaměti stav
robots.txt, metadat a hlaviček; používejte „denylist/allowlist“. - Kanonické URL a duplicity: při agregaci respektujte
rel="canonical"; omezujte duplicity a spam z parametrů. - Šifrování a bezpečnost: data bezpečně přenášejte a ukládejte, přístupy auditujte.
- Vynechání obsahu: implementujte pravidla pro odstranění částí (např. prvků s
data-nosnippetnebo sekcí se specifickou licencí).
Signály vynucování zásad: příklady implementace
- robots.txt (blokování dedikovaného AI agenta):
User-agent: MyAICrawler Disallow: /private/ Disallow: /no-tdm/ Allow: /public/ - HTTP hlavička pro PDF:
X-Robots-Tag: noindex, noarchive - Meta tag pro řízení snippetu (neblokuje indexování):
<meta name="robots" content="index,follow, max-snippet:160, max-image-preview:large"> - Strojově čitelný „TDM opt-out“ (neformální signál):
<meta name="permissions" content="ai: no-train; tdm: opt-out">Poznámka: názvy a formát takových polí se liší; důležité je, aby je vaše crawlery dokázaly číst a respektovat.
Governance: procesy, role a odpovědnosti
- Data Steward: odpovídá za pravidla akvizice, filtrování, evidenci licencí a audity.
- Legal & Compliance: ověřuje právní titul, podmínky služby (ToS), dopady jurisdikce a proces opt-out.
- Security & Privacy: řídí čištění PII, přístupová práva a reakci na incidenty.
- ML Ops: uplatňuje „hygienu dat“ v tréninkové pipeline a eviduje reprodukovatelnost.
Etika TDM: respekt k autorům a ekosystému
- Reciprocita: odkazujte na zdroje, zachovávejte uvedení autorů a podporujte otevřená data, kde je to možné.
- Transparentnost: zveřejňujte „dataset cards“/„model cards“ se stručným popisem původu a omezení.
- Citlivé oblasti: zdravotnictví, děti, soukromé komunity – uplatňujte přísnější kritéria, vyžadujte výslovné souhlasy, nebo obsah zcela vylučte.
Kontrolní seznam (Checklist) pro projekt TDM
- Právní základ pro každý dataset (licence, výjimka, souhlas, soulad s ToS) je zdokumentován?
- Mechanismus opt-out (robots/meta/headers) se respektuje a je jeho dodržování technicky vynucováno?
- Ochrana PII (detekce, maskování, mazání na žádost) je zavedena?
- Data lineage a auditní záznam (čas, zdroj, licence, hash) jsou plně dohledatelné?
- Odstranění kontaminace a deduplikace probíhají před tréninkem?
- Omezování rychlosti a ohleduplné procházení jsou nastaveny?
- Reakce na incidenty v případě nároku držitele práv (takedown, zásady pro opakovaný trénink) je připravena?
TDM a AIO/AEO: dopady na viditelnost a důvěryhodnost
- Stránky s jasnými licencemi (např. otevřené odborné texty s uvedením autora) mají větší šanci být legálně použitelné v odpovědích AI a vyhledávačů.
- Správné signály (sitemap, robots, meta) snižují riziko nežádoucího použití obsahu nebo naopak pomáhají řídit jeho zpřístupnění.
- Strukturovaná data (schema.org) usnadňují extrakci faktů, aniž by docházelo k porušení celistvých částí děl.
Praktická architektura TDM: od zdroje po trénink
- Discovery: seznam zdrojů, stanovení priorit, čtení
robots.txt, seznamy povolených/zakázaných zdrojů. - Acquisition: crawler s vynucováním zásad, parsování (HTML, PDF), extrakce metadat a licenčních polí.
- Sanitization: detekce PII, konverze formátů, deduplikace, detekce toxického obsahu, kvalitativní skóre.
- Catalog: datový katalog s uvedením autorů, hashi, fingerprinty a kontrolními součty.
- Training interface: vzorkování s váhami podle kvality/licence, odstranění kontaminace ve vztahu k evaluačním sadám.
- Governance & audit: pravidelné revize, uplatňování opt-out, právo na výmaz.
Vzorová komunikace pro držitele práv a provozovatele AI
- Pro držitele práv: uveďte jasné licenční podmínky, strojově čitelné signály a preferovaný kontakt pro TDM a takedown.
- Pro provozovatele AI: zveřejněte zásady respektování signálů, lhůty pro reakci na žádosti a možnosti opt-out.
Minimalizace rizik při publikování výstupů
- Testy memorování: testujte, zda je model schopen citovat tréninkový text; zaveďte antiplagiátorské filtry a filtry proti úniku dat.
- Atribuce: u faktických výstupů upřednostňujte uvádění zdrojových odkazů či citací.
- Bezpečnostní rozhraní: omezení objemu a rychlosti požadavků i zásady pro generovaný obsah.
shrnutí
Zásady TDM pro AI/LLM tvoří soubor právních, technických a etických pravidel, která umožňují vytěžovat data v souladu s právy autorů, ochranou soukromí a kvalitou ekosystému. Klíčem je kombinace vynucování zásad (robots/meta/headers), licenční due diligence, hygieny datasetů, ochrany PII a auditovatelnosti. Důslednou implementací získáte robustní a udržitelný základ pro trénink a nasazování moderních modelů, který obstojí po právní i reputační stránce.
