Proč cloudová řešení pro Big Data
Cloud poskytuje elastickou výpočetní i úložnou kapacitu, která se škáluje podle potřeby a je účtována podle skutečné spotřeby. Pro infrastrukturu Big Data to znamená možnost zpracovávat enormní objemy dat bez předimenzovaných investic, zkrátit dobu uvedení řešení do provozu a sjednotit nástroje pro ingest, zpracování, analytiku, strojové učení i správu dat. Klíčovými principy jsou oddělení architektury úložiště a výpočetního výkonu, automatizace, observabilita, správa nákladů a správa dat.
Referenční architektura: datové jezero a lakehouse
Dominantním vzorem je datové jezero v objektovém úložišti doplněné o vrstvu lakehouse (otevřené tabulkové formáty, transakce, ACID), která umožňuje odstranit slabiny klasických jezer (kvalita schémat, transakční konzistence, time travel).
- Datové jezero (S3/GCS/ABFS): surová a kurátorovaná data ve formátech Parquet/ORC/Avro.
- Lakehouse: Delta Lake, Apache Iceberg nebo Apache Hudi přidávají transakční log, snapshoty, klonování a efektivní aktualizace/slučování.
- Metastore/katalog: Hive Metastore, Glue Data Catalog nebo jednotný katalog (např. Unity Catalog) pro schémata, přístupová práva a lineage.
- Dotazovací/výpočetní vrstva: Spark, Trino/Presto, bezserverové SQL enginy a služby datových skladů.
Úložiště: objektové, souborové a tabulkové vrstvy
- Objektová úložiště: vysoká trvanlivost, nízké náklady, škálovatelné I/O; třídy (standardní, málo používaná data, archivní) pro vrstvení úložiště.
- Souborové vrstvy/POSIX: distribuované FS pro specifické úlohy (aplikace závislé na POSIX, dočasné mezipaměti pro ETL).
- Tabulkové formáty: Parquet/ORC pro sloupcovou kompresi; otevřené tabulky (Delta/Iceberg/Hudi) pro ACID a evoluci schématu.
- Optimalizace uspořádání: partitioning, clustering (Z-Order/Hash), slučování malých souborů a správa metadat.
Ingest a streaming: od dávkového zpracování po real-time
- Dávkový ingest: dávkové načítání pomocí ETL/ELT (Spark, bezserverové kopírování, CDC z databází).
- Streaming: Kafka/Pulsar, cloudové služby pub/sub, zpracování streamů (Flink, Spark Structured Streaming) s přesnými zárukami doručení.
- CDC (Change Data Capture): Debezium, ingest z OLTP založený na logu do datového jezera/skladu s nízkou latencí.
- IoT na okraji sítě: brány s lokální agregací, ukládáním do vyrovnávací paměti a bezpečným přenosem do cloudu.
Zpracování dat: Spark, SQL enginy a bezserverové služby
- Distribuované výpočty: Apache Spark pro ETL, ML a SQL; provoz na spravovaných službách či Kubernetes s automatickým škálováním.
- Interaktivní/ad hoc SQL: Trino/Presto pro federované dotazy nad datovým jezerem; bezserverové SQL (např. dotazy přímo nad objekty).
- Datové sklady: elastické sklady (sloupcové úložiště, oddělení výpočetního výkonu od úložiště, automatické horizontální škálování, materializované pohledy).
- Orchestrace: Airflow/Cloud Composer/MWAA, případně deklarativní DAGy a událostmi řízené pipeline (Functions/Lambda + orchestrace Step).
Lakehouse versus datový sklad: komplementarita
Lakehouse sjednocuje polostrukturovaná/nestrukturovaná data a pokročilé transformace, zatímco datový sklad exceluje v konzistentních modelech BI a stabilních SLA pro reporting. V praxi se využívá bronze–silver–gold (medailonová architektura) v datovém jezeře, přičemž vrstvu gold lze zpřístupňovat buď prostřednictvím otevřených tabulek (SQL engine), nebo ji nahrávat do datového skladu pro kritické dashboardy.
Modelování a řízení kvality: schéma, DQ a lineage
- Vývoj schématu: řízené schema-on-read/write, kompatibilita typů a validace při zápisu.
- Kvalita dat: pravidla úplnosti, jedinečnosti, referenční integrity a obchodních validací (Great Expectations/Deequ) s automatickými metrikami.
- Lineage: sběr datových toků (OpenLineage) pro auditovatelnost, analýzy dopadů a řízení změn.
Bezpečnost a správa dat: IAM, šifrování a řízení přístupu
- IAM: princip nejmenších oprávnění, identita úloh, krátkodobé tokeny; oddělení rolí (vlastník dat, správce dat, analytik).
- Šifrování: v klidovém stavu (správa klíčů KMS/HSM), při přenosu (TLS), šifrování na straně klienta pro citlivé datasety.
- Zabezpečení na úrovni řádků/sloupců a maskování: dynamická anonymizace, označování citlivých polí, přístup podle atributů (ABAC).
- Datový katalog: centrální inventář, klasifikace, zásady uchovávání a právní blokace mazání; pracovní postupy pro schvalování přístupu.
Síťová infrastruktura a izolace: VPC, privátní přístupy a multitenance
- Privátní propojení: peering/privátní linky mezi výpočetními prostředky a úložištěm, eliminace úniku dat přes internet.
- Segmentace: izolace prostředí (prod/test/dev), oddělené účty/projekty a síťové zásady.
- Datové brány: řízené odchozí přenosy, inspekce DLP a řadiče odchozích přenosů pro citlivé oblasti.
Kontrakty a SDLC pro data (DataOps)
- Datové kontrakty: explicitní SLA/SLO pro schémata a latenci, verzování a automatizované testy pipeline.
- CI/CD: infrastruktura jako kód (Terraform), pipeline jako kód, postupné nasazování transformací, návrat k předchozím verzím tabulek (time travel).
- Observabilita: metriky aktuálnosti, objemů, nákladů a chybovosti; upozornění a provozní postupy.
Výpočty na Kubernetes: operátory Spark/Flink a konektory úložišť
- Spark na K8s: dávkové úlohy v podech i interaktivní úlohy; dynamické přidělování a izolace týmů pomocí jmenných prostorů.
- Stavové streamy: operátor Flink s checkpointováním do objektového úložiště.
- Konektory: nativní klienti S3/GCS/ABFS, vrstvy mezipaměti (Alluxio) pro nižší latenci.
ML/AI nad Big Data: feature store a MLOps
- Feature store: sdílení příznaků mezi týmy, synchronizace offline/online, zpětné doplnění dat a kontrola verzí.
- Trénování a inference: škálovatelné clustery, bezserverové trénování, distribuované frameworky (Horovod/DeepSpeed) s přístupem k datovému jezeru.
- MLOps: sledování experimentů, registr modelů, CI/CD modelů, postupné a stínové nasazení; správa modelů (zkreslení, drift, audit).
Nákladovost a FinOps: řízení TCO
- Správné dimenzování: automatické škálování clusterů, uzly spot/preemptible pro dávkové úlohy, plánování v časových oknech s nízkými cenami.
- Optimalizace I/O: komprese (ZSTD/Snappy), vhodné velikosti souborů (128–1024 MB), pruning/predicate pushdown.
- Životní cyklus dat: přesun do chladných tříd úložiště, archivace, zásady expirace, deduplikace a slučování.
- Showback/chargeback: označování nákladů, rozúčtování podle týmů/datasetů/pipeline.
Spolehlivost, DR a multiregionální provoz
- RPO/RTO: verze objektů, replikace mezi regiony, snapshoty tabulek (Delta/Iceberg), katalog v režimu vysoké dostupnosti.
- Failover: aktivní–pasivní datový sklad/výpočetní infrastruktura, DNS a konfigurační přepínače, testy obnovy (chaos engineering pro data).
- Audit a soulad: neměnné logy (WORM), object lock, kryptografické důkazy integrity.
Soukromí a regulace: GDPR a datová rezidence
- Minimalizace dat, pseudonymizace, tokenizace a selektivní šifrování citlivých polí.
- Rezidence: regionální umístění dat, geografické omezení přístupů, kontroly exportu.
- Evidence zpracování: katalog s právním titulem, harmonogramy uchovávání a automatizované mazání.
Provozní vzory: Lambda, Kappa a Medallion
- Lambda: paralelní dávková a streamovací cesta – vyšší složitost, ale větší flexibilita.
- Kappa: jednotný stream jako zdroj pravdy s opětovným zpracováním z logu; jednodušší údržba.
- Medallion: Bronze (surová data), Silver (čištění/standardizace), Gold (datamarty pro byznys, publikace).
Standardy interoperability a sdílení dat
- Otevřené formáty: Parquet/ORC/Avro + Arrow pro vektorové přenosy.
- Otevřené tabulky: Delta/Iceberg/Hudi pro ACID, klonování a time travel.
- Sdílení dat: sdílení bez kopírování mezi účty/regiony (otevřené protokoly typu Delta Sharing, bezpečné odkazy/katalogy).
Kontrolní seznam pro návrh platformy Big Data v cloudu
- Volba otevřeného tabulkového formátu a centralizovaného katalogu a správy dat.
- Architektura ingestu (batch/stream) s CDC a jasnými SLA.
- Výpočetní vrstva pro ETL/ELT, interaktivní SQL a ML; orchestrátor s CI/CD.
- Infrastruktura jako kód, sledování kvality a lineage, observabilita a reakce na incidenty.
- Bezpečnost: IAM, šifrování, RLS/CLS, privátní síťová infrastruktura, DLP.
- FinOps: vrstvení úložiště, optimalizace I/O, spot/preemptible, chargeback.
- DR/HA: verze, replikace, ověřené RPO/RTO, plány pro více regionů.
Závěr: škálovatelná, otevřená a řízená platforma
Cloudová infrastruktura Big Data je úspěšná, pokud kombinuje otevřené formáty a principy lakehouse s automatizovaným provozem, důslednou správou dat a řízením nákladů. Tato kombinace umožňuje bezpečně a efektivně poskytovat analytiku, reporting i AI nad daty v petabajtovém měřítku, rychle reagovat na změny a vyhnout se uzamčení do proprietárních slepých uliček.
