Rámec metod analýzy dat
Analýza dat zahrnuje postupy od popisné (descriptive) přes diagnostickou (diagnostic) a prediktivní (predictive) až po preskriptivní (prescriptive) analytiku. Každá úroveň odpovídá na jinou otázku: co se stalo, proč se to stalo, co se stane a co máme udělat. Metodický postup obvykle zahrnuje přípravu dat, explorativní analýzu (EDA), modelování, validaci a interpretaci s ohledem na nejistotu, rizika a etiku.
Správa a příprava dat: kvalita je klíčová
- Čištění: odstranění duplicit, oprava typografických chyb, sjednocení kódů a jednotek.
- Ošetření chybějících hodnot: listwise deletion, imputace (medián, MICE, KNN), indikátory chybějících hodnot.
- Normalizace a škálování: standardizace (z-score), min-max škálování, robustní škálování pro metody citlivé na rozsah.
- Tvorba příznaků: doménové transformace (log, Box-Cox), interakce, polynomy, časová zpoždění a agregace.
- Datové typy: numerické vs. kategoriální (one-hot, target encoding), text (tokenizace, vektorizace), grafová data (adjacency, embeddings).
- Správa dat: původ dat (provenience), verzování datových sad, katalog a přístupová práva; měření kvality (úplnost, aktuálnost, validita).
Explorativní analýza (EDA): porozumění před modelováním
- Distribuce: histogramy, KDE, kvantilové grafy, odhady momentů (průměr, medián, šikmost, špičatost).
- Vztahy: korelace (Pearson/Spearman/Kendall), párové grafy, teplotní mapy, partial dependence již v rané fázi.
- Atypické hodnoty: krabicové grafy, IQR, robustní metriky (MCD), detekce odlehlých hodnot (Isolation Forest) jako vodítko.
- Dimenzionalita: PCA, t-SNE/UMAP pro vizualizaci struktur a klastrů.
- Posun dat: porovnání trénovacích a produkčních dat (PSI, KL divergence), sezónnost a strukturální zlomy.
Popisná analytika: co se stalo
- Agregace: součty, průměry, procenta, kontingenční tabulky, seskupení podle klíčových dimenzí.
- Časové řady: klouzavé průměry, sezónní indexy, dekompozice (trend, sezónnost, rezidua).
- Vizualizace: sloupcové a čárové grafy, treemapy, vodopádové grafy, Sankeyovy diagramy pro zobrazení toků.
- Distribuční pohled: decily/kvartily, Lorenzova křivka a Giniho koeficient (nerovnoměrnost).
Diagnostická analytika: proč se to stalo
- Asociační analýza: kontingenční tabulky, chí-kvadrát testy, Cramérův V, lift/conviction u asociačních pravidel.
- Regrese s vysvětlením: lineární/logistická regrese, GLM (Poisson, Gamma), LASSO/Ridge/Elastic Net; koeficienty a jejich intervaly spolehlivosti.
- Kauzální inference: metoda rozdílu v rozdílech (DiD), párování/vážení podle propensity score, instrumentální proměnné, RCT/AB testy.
- Shapleyho hodnoty a rozklad variance: ANOVA, Shapley values pro vysvětlení nezávislé na modelu.
- Segmentace příčin: rozhodovací stromy, CHAID; root cause analysis pomocí protokolů událostí (dolování procesů).
Prediktivní analytika: co se stane
- Tabulková data: gradient boosting (XGBoost, LightGBM, CatBoost), náhodné lesy, neuronové sítě (MLP).
- Časové řady: ARIMA/SARIMA, ETS, Prophet, TBATS, globální modely (RNN/LSTM/Temporal Fusion Transformer), křížová validace v čase (rolling origin).
- Text: klasifikace a NER s vektory (TF-IDF) i kontextovými embeddingy (transformery); metriky F1/ROC-AUC/PR-AUC.
- Obraz a zvuk: CNN/ViT, spektrogramy + CNN/CRNN; augmentace a transfer learning.
- Pravděpodobnostní predikce: kvantilové modely, pinball loss, predikční intervaly, bagging/bootstrapping pro vyjádření nejistoty.
Preskriptivní analytika: co máme udělat
- Optimalizace: lineární/smíšené celočíselné programování (LP/MIP), heuristiky (SA, GA), kombinatorické úlohy (VRP, knapsack).
- Posilované učení: řízení politik, multi-armed bandit, kontextové bandity pro personalizaci.
- Simulace: scénáře „co kdyby“, Monte Carlo pro kvantifikaci rizik, diskrétní simulace procesů.
Metodiky ověřování: aby modely nelhaly
- Rozdělení dat: trénovací/validační/testovací data, vnořená křížová validace pro výběr hyperparametrů.
- Únik informací: striktní časové oddělení, odstranění zástupných proměnných cílové hodnoty, kontrola příznaků vytvořených agregací.
- Kalibrace: Plattova/izotonická kalibrace, Brierovo skóre pro pravděpodobnostní predikce.
- Stabilita: testování posunu dat, výkonnost v podskupinách (analýza podskupin), odolnost vůči šumu.
Metriky výkonu: různé cíle, různé míry
- Regrese: MAE, RMSE, MAPE (pozor na nulové hodnoty), R² a upravené R², pinball loss pro kvantily.
- Klasifikace: accuracy vs. F1, ROC-AUC vs. PR-AUC (u nevyvážených tříd), log-loss, specificita/senzitivita.
- Časové řady: sMAPE, MASE, WAPE; vyhodnocení podle predikčních horizontů a sezón.
- Byznysové metriky: zisk/CLV, náklady na chyby I. a II. druhu, metriky uplift u kauzálních modelů.
Časové řady: zvláštní pozornost
- Stacionarita: testy ADF/KPSS, diferenciace, Box-Coxova transformace, sezónní diferenciace.
- Sezónnost a svátky: Fourierovy členy, indikátorové proměnné, kalendářní efekty.
- Hierarchie: postup zdola nahoru, shora dolů, optimal reconciliation (MinT) pro konzistenci napříč úrovněmi.
Klastry a redukce dimenzionality
- Učení bez učitele: k-means, k-medoids, DBSCAN/HDBSCAN; validace pomocí siluetového skóre a Daviesova-Bouldinova indexu.
- Redukce: PCA (lineární), NMF (aditivní témata), autoenkodéry (nelineární), UMAP/t-SNE (vizualizace).
Kauzální analýza a experimenty
- Randomizované experimenty: testy AB/n-arm, stratifikace, sekvenční analýza (alpha spending), CUPED pro snížení variance.
- Observační studie: kritérium back-door, DAGy pro identifikaci, dvojitě robustní odhady (AIPW), synthetic control.
Interpretovatelnost a vysvětlitelnost
- Globální pohled: důležitost příznaků (permutace), PDP/ICE, ALE grafy.
- Lokální pohled: LIME, SHAP, kontrafaktuální příklady; audit prediktivních pravidel.
- Stabilita vysvětlení: testování konzistence napříč opakovaným vzorkováním a verzemi modelu.
Etika, spravedlnost a ochrana soukromí
- Zkreslení a férovost: equalized odds, demographic parity, disparate impact; zmírňování zkreslení před zpracováním, během něj i po něm.
- Soukromí: minimalizace dat, pseudonymizace, diferenciální ochrana soukromí, federované učení.
- Soulad s předpisy: auditovatelnost, vysledovatelnost rozhodnutí, model cards a datasheets for datasets.
Produkční nasazení: MLOps a DataOps
- Datové pipeline: deklarativní DAG (Airflow, Dagster), verzování dat/modelů (DVC/MLflow), feature store.
- Monitorování: kvalita dat, posun dat, concept drift, metriky latence a chyb, SLA/SLO.
- Řízení verzí a nasazení: canary/blue-green, stínové nasazení, návrat k předchozí verzi, pravidelné přeučování.
Škálování a výpočetní výkon
- Distribuované zpracování: Spark/Flink/Dask pro ETL a datové toky; map-reduce vs. grafy založené na DAG.
- Akcelerace: GPU/NPU u hlubokých sítí, vektorové instrukce (SIMD) a kvantizace při inferenci.
- On-premise vs. cloud: citlivost dat, náklady, elasticita; hybridní orchestrace a architektury lakehouse.
Typické chyby a jejich prevence
- Přeučení (overfitting) v důsledku nedostatečné validace – řešení: regularizace, křížová validace, jednodušší model.
- Únik informací z dat – přísné oddělení datových sad, časová validace, audit příznaků.
- Nesoulad metrik s cíli – definice byznysových KPI a nákladů na chyby, ladění prahu.
- Ignorování nejistoty – intervaly, bootstrap, predikční rozptyl, scénáře.
- Opomíjení kauzality u intervencí – používat experimenty nebo kauzální metody, nejen korelace.
Výběr metod podle otázky a dat
- Popis a monitoring: dashboardy, KPI, statistické řízení procesů (SPC, CUSUM, EWMA).
- Diagnostika: GLM, vysvětlitelné stromy, kauzální grafy a párování.
- Predikce: boosting, neuronové sítě, specializované modely časových řad.
- Preskripce: optimalizace, posilované učení, simulace metodou Monte Carlo.
Kontrolní seznam analytického projektu
- Definujte otázku a hypotézy, rozhodněte o úrovni analytiky (popisná/diagnostická/prediktivní/preskriptivní).
- Zajistěte správu dat, kvalitu a přístup; připravte datový slovník.
- Proveďte EDA, odhalte odlehlé hodnoty, vztahy a posun dat.
- Zvolte modely a metriky v souladu s cíli a náklady na chyby.
- Nastavte validaci a kalibraci s ohledem na čas a únik informací z dat.
- Zajistěte interpretovatelnost, férovost a dokumentaci.
- Navrhněte nasazení a monitoring (MLOps), plán přeučování a správy verzí.
- Vyhodnoťte nejistotu a připravte scénáře pro rozhodování.
Závěr: propojení metod v hodnototvorném řetězci
Úspěšná analytika začíná kvalitními daty a jasně formulovanou otázkou, pokračuje disciplinovanou EDA a vhodnou kombinací popisných, diagnostických a prediktivních metod a končí preskriptivním doporučením. Zásadní je měření nejistoty, spravedlnost modelů a disciplína při produkčním nasazení. Propojení těchto kroků umožňuje přeměnit data v robustní rozhodnutí s prokazatelným dopadem.
