Metody analýzy dat: od popisné po prediktivní analytiku

Metody analýzy dat: Od popisné (deskriptivní) po prediktivní

Rámec metod analýzy dat

Analýza dat zahrnuje postupy od popisné (descriptive) přes diagnostickou (diagnostic) a prediktivní (predictive) až po preskriptivní (prescriptive) analytiku. Každá úroveň odpovídá na jinou otázku: co se stalo, proč se to stalo, co se stane a co máme udělat. Metodický postup obvykle zahrnuje přípravu dat, explorativní analýzu (EDA), modelování, validaci a interpretaci s ohledem na nejistotu, rizika a etiku.

Správa a příprava dat: kvalita je klíčová

  • Čištění: odstranění duplicit, oprava typografických chyb, sjednocení kódů a jednotek.
  • Ošetření chybějících hodnot: listwise deletion, imputace (medián, MICE, KNN), indikátory chybějících hodnot.
  • Normalizace a škálování: standardizace (z-score), min-max škálování, robustní škálování pro metody citlivé na rozsah.
  • Tvorba příznaků: doménové transformace (log, Box-Cox), interakce, polynomy, časová zpoždění a agregace.
  • Datové typy: numerické vs. kategoriální (one-hot, target encoding), text (tokenizace, vektorizace), grafová data (adjacency, embeddings).
  • Správa dat: původ dat (provenience), verzování datových sad, katalog a přístupová práva; měření kvality (úplnost, aktuálnost, validita).

Explorativní analýza (EDA): porozumění před modelováním

  • Distribuce: histogramy, KDE, kvantilové grafy, odhady momentů (průměr, medián, šikmost, špičatost).
  • Vztahy: korelace (Pearson/Spearman/Kendall), párové grafy, teplotní mapy, partial dependence již v rané fázi.
  • Atypické hodnoty: krabicové grafy, IQR, robustní metriky (MCD), detekce odlehlých hodnot (Isolation Forest) jako vodítko.
  • Dimenzionalita: PCA, t-SNE/UMAP pro vizualizaci struktur a klastrů.
  • Posun dat: porovnání trénovacích a produkčních dat (PSI, KL divergence), sezónnost a strukturální zlomy.

Popisná analytika: co se stalo

  • Agregace: součty, průměry, procenta, kontingenční tabulky, seskupení podle klíčových dimenzí.
  • Časové řady: klouzavé průměry, sezónní indexy, dekompozice (trend, sezónnost, rezidua).
  • Vizualizace: sloupcové a čárové grafy, treemapy, vodopádové grafy, Sankeyovy diagramy pro zobrazení toků.
  • Distribuční pohled: decily/kvartily, Lorenzova křivka a Giniho koeficient (nerovnoměrnost).

Diagnostická analytika: proč se to stalo

  • Asociační analýza: kontingenční tabulky, chí-kvadrát testy, Cramérův V, lift/conviction u asociačních pravidel.
  • Regrese s vysvětlením: lineární/logistická regrese, GLM (Poisson, Gamma), LASSO/Ridge/Elastic Net; koeficienty a jejich intervaly spolehlivosti.
  • Kauzální inference: metoda rozdílu v rozdílech (DiD), párování/vážení podle propensity score, instrumentální proměnné, RCT/AB testy.
  • Shapleyho hodnoty a rozklad variance: ANOVA, Shapley values pro vysvětlení nezávislé na modelu.
  • Segmentace příčin: rozhodovací stromy, CHAID; root cause analysis pomocí protokolů událostí (dolování procesů).

Prediktivní analytika: co se stane

  • Tabulková data: gradient boosting (XGBoost, LightGBM, CatBoost), náhodné lesy, neuronové sítě (MLP).
  • Časové řady: ARIMA/SARIMA, ETS, Prophet, TBATS, globální modely (RNN/LSTM/Temporal Fusion Transformer), křížová validace v čase (rolling origin).
  • Text: klasifikace a NER s vektory (TF-IDF) i kontextovými embeddingy (transformery); metriky F1/ROC-AUC/PR-AUC.
  • Obraz a zvuk: CNN/ViT, spektrogramy + CNN/CRNN; augmentace a transfer learning.
  • Pravděpodobnostní predikce: kvantilové modely, pinball loss, predikční intervaly, bagging/bootstrapping pro vyjádření nejistoty.

Preskriptivní analytika: co máme udělat

  • Optimalizace: lineární/smíšené celočíselné programování (LP/MIP), heuristiky (SA, GA), kombinatorické úlohy (VRP, knapsack).
  • Posilované učení: řízení politik, multi-armed bandit, kontextové bandity pro personalizaci.
  • Simulace: scénáře „co kdyby“, Monte Carlo pro kvantifikaci rizik, diskrétní simulace procesů.

Metodiky ověřování: aby modely nelhaly

  • Rozdělení dat: trénovací/validační/testovací data, vnořená křížová validace pro výběr hyperparametrů.
  • Únik informací: striktní časové oddělení, odstranění zástupných proměnných cílové hodnoty, kontrola příznaků vytvořených agregací.
  • Kalibrace: Plattova/izotonická kalibrace, Brierovo skóre pro pravděpodobnostní predikce.
  • Stabilita: testování posunu dat, výkonnost v podskupinách (analýza podskupin), odolnost vůči šumu.

Metriky výkonu: různé cíle, různé míry

  • Regrese: MAE, RMSE, MAPE (pozor na nulové hodnoty), R² a upravené R², pinball loss pro kvantily.
  • Klasifikace: accuracy vs. F1, ROC-AUC vs. PR-AUC (u nevyvážených tříd), log-loss, specificita/senzitivita.
  • Časové řady: sMAPE, MASE, WAPE; vyhodnocení podle predikčních horizontů a sezón.
  • Byznysové metriky: zisk/CLV, náklady na chyby I. a II. druhu, metriky uplift u kauzálních modelů.

Časové řady: zvláštní pozornost

  • Stacionarita: testy ADF/KPSS, diferenciace, Box-Coxova transformace, sezónní diferenciace.
  • Sezónnost a svátky: Fourierovy členy, indikátorové proměnné, kalendářní efekty.
  • Hierarchie: postup zdola nahoru, shora dolů, optimal reconciliation (MinT) pro konzistenci napříč úrovněmi.

Klastry a redukce dimenzionality

  • Učení bez učitele: k-means, k-medoids, DBSCAN/HDBSCAN; validace pomocí siluetového skóre a Daviesova-Bouldinova indexu.
  • Redukce: PCA (lineární), NMF (aditivní témata), autoenkodéry (nelineární), UMAP/t-SNE (vizualizace).

Kauzální analýza a experimenty

  • Randomizované experimenty: testy AB/n-arm, stratifikace, sekvenční analýza (alpha spending), CUPED pro snížení variance.
  • Observační studie: kritérium back-door, DAGy pro identifikaci, dvojitě robustní odhady (AIPW), synthetic control.

Interpretovatelnost a vysvětlitelnost

  • Globální pohled: důležitost příznaků (permutace), PDP/ICE, ALE grafy.
  • Lokální pohled: LIME, SHAP, kontrafaktuální příklady; audit prediktivních pravidel.
  • Stabilita vysvětlení: testování konzistence napříč opakovaným vzorkováním a verzemi modelu.

Etika, spravedlnost a ochrana soukromí

  • Zkreslení a férovost: equalized odds, demographic parity, disparate impact; zmírňování zkreslení před zpracováním, během něj i po něm.
  • Soukromí: minimalizace dat, pseudonymizace, diferenciální ochrana soukromí, federované učení.
  • Soulad s předpisy: auditovatelnost, vysledovatelnost rozhodnutí, model cards a datasheets for datasets.

Produkční nasazení: MLOps a DataOps

  • Datové pipeline: deklarativní DAG (Airflow, Dagster), verzování dat/modelů (DVC/MLflow), feature store.
  • Monitorování: kvalita dat, posun dat, concept drift, metriky latence a chyb, SLA/SLO.
  • Řízení verzí a nasazení: canary/blue-green, stínové nasazení, návrat k předchozí verzi, pravidelné přeučování.

Škálování a výpočetní výkon

  • Distribuované zpracování: Spark/Flink/Dask pro ETL a datové toky; map-reduce vs. grafy založené na DAG.
  • Akcelerace: GPU/NPU u hlubokých sítí, vektorové instrukce (SIMD) a kvantizace při inferenci.
  • On-premise vs. cloud: citlivost dat, náklady, elasticita; hybridní orchestrace a architektury lakehouse.

Typické chyby a jejich prevence

  • Přeučení (overfitting) v důsledku nedostatečné validace – řešení: regularizace, křížová validace, jednodušší model.
  • Únik informací z dat – přísné oddělení datových sad, časová validace, audit příznaků.
  • Nesoulad metrik s cíli – definice byznysových KPI a nákladů na chyby, ladění prahu.
  • Ignorování nejistoty – intervaly, bootstrap, predikční rozptyl, scénáře.
  • Opomíjení kauzality u intervencí – používat experimenty nebo kauzální metody, nejen korelace.

Výběr metod podle otázky a dat

  • Popis a monitoring: dashboardy, KPI, statistické řízení procesů (SPC, CUSUM, EWMA).
  • Diagnostika: GLM, vysvětlitelné stromy, kauzální grafy a párování.
  • Predikce: boosting, neuronové sítě, specializované modely časových řad.
  • Preskripce: optimalizace, posilované učení, simulace metodou Monte Carlo.

Kontrolní seznam analytického projektu

  1. Definujte otázku a hypotézy, rozhodněte o úrovni analytiky (popisná/diagnostická/prediktivní/preskriptivní).
  2. Zajistěte správu dat, kvalitu a přístup; připravte datový slovník.
  3. Proveďte EDA, odhalte odlehlé hodnoty, vztahy a posun dat.
  4. Zvolte modely a metriky v souladu s cíli a náklady na chyby.
  5. Nastavte validaci a kalibraci s ohledem na čas a únik informací z dat.
  6. Zajistěte interpretovatelnost, férovost a dokumentaci.
  7. Navrhněte nasazení a monitoring (MLOps), plán přeučování a správy verzí.
  8. Vyhodnoťte nejistotu a připravte scénáře pro rozhodování.

Závěr: propojení metod v hodnototvorném řetězci

Úspěšná analytika začíná kvalitními daty a jasně formulovanou otázkou, pokračuje disciplinovanou EDA a vhodnou kombinací popisných, diagnostických a prediktivních metod a končí preskriptivním doporučením. Zásadní je měření nejistoty, spravedlnost modelů a disciplína při produkčním nasazení. Propojení těchto kroků umožňuje přeměnit data v robustní rozhodnutí s prokazatelným dopadem.