Dvě paradigmata učení z dat
Supervidované a nesupervidované učení představují základní přístupy strojového učení. Supervidované učení pracuje s párovanými příklady (vstup, výstup/štítek) a učí se predikovat výstupní proměnnou. Nesupervidované učení pracuje pouze s neoznačenými daty a snaží se odhalit jejich vnitřní strukturu, latentní faktory a vztahy. Obě paradigmata lze kombinovat (semi-supervidované učení, self-supervised learning, weak supervision) a často sdílejí podobné modely s odlišným cílem optimalizace.
Formální definice úloh
- Supervidované učení: je dána množina dvojic {(x_i, y_i)}_{i=1}^n, kde x_i jsou vstupy a y_i cílové hodnoty (u klasifikace diskrétní, u regrese spojité). Cílem je nalézt funkci f: mathcal{X} to mathcal{Y}, která minimalizuje očekávanou ztrátu mathbb{E}[ell(f(x), y)].
- Nesupervidované učení: je dána množina {x_i}_{i=1}^n bez štítků. Cílem je odhalit strukturu dat: shluky, dimenzionalitu, hustotu p(x), anomálie nebo reprezentace z = g(x), které komprimují informaci.
Typické úlohy a příklady použití
| Paradigma | Úloha | Popis | Příklad |
|---|---|---|---|
| Supervidované | Klasifikace | Přiřazení třídy | Detekce spamu, rozpoznávání obrázků koček a psů |
| Supervidované | Regrese | Predikce spojité hodnoty | Odhad ceny nemovitosti, predikce poptávky |
| Supervidované | Řazení (ranking) | Uspořádání podle relevance | Vyhledávače, doporučování |
| Nesupervidované | Shlukování | Skupiny podobných vzorků | Segmentace zákazníků |
| Nesupervidované | Snížení dimenze | Projekce do prostoru s menším počtem dimenzí | Vizualizace, předzpracování |
| Nesupervidované | Detekce anomálií | Odchylky od „normálu“ | Podvody, poruchy strojů |
| Nesupervidované | Modelování hustoty | Odhad p(x) | Generativní modely, syntetická data |
Algoritmy: přehled hlavních zástupců
- Supervidované: lineární a logistická regrese, SVM, náhodné lesy a gradient boosting (XGBoost/LightGBM/CatBoost), neuronové sítě (CNN, RNN/Transformers), k-NN, Naivní Bayes.
- Nesupervidované: k-means/k-medoids, hierarchické shlukování, DBSCAN/HDBSCAN, GMM, PCA/ICA/FA, t-SNE/UMAP (vizualizace), autoenkodéry, word2vec/kontrastivní učení (self-supervised reprezentace).
Ztrátové funkce a optimalizace
- Supervidované: MSE/MAE (regrese), log-loss/cross-entropy (klasifikace), hinge loss (SVM), focal loss (nevyvážené třídy), pairwise/listwise loss (ranking). K optimalizaci se nejčastěji používají gradientní metody (SGD, Adam, L-BFGS), u stromů aditivní boosting.
- Nesupervidované: kritérium setrvačnosti k-means (součet čtverců vzdáleností), silueta/DB index pro výběr k; u PCA minimalizace rekonstrukční chyby/maximalizace vysvětlené variance; u autoenkodérů rekonstrukční loss (L2, BCE) a případně regularizace (KL u VAE).
Hodnocení výkonu: metriky a validace
- Supervidované: přesnost, precision/recall/F1, ROC-AUC/PR-AUC, RMSE/MAE/R2, log-loss; k-fold křížová validace, stratifikace, časové dělení u časových řad. Důraz se klade na generalizaci a testování na nezávislé odložené množině.
- Nesupervidované: interní metriky (silueta, Calinski-Harabasz, Davies-Bouldin), externí metriky, jsou-li k dispozici částečné štítky (Adjusted Rand Index, Normalized Mutual Information), rekonstrukční chyba, pravděpodobnostní kritéria (BIC/AIC u GMM), metody založené na stabilitě.
Datové požadavky a náklady na anotaci
Supervidované učení vyžaduje kvalitní štítky, jejichž získání je nákladné (čas expertů, nekonzistence, zkreslení). Nesupervidované učení lze škálovat na velké objemy surových dat, ale interpretace výstupů a volba hyperparametrů jsou náročnější. V praxi se uplatňuje semi-supervidovaný přístup: využití malého množství štítků k nasměrování reprezentací naučených na neoznačených datech.
Předzpracování a inženýrství příznaků
- Škálování a normalizace: standardizace (z-score), min-max; klíčové pro metody založené na vzdálenosti (SVM, k-means) a gradientní učení.
- Kódování kategorií: one-hot, target encoding (pozor na únik informací, nutná CV), embeddingy.
- Snížení dimenze: PCA/UMAP pro odstranění šumu, zvýšení rychlosti a zlepšení separability; v supervidovaném scénáři také LDA.
- Výběr příznaků: filtrační metody (mutual information), zabudované metody (L1/L2, důležitost příznaků ze stromů), wrapperové metody (RFE).
Shlukování vs. klasifikace: koncepční rozdíly
- Klasifikace (supervidovaná): naučené hranice mezi třídami; umožňuje pravděpodobnostní výstupy a kvantifikaci nejistoty.
- Shlukování (nesupervidované): hledá přirozené skupiny podle podobnosti; výsledek nemusí odpovídat lidským kategoriím. Volba metriky vzdálenosti a měřítka má zásadní vliv.
Generativní vs. diskriminační pohled
Supervidované metody bývají často diskriminační (modelují p(y|x)), zatímco nesupervidované a některé generativní modely odhadují p(x) nebo společně p(x, y). Generativní přístup umožňuje syntézu dat, imputaci chybějících hodnot, detekci anomálií a aktivní učení, ale jeho trénování je náročnější (např. VAE, normální toky, difuzní modely).
Výběr modelu a hyperparametrů
- Supervidované: grid search/random search, Bayesovská optimalizace, validace s časovým dělením u sekvencí; early stopping, regularizace (L1/L2, dropout), kalibrace pravděpodobností (Platt/Isotonic).
- Nesupervidované: výběr k (k-means) pomocí metody lokte/siluety, epsilon/minPts (DBSCAN) podle hustoty; u PCA volba počtu komponent podle vysvětlené variance.
Interpretovatelnost a vysvětlitelnost
- Supervidované: globální (koeficienty lineárních modelů, důležitost příznaků), lokální (LIME/SHAP, kontrafaktuální vysvětlení), spolehlivost (kalibrace).
- Nesupervidované: popis shluků pomocí prototypů/centroidů, zatížení komponent u PCA, vizualizace (t-SNE/UMAP), rekonstrukční mapy u autoenkodérů.
Nevyvážená data, šum a anomálie
- Supervidované: převážení ztráty, oversampling (SMOTE), undersampling, cost-sensitive učení, volba prahu podle PR-AUC.
- Nesupervidované: robustní metriky, metody založené na hustotě (LOF), izolace pomocí stromů (iForest), autoenkodéry s vysokou rekonstrukční chybou pro odlehlé body.
Pipeline a nasazení v praxi
- Definice cíle: predikovat y (supervidovaně) nebo získat reprezentace/segmenty (nesupervidovaně).
- Správa dat: sběr, čištění, deduplikace, správa verzí dat a štítků.
- Feature store a sledování experimentů: opakovatelnost, audit, MLOps.
- Trénink a validace: správná schémata CV, metriky navázané na obchodní cíle.
- Nasazení: online/batch inference, monitoring driftu (datového i konceptuálního), opakovaný trénink.
Bezpečnostní a etické aspekty
- Zkreslení a spravedlnost: u supervidovaného učení může být zkreslení „zapečetěno“ ve štítcích; nutná je auditovatelnost a používání metrik spravedlnosti.
- Soukromí: u nesupervidovaných reprezentací pozor na možnost opětovné identifikace; zvažte DP (differential privacy) a anonymizaci.
- Robustnost: odolnost vůči adversariálním vstupům, kontaminovaným štítkům i odlehlým hodnotám.
Srovnání výhod a omezení
| Kritérium | Supervidované učení | Nesupervidované učení |
|---|---|---|
| Požadavky na data | Vyžaduje štítky (nákladné) | Bez štítků (snadná škálovatelnost) |
| Vyhodnocení | Jednoznačné metriky, snadná validace | Obtížnější, často nepřímé metriky |
| Interpretace | Často lepší, zejména u jednodušších modelů | Závisí na volbě metody a metrik |
| Obecnost výstupu | Specifická predikce cíle | Obecná struktura a reprezentace |
| Citlivost na šum | Citlivé na chybné štítky | Citlivé na škálování a metriky podobnosti |
| Nasaditelnost | Přímočará pro obchodní cíle | Užitečné pro průzkum a předzpracování |
Překlenutí mezery: semi-supervidované a self-supervised učení
- Semi-supervidované učení: kombinuje malé množství štítků s rozsáhlým neoznačeným korpusem (pseudo-labeling, regularizace konzistence, šíření štítků založené na grafech).
- Self-supervised učení: vytváří úlohy typu pretext ze samotných dat (maskování částí vstupu, kontrastivní učení). Naučené reprezentace se následně doladí pomocí malého množství štítků.
Praktická doporučení pro volbu přístupu
- Pokud máte kvalitní štítky a jasný KPI, upřednostněte supervidované učení s robustní validací.
- Při průzkumu neznámé domény, segmentaci, detekci anomálií nebo předzpracování zvažte nesupervidované metody.
- Pokud jsou štítky vzácné, využijte semi-supervised/self-supervised předtrénování a poté dolaďte model pomocí malého množství označených dat.
- Nezapomeňte na MLOps: verzování dat a modelů, monitoring driftu, politiky opakovaného trénování.
Časté chyby a jak se jim vyhnout
- Únik informací (leakage): míchání trénovacích a validačních dat, použití target encodingu bez správné CV.
- Přeučení (overfitting): nedostatečná regularizace, absence early stopping, příliš složitý model vzhledem k velikosti dat.
- Nesprávná metrika: optimalizace accuracy u nevyvážených tříd; volte PR-AUC, F1 nebo nákladově citlivé ztrátové funkce.
- Nesprávná volba vzdálenosti: shlukování bez škálování příznaků; zvažte kosinovou/metriku Mahalanobisovy vzdálenosti.
- Přehnané spoléhání na vizualizace: t-SNE/UMAP slouží k vizualizaci, nikoli k metrickému hodnocení separability.
Závěr
Supervidované učení vyniká tam, kde známe cíle a máme štítky; nesupervidované učení je klíčové pro objevování struktury, snížení dimenze, detekci anomálií a učení reprezentací. V moderní praxi se hranice stírá díky semi-supervidovaným a self-supervised metodám, které využívají velké objemy neoznačených dat a malé množství štítků. Klíčem k úspěchu je správná formulace úlohy, volba metrik, pečlivá validace a provozní disciplína (MLOps), které zajistí, že modely budou nejen přesné, ale také odolné, spravedlivé a udržitelné.
