Supervidované vs. nesupervidované učení: rozdíly v trénovacích datech

Supervizované vs. nesupervizované učení: Rozdíly v tréninkových datech

Dvě paradigmata učení z dat

Supervidované a nesupervidované učení představují základní přístupy strojového učení. Supervidované učení pracuje s párovanými příklady (vstup, výstup/štítek) a učí se predikovat výstupní proměnnou. Nesupervidované učení pracuje pouze s neoznačenými daty a snaží se odhalit jejich vnitřní strukturu, latentní faktory a vztahy. Obě paradigmata lze kombinovat (semi-supervidované učení, self-supervised learning, weak supervision) a často sdílejí podobné modely s odlišným cílem optimalizace.

Formální definice úloh

  • Supervidované učení: je dána množina dvojic {(x_i, y_i)}_{i=1}^n, kde x_i jsou vstupy a y_i cílové hodnoty (u klasifikace diskrétní, u regrese spojité). Cílem je nalézt funkci f: mathcal{X} to mathcal{Y}, která minimalizuje očekávanou ztrátu mathbb{E}[ell(f(x), y)].
  • Nesupervidované učení: je dána množina {x_i}_{i=1}^n bez štítků. Cílem je odhalit strukturu dat: shluky, dimenzionalitu, hustotu p(x), anomálie nebo reprezentace z = g(x), které komprimují informaci.

Typické úlohy a příklady použití

Paradigma Úloha Popis Příklad
Supervidované Klasifikace Přiřazení třídy Detekce spamu, rozpoznávání obrázků koček a psů
Supervidované Regrese Predikce spojité hodnoty Odhad ceny nemovitosti, predikce poptávky
Supervidované Řazení (ranking) Uspořádání podle relevance Vyhledávače, doporučování
Nesupervidované Shlukování Skupiny podobných vzorků Segmentace zákazníků
Nesupervidované Snížení dimenze Projekce do prostoru s menším počtem dimenzí Vizualizace, předzpracování
Nesupervidované Detekce anomálií Odchylky od „normálu“ Podvody, poruchy strojů
Nesupervidované Modelování hustoty Odhad p(x) Generativní modely, syntetická data

Algoritmy: přehled hlavních zástupců

  • Supervidované: lineární a logistická regrese, SVM, náhodné lesy a gradient boosting (XGBoost/LightGBM/CatBoost), neuronové sítě (CNN, RNN/Transformers), k-NN, Naivní Bayes.
  • Nesupervidované: k-means/k-medoids, hierarchické shlukování, DBSCAN/HDBSCAN, GMM, PCA/ICA/FA, t-SNE/UMAP (vizualizace), autoenkodéry, word2vec/kontrastivní učení (self-supervised reprezentace).

Ztrátové funkce a optimalizace

  • Supervidované: MSE/MAE (regrese), log-loss/cross-entropy (klasifikace), hinge loss (SVM), focal loss (nevyvážené třídy), pairwise/listwise loss (ranking). K optimalizaci se nejčastěji používají gradientní metody (SGD, Adam, L-BFGS), u stromů aditivní boosting.
  • Nesupervidované: kritérium setrvačnosti k-means (součet čtverců vzdáleností), silueta/DB index pro výběr k; u PCA minimalizace rekonstrukční chyby/maximalizace vysvětlené variance; u autoenkodérů rekonstrukční loss (L2, BCE) a případně regularizace (KL u VAE).

Hodnocení výkonu: metriky a validace

  • Supervidované: přesnost, precision/recall/F1, ROC-AUC/PR-AUC, RMSE/MAE/R2, log-loss; k-fold křížová validace, stratifikace, časové dělení u časových řad. Důraz se klade na generalizaci a testování na nezávislé odložené množině.
  • Nesupervidované: interní metriky (silueta, Calinski-Harabasz, Davies-Bouldin), externí metriky, jsou-li k dispozici částečné štítky (Adjusted Rand Index, Normalized Mutual Information), rekonstrukční chyba, pravděpodobnostní kritéria (BIC/AIC u GMM), metody založené na stabilitě.

Datové požadavky a náklady na anotaci

Supervidované učení vyžaduje kvalitní štítky, jejichž získání je nákladné (čas expertů, nekonzistence, zkreslení). Nesupervidované učení lze škálovat na velké objemy surových dat, ale interpretace výstupů a volba hyperparametrů jsou náročnější. V praxi se uplatňuje semi-supervidovaný přístup: využití malého množství štítků k nasměrování reprezentací naučených na neoznačených datech.

Předzpracování a inženýrství příznaků

  • Škálování a normalizace: standardizace (z-score), min-max; klíčové pro metody založené na vzdálenosti (SVM, k-means) a gradientní učení.
  • Kódování kategorií: one-hot, target encoding (pozor na únik informací, nutná CV), embeddingy.
  • Snížení dimenze: PCA/UMAP pro odstranění šumu, zvýšení rychlosti a zlepšení separability; v supervidovaném scénáři také LDA.
  • Výběr příznaků: filtrační metody (mutual information), zabudované metody (L1/L2, důležitost příznaků ze stromů), wrapperové metody (RFE).

Shlukování vs. klasifikace: koncepční rozdíly

  • Klasifikace (supervidovaná): naučené hranice mezi třídami; umožňuje pravděpodobnostní výstupy a kvantifikaci nejistoty.
  • Shlukování (nesupervidované): hledá přirozené skupiny podle podobnosti; výsledek nemusí odpovídat lidským kategoriím. Volba metriky vzdálenosti a měřítka má zásadní vliv.

Generativní vs. diskriminační pohled

Supervidované metody bývají často diskriminační (modelují p(y|x)), zatímco nesupervidované a některé generativní modely odhadují p(x) nebo společně p(x, y). Generativní přístup umožňuje syntézu dat, imputaci chybějících hodnot, detekci anomálií a aktivní učení, ale jeho trénování je náročnější (např. VAE, normální toky, difuzní modely).

Výběr modelu a hyperparametrů

  • Supervidované: grid search/random search, Bayesovská optimalizace, validace s časovým dělením u sekvencí; early stopping, regularizace (L1/L2, dropout), kalibrace pravděpodobností (Platt/Isotonic).
  • Nesupervidované: výběr k (k-means) pomocí metody lokte/siluety, epsilon/minPts (DBSCAN) podle hustoty; u PCA volba počtu komponent podle vysvětlené variance.

Interpretovatelnost a vysvětlitelnost

  • Supervidované: globální (koeficienty lineárních modelů, důležitost příznaků), lokální (LIME/SHAP, kontrafaktuální vysvětlení), spolehlivost (kalibrace).
  • Nesupervidované: popis shluků pomocí prototypů/centroidů, zatížení komponent u PCA, vizualizace (t-SNE/UMAP), rekonstrukční mapy u autoenkodérů.

Nevyvážená data, šum a anomálie

  • Supervidované: převážení ztráty, oversampling (SMOTE), undersampling, cost-sensitive učení, volba prahu podle PR-AUC.
  • Nesupervidované: robustní metriky, metody založené na hustotě (LOF), izolace pomocí stromů (iForest), autoenkodéry s vysokou rekonstrukční chybou pro odlehlé body.

Pipeline a nasazení v praxi

  1. Definice cíle: predikovat y (supervidovaně) nebo získat reprezentace/segmenty (nesupervidovaně).
  2. Správa dat: sběr, čištění, deduplikace, správa verzí dat a štítků.
  3. Feature store a sledování experimentů: opakovatelnost, audit, MLOps.
  4. Trénink a validace: správná schémata CV, metriky navázané na obchodní cíle.
  5. Nasazení: online/batch inference, monitoring driftu (datového i konceptuálního), opakovaný trénink.

Bezpečnostní a etické aspekty

  • Zkreslení a spravedlnost: u supervidovaného učení může být zkreslení „zapečetěno“ ve štítcích; nutná je auditovatelnost a používání metrik spravedlnosti.
  • Soukromí: u nesupervidovaných reprezentací pozor na možnost opětovné identifikace; zvažte DP (differential privacy) a anonymizaci.
  • Robustnost: odolnost vůči adversariálním vstupům, kontaminovaným štítkům i odlehlým hodnotám.

Srovnání výhod a omezení

Kritérium Supervidované učení Nesupervidované učení
Požadavky na data Vyžaduje štítky (nákladné) Bez štítků (snadná škálovatelnost)
Vyhodnocení Jednoznačné metriky, snadná validace Obtížnější, často nepřímé metriky
Interpretace Často lepší, zejména u jednodušších modelů Závisí na volbě metody a metrik
Obecnost výstupu Specifická predikce cíle Obecná struktura a reprezentace
Citlivost na šum Citlivé na chybné štítky Citlivé na škálování a metriky podobnosti
Nasaditelnost Přímočará pro obchodní cíle Užitečné pro průzkum a předzpracování

Překlenutí mezery: semi-supervidované a self-supervised učení

  • Semi-supervidované učení: kombinuje malé množství štítků s rozsáhlým neoznačeným korpusem (pseudo-labeling, regularizace konzistence, šíření štítků založené na grafech).
  • Self-supervised učení: vytváří úlohy typu pretext ze samotných dat (maskování částí vstupu, kontrastivní učení). Naučené reprezentace se následně doladí pomocí malého množství štítků.

Praktická doporučení pro volbu přístupu

  1. Pokud máte kvalitní štítky a jasný KPI, upřednostněte supervidované učení s robustní validací.
  2. Při průzkumu neznámé domény, segmentaci, detekci anomálií nebo předzpracování zvažte nesupervidované metody.
  3. Pokud jsou štítky vzácné, využijte semi-supervised/self-supervised předtrénování a poté dolaďte model pomocí malého množství označených dat.
  4. Nezapomeňte na MLOps: verzování dat a modelů, monitoring driftu, politiky opakovaného trénování.

Časté chyby a jak se jim vyhnout

  1. Únik informací (leakage): míchání trénovacích a validačních dat, použití target encodingu bez správné CV.
  2. Přeučení (overfitting): nedostatečná regularizace, absence early stopping, příliš složitý model vzhledem k velikosti dat.
  3. Nesprávná metrika: optimalizace accuracy u nevyvážených tříd; volte PR-AUC, F1 nebo nákladově citlivé ztrátové funkce.
  4. Nesprávná volba vzdálenosti: shlukování bez škálování příznaků; zvažte kosinovou/metriku Mahalanobisovy vzdálenosti.
  5. Přehnané spoléhání na vizualizace: t-SNE/UMAP slouží k vizualizaci, nikoli k metrickému hodnocení separability.

Závěr

Supervidované učení vyniká tam, kde známe cíle a máme štítky; nesupervidované učení je klíčové pro objevování struktury, snížení dimenze, detekci anomálií a učení reprezentací. V moderní praxi se hranice stírá díky semi-supervidovaným a self-supervised metodám, které využívají velké objemy neoznačených dat a malé množství štítků. Klíčem k úspěchu je správná formulace úlohy, volba metrik, pečlivá validace a provozní disciplína (MLOps), které zajistí, že modely budou nejen přesné, ale také odolné, spravedlivé a udržitelné.