Cíle trénování a evaluace ve strojovém učení
Trénování modelů ve strojovém učení je proces učení parametrů (případně i struktur) z dat s cílem minimalizovat chybu či maximalizovat užitek při generalizaci na dosud neviděné vzorky. Evaluace přesnosti pak kvantifikuje kvalitu tohoto učení pomocí metrik, statistických testů a analýz chyb. Klíčovou výzvou je zabránit přeučení, zachovat reprodukovatelnost a poskytovat spolehlivé odhady výkonu i nejistoty.
Příprava dat: kvalita před kvantitou
- Čištění a imputace: odstranění či imputace chybějících hodnot (medián/modus, modelový přístup), detekce anomálií, sjednocení kategorií.
- Normalizace a škálování: standardizace (z-skóre), min–max škálování, robustní škálování; u neuronových sítí také normalizace vstupů a kategorizace.
- Tvorba příznaků: doménové transformace, logaritmická transformace/Box-Coxova transformace, polynomiální interakce, vnoření; zařazení do pipeline, aby nedošlo k úniku informací.
- Rozdělení dat: trénovací, validační a testovací sady; u časových řad rozdělení časových řad se zachováním kauzality.
Rozdělení dat a validační strategie
- Hold-out: jednoduché rozdělení (např. 70/15/15); rychlé, ale s vyšším rozptylem odhadu.
- k-násobná křížová validace: stabilnější odhady; u nevyvážených tříd použijte stratifikaci.
- Vnořená křížová validace: korektní výběr hyperparametrů bez zkreslení způsobeného příliš optimistickým odhadem (vnitřní smyčka pro ladění, vnější pro odhad).
- Časová křížová validace: postupné rozšiřování oken (rozšiřující se/posuvná), bez přenosu informací z budoucnosti do minulosti.
Trénovací cíle a ztrátové funkce
- Klasifikace: logaritmická ztráta (NLL), hinge loss, focal loss (pro nevyvážené třídy), Brierovo skóre (kalibrace pravděpodobností).
- Regrese: MSE (citlivá na odlehlé hodnoty), MAE (robustnější), Huberova ztráta, kvantilová ztráta (predikce kvantilů).
- Pořadí/řazení: párová/seznamová ztráta (LambdaRank, ListNet) při optimalizaci NDCG/MAP.
- Generativní modely/NLP/počítačové vidění: křížová entropie, Dice/IoU pro segmentaci, FID/KID pro kvalitu generovaných obrazů, BLEU/ROUGE/METEOR/BERTScore pro text.
Optimalizace a regulace modelu
- Optimalizátory: SGD s momentem, Adam/AdamW, RMSProp; plánování rychlosti učení (kosinusové, po krocích, one-cycle).
- Regularizace: L2 (úbytek vah), L1 (řídkost), předčasné zastavení, dropout, rozšiřování dat, mixup/cutmix.
- Bagging/boosting: Random Forest, Gradient Boosting (XGBoost/LightGBM/CatBoost), skládání/ansámblování.
- Kalibrace: Plattova regrese, izotonická regrese, škálování teplotou pro pravděpodobnosti.
Ladění hyperparametrů
- Mřížkové/náhodné vyhledávání: jednoduché základní strategie; náhodné vyhledávání bývá efektivnější při mnoha dimenzích.
- Bayesovská optimalizace: Gaussovy procesy, TPE; vzorkování slibných oblastí prostoru.
- Hyperband/ASHA: adaptivní přidělování výpočetního rozpočtu, hodnocení s různou úrovní výpočetních zdrojů (multi-fidelity; předčasné zastavování slabých kandidátů).
- Praxe: definujte prostor vyhledávání s logaritmickými měřítky; měřte výkon pomocí CV; pečlivě zaznamenávejte experimenty (mlflow, wandb).
Metody prevence úniku informací (data leakage)
- Používejte pipeline: fit/transform provádějte výhradně na trénovacích datech uvnitř jednotlivých foldů křížové validace.
- Nesdílejte statistiky (škálování, imputace, výběr příznaků) mezi trénovací, validační a testovací sadou.
- S kódováním cílové proměnné nakládejte pečlivě (schéma out-of-fold); pozor na časové závislosti.
Metriky klasifikace a jejich interpretace
- Přesnost (Accuracy): vhodná při vyvážených třídách; u vzácných událostí může být zavádějící.
- Precision, Recall, F1: kompromis mezi falešně pozitivními a falešně negativními výsledky; agregace macro/micro/weighted.
- ROC-AUC: nezávislá na prahu, ale může nadhodnocovat výkon při nesymetrických nákladech; PR-AUC je vhodnější u vzácných událostí.
- Matice záměn a nákladově citlivé metriky: očekávané náklady, optimalizace prahu podle klíčových ukazatelů výkonnosti podniku.
Metriky pro regresi a pravděpodobnostní výstupy
- RMSE/MAE: chyby v jednotkách cílové proměnné; MAE je robustnější vůči odlehlým hodnotám.
- R²: podíl vysvětlené variability; mimo lineární kontext interpretujte s opatrností.
- NLL/Brier: kvalita pravděpodobnostních odhadů; kalibrační křivky a diagramy spolehlivosti.
- Pinball loss a Winkler score pro kvantilové a intervalové predikce.
Nastavení rozhodovacího prahu a nákladově citlivé učení
- Optimalizace prahu na validačních datech podle F1, Youdenova indexu nebo podle očekávaného zisku/ztráty.
- Matice nákladů klasifikace (náklady chybné klasifikace), vážení tříd, focal loss a řízené vzorkování (SMOTE, podvzorkování).
Nejistota, intervaly spolehlivosti a statistická významnost
- Intervaly: bootstrap nad vzorky či foldy (percentilový/BCa), Wilsonovy intervaly pro přesnost.
- Testy: párový t-test/McNemarův test (závislé odhady), randomizační permutační test; pozor na závislost mezi foldy.
- Analýza stability: variabilita metrik napříč rozděleními/foldy, robustnost modelu vůči šumu.
Analýza chyb a diagnostika modelu
- Členění výkonu podle skupin (věk, region, třída produktu) – hledání slabých míst a zkreslení.
- Učicí křivky: výkon v závislosti na velikosti dat (podučení/přeučení), odhad přínosu dalšího sběru dat.
- Kontrola na základě matice záměn: audit falešně pozitivních/falešně negativních výsledků se zpětnou vazbou pro tvorbu příznaků nebo štítků.
- Vysvětlitelnost: SHAP/Permutační důležitost, parciální závislost, ablace příznaků.
Trénování ve velkém měřítku
- Distribuované učení: paralelizace dat/modelu, ZeRO, gradient checkpointing, smíšená přesnost (FP16/bfloat16).
- Ukládání kontrolních bodů a předčasné zastavení spouštěné podle validační metriky; ReduceLROnPlateau.
- Regulační techniky: vyhlazování štítků, stochastic depth, průměrování vah (SWA), EMA vah.
Férovost, zkreslení a robustnost
- Metriky férovosti: demografická parita, vyrovnané šance, rovné příležitosti; měřte je pro jednotlivé skupiny.
- Robustnost: odolnost vůči šumu/vzorkům mimo rozdělení (OOD), rozšiřování dat při testování; adversariální testy podle domény.
- Kalibrace napříč skupinami: křivky spolehlivosti pro jednotlivé segmenty, rekalibrace.
Drift, detekce OOD a monitorování v produkci
- Drift dat (P(x)) a konceptuální drift (P(y|x)): PSI/KL divergence, porovnání rozdělení příznaků/reziduí.
- Detekce OOD: detektory hustoty, Mahalanobisova vzdálenost, ansámblování/MC Dropout pro odhad nejistoty.
- Monitorování: výkonnostní metriky, klíčové ukazatele výkonnosti podniku, latence, využití zdrojů; následný sběr štítků a cykly opakovaného trénování.
Reprodukovatelnost a MLOps
- Náhodná semínka a determinismus: fixace náhodnosti (numpy/TF/PyTorch), kontrola determinismu PSL/BLAS.
- Původ a historie: verzování dat a kódu, artefakty modelů, uzamčení závislostí (poetry/conda-lock).
- Sledování experimentů: parametry, metriky, grafy učení, registr modelů; CI/CD pro trénování i nasazení.
- Dokumentace: datové listy modelů, karty modelů, rizika a omezení.
Specifika nestrukturovaných dat
- Obrazy: rozšiřování dat (převrácení, oříznutí, změna barev), metriky top-1/top-5, mAP, IoU; trénování s využitím transfer learningu.
- Text: tokenizace, subslova, předtrénování/doladění; metriky (F1, BLEU/ROUGE), testy toxicity/zkreslení.
- Zvuk/časové řady: spektrogramy, rozšiřování dat (SpecAugment), metriky CER/WER, DTW pro časové řady.
Typické nástrahy a jak se jim vyhnout
- Únik dat prostřednictvím společného škálování/kódování cílové proměnné; vždy provádějte fit pouze na trénovacích datech v rámci foldu.
- Přeučení na validační sadu v důsledku velkého počtu pokusů; použijte vnořenou křížovou validaci nebo závěrečnou testovací sadu.
- Nesprávná metrika vzhledem k obchodnímu cíli; nejprve definujte nákladovou funkci a nastavení prahu.
- Nereprezentativní rozdělení: chybějící stratifikace, nesprávné časové oddělení, únik skupin (stejný subjekt v trénovací i validační sadě).
Postup „krok za krokem“ pro robustní trénování a evaluaci
- Definujte cílovou metodu hodnocení a akceptační kritéria (metrika, interval spolehlivosti, obchodní náklady).
- Připravte pipeline předzpracování s ochranou proti úniku dat; zvolte odpovídající rozdělení dat.
- Zvolte základní model a ztrátovou funkci; sledujte učicí křivky.
- Proveďte hledání hyperparametrů (náhodné/Bayesovské) a validujte pomocí křížové validace.
- Zajistěte kalibraci pravděpodobností a optimalizaci prahu na validační sadě.
- Vyhodnoťte model na uzamčené testovací sadě s intervaly spolehlivosti a statistickým srovnáním.
- Proveďte analýzu chyb, audit férovosti/robustnosti a dokumentaci modelu.
- Proveďte nasazení s monitorováním driftu, sběrem štítků a plánem opakovaného trénování.
Kontrolní seznam před produkčním nasazením
- Metriky splňují cíle, jsou k dispozici intervaly spolehlivosti a výsledky testů významnosti.
- Pipeline je bez úniků, kroky fit/transform jsou v rámci křížové validace izolované.
- Model je kalibrovaný, prahy jsou optimalizované podle nákladové funkce.
- Jsou zajištěny reprodukovatelné běhy (seed, verze dat/knihoven) a experimenty jsou zaznamenané.
- Je zajištěno monitorování driftu a metrik, upozornění, záložní strategie a postup vrácení změn.
Závěr
Úspěšné trénování a evaluace přesnosti vyžadují systematický přístup: kvalitní data a jejich správné rozdělení, vhodnou ztrátovou funkci a metriky, důslednou validaci bez úniků, statistické ověření výsledků, kalibraci a robustní provozní rámec. Teprve souhra těchto prvků poskytuje modely, které jsou nejen přesné v laboratorních podmínkách, ale také spolehlivé, férové a udržitelné v reálném provozu.
