Proč o úspěchu rozhodují optimalizace a přenosové učení
V hlubokém učení dnes nevítězí pouze velikost modelu, ale také schopnost jej efektivně optimalizovat a přenášet znalosti mezi doménami a úlohami. Optimalizace ovlivňuje rychlost konvergence, generalizaci a stabilitu; přenosové učení (transfer learning) zásadně zkracuje dobu trénování i potřebné množství dat. Tento text systematicky shrnuje moderní postupy: od výběru optimalizačních algoritmů přes regularizační techniky a plánování učicí rychlosti až po metody adaptace předtrénovaných reprezentací, destilaci a parametricky úsporné přístupy k fine-tuningu.
Formulace problému a ztrátové funkce
- Volba ztrátové funkce: klasifikace (cross-entropy, vyhlazování štítků), regrese (Huber/MAE/MSE), detekce/segmentace (focal loss, Dice/IoU), řazení (pairwise/listwise), generativní modely (NLL, adversarial loss).
- Regularizační členy: L2 (weight decay), řídkost (L1, L0 prox), ortogonalizační penalizace, KL divergence (VAEs, destilace).
- Učení s více cíli: váhování ztrátových funkcí (uncertainty weighting), gradient surgery při konfliktu mezi cíli v rámci multi-task učení.
Optimalizační algoritmy: SGD, AdamW a další
- SGD s momentum/Nesterovem: výborná generalizace, nižší nároky na paměť; citlivý na ladění LR a velikosti dávky.
- Adam/AdamW: rychlá konvergence, odolnost vůči změnám měřítka gradientů; decoupled weight decay (AdamW) zlepšuje generalizaci.
- RMSProp/AdaGrad: dříve oblíbené u RNN, dnes se používají spíše ve specializovaných případech.
- Shampoo/Adafactor/Lion: pokročilé (kvazi)metody druhého řádu a metody s nízkými nároky na paměť pro velké modely; přínosné především u jazykových a vizuálních LLM/VLM.
- SAM/GSAM (Sharpness-Aware Minimization): penalizuje ostrá minima, zlepšuje robustnost a generalizaci na OOD datech; na jeden krok vyžaduje o něco více výpočetních prostředků.
Plánování učicí rychlosti a strategie trénování
- Warmup: lineární nebo konstantní nárůst během prvních N kroků stabilizuje učení (zejména v kombinaci s Adamem a velkými dávkami).
- Cosine decay a One-cycle: umožňují rychle dosáhnout kvalitního minima a snižují citlivost na volbu LR.
- Cyclical LR (triangular, exp range): slouží k prohledávání plató a úniku z mělkých minim.
- Škálování velikosti dávky: linear scaling rule + úprava momentum/beta2 u Adamu při opravdu velkých dávkách.
Stabilita trénování: normalizace, inicializace, přesnost
- Normalizace: BatchNorm (konvergence, ale závislost na velikosti dávky), LayerNorm/GroupNorm (transformery/CNN s malými dávkami), WeightNorm.
- Inicializace: He/Xavier/LSUV; u transformerů je důležité pečlivě škálovat reziduální větve a používat architekturu pre-norm.
- Smíšená přesnost (AMP/bfloat16): 1,3–2,0× vyšší rychlost a nižší nároky na paměť; je třeba hlídat ztrátu numerické stability (škálování gradientů).
Regularizace a zlepšování generalizace
- Dropout/DropPath (stochastická hloubka), rozšiřování dat (RandAugment, MixUp, CutMix), vyhlazování štítků.
- Weight decay oproti L2: v AdamW se používá odděleně od momentů gradientu; obvykle 1e-4 až 1e-2 podle modelu.
- Předčasné zastavení s nastavenou trpělivostí, stochastic weight averaging (SWA) pro dosažení „ploššího“ minima.
Přenosové učení: kdy a jak
Přenosové učení využívá předtrénované reprezentace a adaptuje je na cílovou úlohu s menším množstvím dat a za kratší dobu. Základní možnosti:
- Extrakce příznaků: zmrazit většinu vrstev a natrénovat pouze klasifikační hlavu. Rychlý postup s minimálním rizikem přeučení, ale s nižším maximálním výkonem.
- Fine-tuning: částečně nebo úplně odemknout vrstvy a použít nižší LR. Umožňuje lepší adaptaci na doménu, vyžaduje však více ladění a nese riziko katastrofického zapomínání.
- Adaptery (Houlsby, Pfeiffer), LoRA (adaptace s nízkou hodností), Prefix/Prompt Tuning: parametricky úsporné metody, ideální pro LLM/VLM; přenášejí se pouze malé Δ-parametry.
Doménová adaptace a scénáře few-shot
- Učení bez učitele nebo se slabým učitelem: přidání cílových dat bez štítků (SSL, pseudo-labeling, regularizace konzistence).
- Adverzariální adaptace (DANN): minimalizace rozdílu mezi distribucemi zdrojové a cílové domény v latentním prostoru.
- Meta-learning (MAML, ProtoNets): rychlá adaptace na základě několika příkladů; vhodná pro úlohy, které se rychle mění.
Sebeřízené a kontrastivní předtrénování
- Kontrastivní učení (SimCLR, MoCo, InfoNCE): maximalizace podobnosti mezi různými pohledy na data po augmentaci a minimalizace podobnosti s ostatními.
- Vícemodální předtrénování (CLIP, ALIGN): učení společného prostoru (obraz–text) a následný přenos typu zero-/few-shot.
- Maskované modelování (BERT/MAE): rekonstrukce chybějících tokenů/patchů pro získání robustních reprezentací.
Destilace znalostí a komprese modelů
- Knowledge Distillation: student se učí od učitele (měkčí distribuce s teplotou T, přenos skrytých znalostí).
- Pruning: nestrukturovaný (podle velikosti vah) oproti strukturovanému (kanály/hlavy); hypotéza lottery ticket pro zřídnutí modelu.
- Kvantizace: po trénování (PTQ) oproti kvantizačně uvědomělému tréninku (QAT); INT8/INT4 u LLM s minimální ztrátou výkonu při správné kalibraci.
- Adaptace s nízkým počtem parametrů: LoRA/QLoRA (kvantizace základního modelu + aktualizace s nízkou hodností) výrazně snižuje nároky na paměť.
Učební osnovy a aktivní učení
- Učební osnova (curriculum): postup od jednoduchých příkladů ke složitým; stabilnější a rychlejší konvergence.
- Aktivní učení: výběr „nejcennějších“ vzorků k anotaci (nejistota, core-set, rozmanitost); výrazně snižuje nároky na anotování.
Data: kurátorství, rozšiřování a vyvažování
- Kurátorství: odstranění duplicit/úniků z validačních dat, vyvážení tříd, detekce posunu dat (covariate/label shift).
- Rozšiřování dat: specifické pro danou doménu (audio: time-stretch, specaugment; NLP: back-translation, synonyma; obraz: změna barev, geometrické transformace).
- MixUp/CutMix: zlepšují rozhodovací hranice a kalibraci.
Kalibrace a nejistota
- Teplotní škálování a Plattova kalibrace: úprava pravděpodobností pro lepší rozhodování na základě prahových hodnot.
- Ensembles a MC Dropout: odhad epistemické a aleatorické nejistoty, zásadní pro bezpečné nasazení.
Hledání hyperparametrů
- Bayesovská optimalizace, Hyperband/ASHA, Population Based Training: efektivní prohledávání prostoru.
- Víceúrovňové přístupy: menší datové sady/epochy jako rychlá aproximace.
- Spolehlivá validace: rozdělení podle skupin nebo časových řad, prevence leakage, stratifikace.
Implementační strategie pro přenosové učení
- Inventarizace: identifikujte dostupné předtrénované checkpointy a licenční podmínky/status jejich použití.
- Zmrazení a sondování: nejprve proveďte extrakci příznaků s novou hlavou; získejte základní srovnávací výsledek.
- Postupné odemykání vrstev („unfreezing“) shora dolů s nízkou LR a diskriminativní LR (nižší pro rané vrstvy).
- Ladění pomocí adapterů nebo LoRA, pokud je cílem nízká spotřeba paměti, mnoho doménových variant nebo škálování MLOps.
- Kontinuální učení: pravidelná revalidace na zdrojové i cílové doméně, replay/regularizace proti zapomínání.
Tabulka: kdy zvolit který přístup
| Situace | Doporučená strategie | Výhody | Rizika |
|---|---|---|---|
| Úloha s malým množstvím dat, odlišná doména | Adapter/LoRA + silná augmentace | Málo parametrů, rychlý iterativní vývoj | Omezený maximální výkon, nutnost zvolit správnou vrstvu |
| Velmi blízká doména a dostatek dat | Plný fine-tuning s diskriminativní LR | Nejvyšší potenciální výkon | Vyšší riziko přeučení, delší trénování |
| Nasazení na edge zařízeních s omezeným HW | Destilace + kvantizace (QAT/INT8) | Malý model, nízká latence | Možné snížení přesnosti bez pečlivé kalibrace |
| Dynamická doména (časté změny) | Continual learning + replay/regularizace | Udržení výkonu v čase | Složitější MLOps a datové pipeline |
Metriky úspěchu: nejen přesnost
- Hlavní metriky: přesnost/F1/AUROC/mAP podle úlohy; expected calibration error (ECE), NLL, Brier.
- Výkon a náklady: FLOPs, latence/p95, VRAM/počet parametrů, energie na inferenci, cena za 1 000 požadavků.
- Robustnost: OOD testy, odolnost vůči drobným posunům (benchmarky s augmentacemi).
MLOps a reprodukovatelnost
- Determinismus: nastavení seedů, kontrola knihoven, deterministické režimy mixed precision, záznam prostředí (Docker/conda).
- Sledování experimentů: konfigurace, hyperparametry, checkpointy, verze dat; automatické vyhodnocování a reporty.
- Registr modelů a nasazení: správa variant (full FT, LoRA, distilace), A/B testy, postupné nasazování canary, monitorování driftu.
Kontrolní seznam: praktický postup optimalizace a přenosu
- Definujte ztrátovou funkci a metriky + ověřte, že validační data neobsahují leakage.
- Vyberte optimalizátor (AdamW/SGD) a plán LR (warmup + cosine/one-cycle).
- Nastavte regularizaci (weight decay, dropout, augmentace, vyhlazování štítků).
- Začněte extrakcí příznaků → proveďte benchmark; poté odemykejte vrstvy + použijte diskriminativní LR.
- Vyzkoušejte adapter/LoRA pro parametricky úspornou adaptaci.
- Komprimujte model (destilace, pruning, kvantizace) podle cílového HW.
- Kalibrujte pravděpodobnosti a vyhodnoťte nejistotu.
- Automatizujte HPO (ASHA/BO), zaznamenávejte experimenty a sledujte drift po nasazení.
Časté chyby a jak se jim vyhnout
- Stejná LR pro všechny vrstvy při fine-tuningu → použijte layer-wise nebo diskriminativní LR.
- Předčasné odemknutí všech vrstev při malém množství dat → nejdřív natrénujte hlavu, poté vrstvy odemykejte postupně.
- Ignorování kalibrace → falešně vysoká sebedůvěra, horší rozhodování.
- Nejvhodnější augmentace pro danou doménu (mění štítek) → pečlivě ověřte konzistenci.
- Leakage mezi train/val/test (duplicitní nebo příbuzné vzorky) → deduplikace, rozdělení podle skupin/času.
Závěr: systémový pohled přesahující parametry
Optimalizace modelů a přenosové učení jsou dvě strany téže mince: první zajišťuje, že plně využijete kapacitu architektury na daných datech, druhé umožňuje tuto kapacitu efektivně obohatit znalostmi získanými jinde. Kombinace pečlivě zvolené ztrátové funkce, moderního optimalizátoru, promyšleného plánování LR, robustní regularizace a parametricky úsporné adaptace (adaptery/LoRA) vede k modelům, které jsou přesné, stabilní, rychlé a nasaditelné i na omezeném hardwaru. Klíčem je systematické experimentování, kvalitní data a důsledné MLOps – teprve jejich součinnost přináší udržitelný výkon.
