Proč deep learning změnil rozpoznávání obrazu a řeči
Hluboké učení (Deep Learning, DL) zásadně proměnilo počítačové vidění i automatické rozpoznávání řeči (ASR). Od roku 2012 jsme svědky dramatického skoku v přesnosti díky konvolučním sítím (CNN), rekurentním a později transformačním architekturám (Transformers). Zásadní roli hraje schopnost učit se hierarchické reprezentace přímo z dat, efektivní využití GPU/TPU, rozsáhlých datových sad a metod sebeřízeného učení. Následující text systematicky shrnuje architektury, tréninkové postupy, metriky, nasazení, rizika i trendy v oblasti obrazu a řeči.
Historie a milníky
- Obraz: LeNet (ručně psané číslice) → AlexNet (průlom v soutěži ImageNet) → VGG/ResNet (hloubka a přeskočení vrstev) → EfficientNet (škálování) → Vision Transformers (ViT) a hybridy (ConvNeXt).
- Řeč: Přechod od GMM-HMM k akustickým modelům DNN → LSTM/BLSTM → CTC a pozornostním sekvencím seq2seq → RNN-Transducer a Conformer (konvoluce + self-attention) → velké multimodální modely (audio-text).
- Učení bez dozoru: kontrastivní učení (SimCLR, MoCo), predikce maskovaných částí (MAE pro obraz, wav2vec 2.0/Hubert pro řeč).
Architektury pro obraz: od CNN k Transformerům
- CNN: lokální receptivní pole, sdílení vah, induktivní předpoklad (inductive bias) translace. Vhodné pro klasifikaci, detekci (Faster R-CNN, YOLO, RetinaNet) a segmentaci (U-Net, DeepLab).
- Transformery (ViT, Swin): tokenizace obrazových výřezů, self-attention, globální kontext. Lépe se škálují s daty a předtrénováním; často se kombinují s konvolucemi.
- Reprezentace: pro detekci/segmentaci přidáváme sítě obrazových pyramid (FPN), pro úlohy s hustou predikcí dilatované konvoluce a deformovatelnou pozornost.
Architektury pro řeč: akustika, jazyk a přístup od začátku do konce
- Vstupní vrstva: log-Melovy spektrogramy, MFCC, případně naučená vstupní vrstva (SincNet, konvoluční vstupní vrstva) pro surové audio.
- CTC: Connectionist Temporal Classification pro zarovnání bez časových značek; jednoduchý dekodér, vhodné pro robustnost.
- Seq2Seq s pozorností: akustický enkodér + dekodér s pozorností (znaky/wordpiece); kvalitní při dostatku dat.
- RNN-Transducer (RNN-T): schopnost online zpracování, nízká latence, dobrý kompromis mezi přesností a rychlostí.
- Conformer: kombinuje konvoluce (lokální závislosti) a self-attention (globální závislosti), špičková architektura pro ASR.
- Jazykové modely: n-gram → Transformer LM (wordpiece/BPE); mělké/hluboké slučování (shallow/deep fusion) s akustickým modelem pro zlepšení WER.
Sebeřízené učení (Self-Supervised Learning, SSL)
- Obraz: MAE (maskované autoenkodéry), MoCo/SimCLR (kontrastivní), BYOL/SimSiam (bez negativních vzorků) zlepšují dolaďování pro detekci/segmentaci.
- Řeč: wav2vec 2.0/Hubert se učí univerzální akustické reprezentace z neoznačeného audia; zásadní pro jazyky s nedostatkem anotovaných dat.
- Výhoda: menší závislost na anotacích, lepší zobecnění napříč doménami (šum, akcenty, různé mikrofony/kamery).
Data, augmentace a vyvažování
- Augmentace obrazu: RandomCrop/Flip, ColorJitter, Cutout/CutMix/MixUp, RandAugment/TrivialAugment. Pro detekci mozaika (mosaic), více měřítek (multi-scale).
- Augmentace audia: SpecAugment (maskování v čase/frekvenci), přidávání šumu a dozvuku (RIR), posun rychlosti/výšky tónu; simulace místnosti pro zvýšení robustnosti.
- Kurátorství dat: nevyvážené zastoupení tříd řešíme převažováním (reweighting), vzorkováním, focal loss; deduplikací a vyhledáváním obtížných příkladů (hard example mining).
Ztrátové funkce a cíle učení
- Klasifikace: cross-entropy, vyhlazování štítků (label smoothing); při nevyváženém zastoupení tříd focal loss.
- Detekce: kombinace klasifikační ztráty (CE/focal) a regresní ztráty (L1/GIoU/DIoU/CIoU).
- Segmentace: CE + Dice/Jaccard, případně Tversky pro menšinové třídy.
- ASR: ztrátová funkce CTC, ztrátová funkce transduceru, cross-entropy pro dekodér s pozorností; kombinace prostřednictvím multitaskingu (CTC+att).
Metriky hodnocení
| Doména | Úloha | Metrika | Popis |
|---|---|---|---|
| Obraz | Klasifikace | Top-1/Top-5 | Podíl správně klasifikovaných vzorků |
| Obraz | Detekce | mAP@[.5:.95] | Průměrná přesnost napříč prahy IoU a třídami |
| Obraz | Segmentace | mIoU/Dice | Průměr napříč třídami, překryv masek |
| Řeč | ASR | WER/CER | Míra chybovosti slov/znaků (Word/Character Error Rate) = (S+D+I)/N |
| Řeč | Rozpoznávání klíčových slov | ROC-AUC, F1 | Kompromis mezi TPR/FPR |
Tréninkové techniky a škálování
- Optimalizace: AdamW, LAMB, kosinový pokles (cosine decay), zahřívání (warmup); ořezávání gradientů (gradient clipping) pro zajištění stability.
- Regularizace: dropout, stochastická hloubka, penalizace vah (weight decay), vyhlazování štítků (label smoothing).
- Škálování: paralelismus dat/modelu/pipeline, smíšená přesnost (FP16/BF16), dělení parametrů ZeRO/FS; ukládání kontrolních bodů (checkpointing).
- Ladění hyperparametrů: bayesovská optimalizace, ASHA (vyřazování slabších běhů), trénování založené na populaci (population based training).
Nasazení na edge zařízeních a v reálném čase
- Optimalizace: kvantizace (po tréninku/s přihlédnutím ke kvantizaci), prořezávání (pruning), destilace znalostí; export do ONNX/TensorRT/CoreML.
- Latence: streamovací ASR (streaming RNN-T/Conformer), kauzální pozornost; vizuální modely s předčasným ukončením (early exit).
- Energetická náročnost: rozdělení výpočtů mezi edge a cloud (split computing), adaptivní datový tok (adaptive bitrate) pro video, řídkost (sparsity).
Pipeline rozpoznávání obrazu
- Získávání dat (kamery, parametry kamery, HDR, stabilizace) + maskování citlivých údajů.
- Předzpracování: změna velikosti, normalizace, augmentace; u videa odšumování a detekce scén.
- Inference: klasifikace/detekce/segmentace; následné zpracování (NMS, sledování více objektů, kalibrace skóre).
- Výstup: metriky, překryvná vizualizace, API (REST/gRPC), události.
Pipeline ASR a hlasová analytika
- Audio I/O: VAD (detekce hlasové aktivity), AEC (potlačení ozvěny), AGC (automatické řízení úrovně).
- Extrakce příznaků: log-Melovy příznaky, skládání rámců (frame stacking), normalizace (CMVN).
- Model: CTC/Transducer/Attention (Conformer); jazykový model integrovaný slučováním (fusion).
- Dekódování: prohledávání paprskem (beam search), tokenizace (BPE), zvýraznění klíčových slov (hotword boosting).
- Následné zpracování: interpunkce, normalizace čísel a zkratek, diarizace (x-vektory pyannote).
MLOps a provozní excelence
- DataOps: verzování dat (DVC/LakeFS), datové kontrakty, monitorování posunu (drift) (covariate/prior).
- Trénink: reprodukovatelnost (seed, determinismus), úložiště příznaků (feature store), registr artefaktů (registr modelů).
- Nasazení: canary/blue-green, A/B testy, inference ve stínovém režimu (shadow); příznaky funkcí (feature flags).
- Monitorování: SLI (latence, WER, mAP), posun konceptu (concept drift), kvalita dat (data quality); upozorňování a automatický návrat k předchozí verzi.
Robustnost, bezpečnost a etika
- Robustnost napříč doménami: augmentace při testování (test-time augmentation), adaptace batch norm, adaptace pomocí několika příkladů (few-shot).
- Odolnost vůči adversariálním útokům: adversariální trénink, sanitizace vstupů (input sanitization), certifikované obrany pro bezpečnostně kritické aplikace.
- Bias a férovost: audit napříč demografickými skupinami (WER podle akcentu/pohlaví), převážení (re-weighting), sběr reprezentativních dat.
- Soukromí: anonymizace obrazu/hlasu, federované učení (federated learning), diferenciální soukromí (differential privacy).
- Dodržování předpisů: zaznamenávání rozhodnutí, vysvětlitelnost (saliency, SHAP), správa souhlasů.
Multimodální učení: obraz × řeč × text
- Audio-Visual Speech Recognition (AVSR): fúze odezírání ze rtů a audia pro zvýšení robustnosti v hlučném prostředí.
- Vize a jazyk: CLIP/ALIGN (kontrastivní předtrénování) → lepší klasifikace a vyhledávání v režimu zero-shot.
- Multimodální transkripce a titulkování: spojení ASR s detekcí scén a OCR pro úplný popis videa.
Příklady doménových aplikací
- Průmysl: vizuální inspekce (detekce vad), prediktivní údržba s akustickou diagnostikou.
- Zdravotnictví: segmentace lézí, ASR pro diktování zpráv s terminologickým jazykovým modelem.
- Automobilový průmysl: vnímání scény (detekce/segmentace), hlasové ovládání v kabině s nízkou latencí.
- Bezpečnost: diarizace a rozpoznávání klíčových slov, eticky omezené identifikační systémy navržené s ohledem na ochranu soukromí.
Výběr modelu a provozní kompromisy
| Kritérium | Obraz – příklad | Řeč – příklad | Dopad |
|---|---|---|---|
| Přesnost | ViT-L/14 vs. ResNet-50 | Conformer-L vs. RNN-T small | Vyšší přesnost = vyšší nároky na trénink/výpočetní prostředky |
| Latence | YOLOv8n (edge) | Streamovací RNN-T | Nutné optimalizace (INT8, TensorRT) |
| Náročnost na data | SSL MAE + dolaďování | wav2vec 2.0 + jazykový LM | Šetří anotace, vyžaduje předtrénování |
| Interpretovatelnost | Grad-CAM pro CNN | Váhy pozornosti, fonémové zarovnání | Audit, ladění a dodržování předpisů |
Kontrolní seznam pro produkční nasazení
- Máte vyvážená a kurátorovaná data (výkonnost podle domén/akcentů/tříd)?
- Je pipeline deklarativní (IaC + MLOps), s automatickými testy a CI/CD?
- Proběhl test robustnosti (šum, slabé osvětlení, pohyb, vstupy OOD)?
- Je zajištěno monitorování SLI/SLO (latence, WER/mAP, dostupnost) a upozornění?
- Jsou zajištěny audity bezpečnosti (SBOM, podpisy modelů), soukromí a férovosti?
- Existuje plán pro návrat k předchozí verzi, canary a testy obnovy po havárii (DR) pro modelové služby?
Trendy a budoucnost
- Základní/pokročilé multimodální modely (Foundation/Frontier) s generalizací napříč úlohami a dolaďováním podle instrukcí (instruction tuning).
- Sebeřízené učení + few-shot adaptace na nové domény, průběžné učení (continual learning) bez zapomínání.
- AI přímo v zařízení s akcelerátory (NPU), kvantizace na 4–8 bitů bez výrazné ztráty kvality.
- Neurální kodeky a diskrétní jednotky (discrete units) (k-means v HuBERT) pro efektivní reprezentaci audia a součinnost TTS/ASR.
Závěr
Hluboké učení sjednotilo rozpoznávání obrazu i řeči na základě společných principů: kvalitních reprezentací, škálovatelných architektur a učení založeného na datech. Úspěch v praxi závisí na kvalitní datové logistice, správně zvolených metrikách, disciplinovaném přístupu k MLOps a odpovědném přístupu k bezpečnosti a soukromí. Kombinací sebeřízeného předtrénování, vhodných architektur (ViT/Conformer) a produkčních optimalizací (kvantizace, destilace) lze dosáhnout špičkové přesnosti i v náročných podmínkách a udržet latenci i náklady pod kontrolou.
