Rozšířená realita (AR): princip fungování

Rozšířená realita (AR): Princip fungování

Co je rozšířená realita (AR) a v čem se liší od VR/MR

Rozšířená realita (Augmented Reality, AR) vkládá digitální obsah (3D objekty, texty, ukazatele, data) přímo do vnímání skutečného světa. Na rozdíl od virtuální reality (VR), která uživatele přenáší do plně syntetického prostředí, AR registruje (zarovnává) a fúzuje virtuální prvky se scénou před uživatelem v reálném čase. Smíšená realita (Mixed Reality, MR) je širší nadmnožinou, která zahrnuje plynulé spektrum mezi AR a VR a zdůrazňuje interakci virtuálních objektů s fyzikou a světlem reálného prostředí.

AR z hlediska zpracovatelského řetězce

Systém AR lze chápat jako pipeline: snímání → odhad polohy a mapování (tracking & mapping) → porozumění scéně → rendering & kompozice. Cílem je zachovat nízkou latenci, stabilní registraci a fotorealistickou integraci obsahu.

  • Snímání: kamery (RGB, RGB-D), IMU (akcelerometr, gyroskop), hloubkové senzory (ToF, strukturované světlo), mikrofony, někdy LiDAR.
  • Tracking & mapping: odhad pose (pozice a orientace) zařízení v prostředí a tvorba 3D mapy klíčových bodů nebo husté hloubkové reprezentace.
  • Porozumění scéně: detekce ploch, hran a objektů, odhad osvětlení, segmentace pro okluzi.
  • Rendering & kompozice: nasvícení, stíny, okluze a vyhlazování hran; výsledná kompozice s reálným obrazem (video see-through) nebo optickým průhledem (optical see-through).

Senzory a jejich fúze

AR spoléhá na multisenzorickou fúzi, protože samotný obraz je náchylný k rozmazání, změnám světla a uniformním plochám.

  • IMU: poskytuje rychlé, ale driftující údaje o rotačním a translačním pohybu; hodí se k interpolaci mezi snímky a stabilizaci.
  • Kamery: vizuální odhad pohybu (VO/VIO) pomocí sledování příznaků (feature tracking) a bundle adjustment.
  • Hloubka (ToF/LiDAR): přímé měření vzdáleností pro robustní detekci ploch, okluzi a měřítka scény.
  • Fúze: filtry (Extended/Unscented Kalman), optimalizace factor graph (např. GTSAM) ke snížení driftu a zajištění konzistence stavu.

Kalibrace a souřadnicové systémy

Přesnost AR závisí na správné kalibraci:

  • Vnitřní parametry kamery: ohnisková vzdálenost, hlavní bod, zkreslení čočky (radiální/tangenciální).
  • Vnější parametry: rigidní transformace mezi kamerou, IMU, hloubkovým senzorem a zobrazovacím prvkem (HMD).
  • Souřadnicové systémy: Device frame, World frame, Camera frame, případně Anchor frame pro lokalizované objekty.

Tracking: markerový vs. bezmarkerový (SLAM)

  • Markerový tracking: fiducial značky (ArUco, AprilTag) se známou geometrií. Výhody: rychlá inicializace, stabilita. Nevýhody: vizuální rušivost.
  • Bezmarkerový tracking: SLAM (Simultaneous Localization and Mapping) – metody založené na příznacích (feature-based; ORB/SIFT/AKAZE), direct methods (fotometrická konzistence), případně semidense/dense rekonstrukce. Kombinace s IMU poskytuje VIO (Visual-Inertial Odometry) s nižší latencí a menším driftem.
  • Opětovná lokalizace a perzistence: rozpoznání již navštívených míst, slučování map a sdílené mapy (AR pro více uživatelů) s cloud anchors.

Mapování scény a detekce ploch

AR enginy (ARKit/ARCore/HoloLens SDK) odhadují roviny (podlaha, stůl), hrany a povrchy pro umístění anchorů. Hloubková data a plane fitting (RANSAC) umožňují pevné ukotvení objektů i v prostředích s malým počtem příznaků. Husté mapy podporují tvorbu meshe scény pro pokročilou okluzi a fyzikální interakce.

Odhad osvětlení a fotorealistické nasvícení

Pro vizuální věrohodnost je klíčový odhad osvětlení (light estimation):

  • Mapa prostředí (environment map) a spherical harmonics pro difuzní osvětlení.
  • Reflexní sondy a HDRI pro spekulární složku a realistické odlesky.
  • Stíny a kontaktní stín: blob shadow, shadow mapping a techniky screen-space.

Okluze a segmentace

Okluze zajišťuje, že reálné objekty zakryjí virtuální prvky, pokud mají být „před nimi“. Realizuje se pomocí hloubkové mapy, meshe scény nebo segmentace založené na strojovém učení (learning-based; osoby, ruce). Správná okluze výrazně zvyšuje věrohodnost a stabilitu registrace.

Zobrazovací technologie: video vs. optický průhled

  • Video see-through: kamera snímá svět, zařízení skládá obraz AR a zobrazuje jej na displeji (smartphone, některé HMD). Výhody: plná kontrola nad obrazem, přesné barvy a okluze. Nevýhody: latence a možné nepohodlí.
  • Optical see-through: světelné vlnovody, průhledné displeje (HMD). Výhody: přirozené vnímání reálného světa, nižší riziko nevolnosti z pohybu. Nevýhody: zobrazení pouze s přidáváním světla (additive-only; černá není „černá“), složitější okluze a omezený jas na denním světle.

Renderovací a kompoziční vrstva

Rendering AR musí respektovat časové omezení (ideálně < 16 ms pro 60 FPS) a minimalizovat latenci motion-to-photon.

  • Timewarp/Reprojection: korekce orientace na poslední chvíli, která snižuje vnímané zpoždění.
  • Stabilizace: filtrování a predikce vyhlazují drobné chvění (jitter), aby objekty „neplavaly“.
  • Fotometrie: materiály PBR, tónové mapování a vyvážení bílé pro soudržný vzhled.

Interakce: ruce, pohled, gesta, hlas

Model interakce závisí na zařízení:

  • Dotyk a obrazovka (mobilní AR): hit testing vůči detekovaným plochám, gesta pro změnu měřítka a rotaci.
  • Sledování rukou (hand tracking): detekce kostry ruky, gesta pinch/air tap, přirozená manipulace s 3D objekty, haptická odezva v ovladačích.
  • Gaze & dwell: sledování očí/pohledu pro výběr a zaostření, často v kombinaci s gestem.
  • Hlas: hlasové příkazy pro scénáře bez použití rukou (průmysl, zdravotnictví).

Prostorový zvuk (spatial audio)

AR využívá binaurální rendering a HRTF, aby zvuk vycházel z polohy virtuálních objektů v prostoru. Pro dosažení realističnosti se modelují dozvuk místnosti (reverb), útlum a stínění skutečnými překážkami.

Perzistence a sdílené zážitky

Perzistentní AR ukládá kotvy a mapová data, aby bylo možné se do stejné scény vrátit později. AR pro více uživatelů vyžaduje společný světový souřadnicový systém: sdílené kotvy nebo cloud anchors, synchronizaci pozic a stavů objektů s nízkou latencí (WebRTC, MQTT, vlastní UDP), řešení konfliktů a latencí.

Edge computing a cloud

Náročné úlohy (hustý SLAM, rekonstrukce, rozpoznávání objektů, neuronová inference) lze přesunout (offloadovat) na edge/cloud. Výhodou je vyšší výkon a sdílené mapy, rizikem latence a přepojování (handover) mezi sítěmi. Hybridní modely zpracovávají lokálně „kritickou smyčku“ (tracking) a do cloudu odesílají méně naléhavé úlohy.

Výkonnostní metriky a latence

  • Motion-to-photon: celková doba od pohybu zařízení/hlavy po zobrazení aktualizovaného obrazu (cílově < 20 ms u HMD, < 60 ms u mobilu).
  • Chyba registrace (registration error): úhlová/translační chyba zarovnání virtuálních objektů se skutečnými referenčními body.
  • Drift: kumulativní odchylka pozice/orientace v čase bez opětovné lokalizace.
  • Stabilita snímků (frame stability): jitter, vynechané snímky, latence renderingu p95/p99.

Bezpečnost a ergonomie

  • Fyzická bezpečnost: přehled o okolí prostřednictvím passthrough, zóna bezpečného prostoru, upozornění na překážky.
  • Ochrana soukromí: AR snímá okolí – nutná anonymizace, zpracování přímo v zařízení a omezení sdílení map.
  • Ergonomie: hmotnost HMD, rovnoměrné rozložení, jas a kontrast pro různé světelné podmínky, omezení nevolnosti z pohybu (latence, reprojekce, stabilní zaměřovací značka).

Testování a validace AR

  • Laboratorní kalibrace: testovací vzory pro zkreslení, přesnost odhadu polohy pomocí optického systému (Vicon/OptiTrack).
  • Terénní testy: různé světelné podmínky, texturovanost scén, pohybové profily uživatelů.
  • Hodnocení UX: úspěšnost úkolů, čas, subjektivně vnímaná stabilita, kognitivní zátěž (NASA-TLX).

Typické aplikační scénáře

  • Průmysl a servis: návody „krok za krokem“, vzdálená asistence, kontrola kvality s překryvnými vrstvami tolerancí.
  • Vzdělávání a medicína: anatomické překryvné vrstvy, navigace v operačním poli, simulace postupů.
  • Navigace a maloobchod: navigace ve vnitřních prostorách, vizualizace produktů v prostoru (zařizování interiéru), interaktivní marketing.
  • Zábava a kultura: herní překryvné vrstvy, muzejní expozice s rekonstruovanými artefakty.

Počítačové vidění a strojové učení v AR

Moderní AR využívá hluboké učení (deep learning) pro robustnější feature detection, odhad hloubky z monokulární kamery, sémantickou segmentaci (semantic segmentation; rozlišení podlah, stěn, lidí) a rozpoznávání objektů. Učení přímo v zařízení (on-device) s kvantizovanými modely (INT8) a akcelerátory (NPU) snižuje latenci a chrání soukromí.

Energetika a optimalizace

  • Duty-cycling a adaptivní snímkování: dynamicky snižovat frekvenci senzorů/renderingu, když uživatel neinteraguje.
  • Tiling a foveated rendering: vyšší kvalita v místě, kam se uživatel dívá, nižší jinde; vyžaduje sledování pohybu očí.
  • Společný návrh pipeline (pipeline co-design): sdílení výsledků mezi trackingem a renderingem (např. opětovné využití hloubky), přenosy zero-copy mezi GPU/ISP/NPU.

Standardy, frameworky a nástroje

  • Frameworky: ARKit (iOS), ARCore (Android), MRTK a HoloLens SDK, Vuforia pro průmyslové značky, OpenXR pro interoperabilitu.
  • Enginy: Unity, Unreal s AR pluginy; WebXR pro prohlížeče.
  • Formáty: glTF/USDC pro 3D obsah, light probes a materiály PBR, anchors a mapy specifické pro platformu.

Limity a otevřené výzvy

  • Robustnost v náročných scénách: nízká texturovanost, zrcadla, průsvitné povrchy, extrémní světelné kontrasty.
  • Venkovní AR: jas, odrazy, dosah hloubkových senzorů, přesnost GNSS ve srovnání s lokálním SLAM.
  • Sdílená mapa: škálovatelné sdílení a synchronizace map mezi uživateli, bezpečnost a integrita.
  • Formát zařízení (form factor): lehké, esteticky přijatelné brýle s širokým zorným polem (FOV), vysokým jasem a dlouhou výdrží.

Osvědčené postupy pro stabilní a věrohodnou AR

  • Rychlá inicializace: uživatele navést k pohybu kamerou, aby bylo možné zachytit příznaky, a při hledání ploch poskytovat vizuální zpětnou vazbu.
  • Kontextové kotvy: používat fyzikálně relevantní plochy a snapping pro zajištění stability.
  • Realistická fotometrie: kontaktní stín, přiměřené odlesky, konzistentní měřítko a perspektiva.
  • Odolné chování při selhání (fail-soft): při ztrátě trackingu dočasně zablokovat interakce, informovat o stavu (opětovná lokalizace) a zabránit „plavání“ objektů.
  • Škálování: omezit počet polygonů a velikost textur, používat instancing a LOD, upřednostňovat glTF/PBR.

Závěr

Princip fungování AR spočívá v přesném odhadu polohy, mapování a porozumění scéně, aby bylo možné věrohodně a stabilně sloučit virtuální obsah s realitou. Úspěšná AR integruje multisenzorickou fúzi, robustní SLAM/VIO, správnou fotometrii a ergonomické interakce. S postupným nástupem lehčích HMD, výkonnějších NPU a standardů pro perzistentní mapy se AR posouvá od demonstrací k široce nasazovaným scénářům s přínosem pro uživatele v průmyslu, medicíně i každodenním životě.