Cíle diagnostiky a správy síťového provozu
Diagnostika a správa síťového provozu (Network Operations & Observability) zahrnuje systematické měření, analýzu a řízení toků dat napříč vrstvami OSI s cílem zajistit dostupnost, výkon, bezpečnost a předvídatelnost. Klíčové je stanovit metriky kvality (SLI/SLO), vybudovat sběr telemetrie v reálném čase a uplatňovat řízení provozu (QoS, shaping, směrování) i procesy reakce na incidenty.
Referenční rámec: vrstvy OSI/TCP/IP a typické poruchy
- L1–L2 (fyzická/linková): chybovost na portech, nesoulad duplexu, smyčky STP, chyby VLAN/Trunk, rušení RF u Wi-Fi.
- L3 (síťová): chybné směrovací tabulky, asymetrické cesty, MTU/fragmentace, zahazování paketů podle ACL.
- L4–L7 (transportní/aplikační): vyčerpání portů, retransmise TCP, chyby TLS, latence DNS, problémy služeb.
Klíčové metriky a ukazatele (SLI/SLO)
| kategorie | Metrika | Interpretace |
| Dostupnost | Uptime, Loss (%) | Ztráta paketů < 0,1–1 % u interaktivních služeb |
| Výkon | Latency, Jitter (ms) | Hlas/VC: RTT < 150 ms, jitter < 30 ms |
| Propustnost | Throughput (Mb/s) | 95. percentil při zátěži |
| Spolehlivost | TCP Retrans (%), Out-of-order | Retrans < 2–3 % u WAN |
| Bezpečnost | Flows/min, anomálie | Detekce DDoS, skenování portů, exfiltrace dat |
Sběr telemetrie: NetFlow/IPFIX, sFlow a streamovaná telemetrie
- NetFlow/IPFIX: vzorkovaný/nevzorkovaný export toků (5-tuple, bajty, pakety, trvání, ToS/DSCP); vhodné pro plánování kapacity a detekci anomálií.
- sFlow: vzorkování paketů na L2–L4 + čítače; velmi dobře škálovatelné pro top-of-rack a fabric datového centra.
- Model-driven telemetry: gNMI/GPB/JSON, modely YANG; push stream oproti SNMP pull, nižší latence a režie.
- SNMPv3: základní čítače (ifIn/OutErrors, Discards), teplota/napájení; vyžaduje autorizaci a šifrování.
Aktivní a pasivní měření
- Aktivní: ping, traceroute/mtr, TWAMP/OWAMP (jednosměrné/obousměrné zpoždění, jitter, ztráty), syntetické transakce HTTP/DNS.
- Pasivní: span/tap + pcap (tcpdump, Wireshark), NetFlow/IPFIX, sondy eBPF v hostitelích.
- RUM (Real User Monitoring): měření z prohlížeče/klienta – DNS/TCP/TLS/TTFB, latence z pohledu uživatele.
Diagnostické nástroje a postupy
- L2: show interfaces (CRC, FCS, alignment), show spanning-tree, sousedé LLDP/CDP, flapping MAC tabulky.
- L3: show ip route, traceroute (asymetrie), zjišťování MTU cesty (ping -M do, bit DF), analýza ECMP.
- L4–L7: tcpdump/pcap (SYN, SYN/ACK, velikost okna, SACK, RTT), analýza handshaku TLS, stavové kódy HTTP a TTFB.
- Wi-Fi: spektrální analýza, režie beacon/probe, využití kanálu, opakované pokusy, MCS, roaming (802.11k/v/r).
Řešení problémů krok za krokem (runbook)
- Potvrzení příznaku: reprodukce, sběr časových značek, ověření rozsahu (hostitel/zóna/lokalita).
- Rychlá telemetrie: ping/jitter/loss, mtr; kontrola chyb portů, CPU, paměti a teplot.
- Izolace vrstvy: ARP/ND, DHCP/DNS, smyčky L2, směrování, ACL/NAT, TLS.
- Hypotéza a test: změna cesty, značení DSCP, snížení MSS/MTU, dočasné vypnutí offloadů.
- Náprava: politika QoS, změna směrování, rate-limit/shaping, oprava hardwaru/kabelu, aktualizace firmwaru.
- Post-mortem: strom příčin (5× proč), akční úkoly, aktualizace runbooku.
QoS: klasifikace, značení a plánování front
- Klasifikace: L2 CoS (802.1p), L3 DSCP (EF, AFxy, CSx), NBAR/L7; mapování do výstupních front.
- Fronty: CBWFQ, LLQ (prioritní fronta pro hlas/video), WRED/ECN jako signál přetížení.
- Shaping vs. Policing: shaping vyrovnává špičky (token bucket), policing zahazuje pakety nebo mění jejich značení; shaping používejte na okrajích WAN.
- Bufferbloat a AQM: FQ-CoDel/PIE zkracují latenci při plném zatížení.
Směrování a řízení cest
- IGP: OSPF/ISIS – páteřní síť, ladění cost/metric, LFA/FRR pro rychlou rekonvergenci.
- BGP: směrování podle politik, MED/LocalPref/prepending AS-Path; blackhole/RPZ pro zmírnění dopadů DDoS.
- SD-WAN: dynamický výběr cesty (SLA: loss/latency/jitter), FEC, duplikace paketů; segmentace provozu.
Adresace, MTU a fragmentace
- IPv4/IPv6: SLAAC/DHCPv6, zabezpečení ND (RA-Guard), dual-stack oproti NAT64/DNS64.
- MTU: Path MTU Discovery, úprava MSS na okraji tunelů (IPsec/GRE/VXLAN) k eliminaci fragmentace.
DNS, DHCP, NTP a jejich vliv na výkon
- DNS: latence překladu jmen, míra zásahů do cache, ECS (EDNS Client Subnet) v sítích CDN, režie DNSSEC.
- DHCP: vyčerpání fondů adres, chybné relaye (IP helper), konflikty adres.
- NTP/PTP: nekonzistentní čas komplikuje korelaci logů; PTP pro nízkolatenční finanční/OT sítě.
Observabilita: logy, metriky, trasy a události
- Centralizace: syslog (strukturovaný), NetFlow/IPFIX, SNMP trapy do SIEM/TSDB; korelace s metrikami APM aplikací.
- Distribuované trasování: OpenTelemetry – propojení síťových a aplikačních tras (span/trace id).
- Dashboardy: 95./99. percentil latence, vytížení linek, chybovost portů, mapy závislostí.
Automatizace a deklarativní správa
- Konfigurační modely: YANG/NETCONF/RESTCONF, gNMI; „source of truth“ (Git) a kanály CI/CD.
- Šablony: Jinja2, validace podle schémat; testy tranzitní sítě (Batfish) před nasazením.
- Soulad s předpisy: detekce odchylek konfigurace, automatická náprava, řízení přístupu podle rolí.
Bezpečnost provozu (NDR, IDS/IPS, Zero Trust)
- NDR/IDS: behaviorální analýza toků (DGA, beaconing), otisky TLS (JA3/JA4), detekce laterálního pohybu.
- Segmentace: VRF/VLAN/SGT/ACL, mikrosegmentace (hostitelský firewall, SDP).
- Šifrování: IPsec/DTLS/MACsec; vliv na MTU a telemetrii (omezená viditelnost na L7).
- DDoS: RTBH, flowspec, čištění provozu; rate-limit řídicí roviny (CoPP).
Wi-Fi a mobilní přístup jako součást správy provozu
- RRM: plánování kanálů, šířky (2,4: 20 MHz; 5: 40/80 MHz podle hustoty; 6 GHz přednostně 80 MHz), vyvážení vysílacího výkonu.
- Zkušenost klientů: rozložení SNR, opakované pokusy, doba roamingu, kategorie zařízení; band steering a minimální RSSI.
- Kvalita hlasu/VC: správné nastavení SSID (co nejméně SSID), WMM/EDCA, mapování DSCP přes WLAN, limity PPS.
Plánování kapacity a modelování
- Analýza trendů: 95. percentil využití linek, špičky, denní/měsíční sezónnost.
- Scénáře „co kdyby“: simulace přesměrování, výpadků a migrací (např. změny Anycastu, nový uplink).
- CDN/Peering: optimalizace cest k uzlům pro doručování obsahu, měření RTT k anycastovým IP adresám.
Provozní procesy: NOC, incidenty a řízení změn
- Řízení incidentů: závažnost, SLA, eskalační matice; komunikační šablony.
- Řízení problémů: analýza hlavní příčiny (RCA), prevence opakování, znalostní báze.
- Řízení změn: údržbová okna, testy před změnou, plán návratu k předchozímu stavu, canary nasazení.
Kontrolní seznam pro rychlou diagnostiku
- Je problém lokální, nebo plošný? (telemetrie, heatmapy, stav uplinků)
- Nejsou na portech chyby? Odpovídá duplex, rychlost a optika? (CRC, LOS, vysílací/přijímací výkon)
- Fungují ARP/ND/DHCP/DNS? (úskalí: zastaralé záznamy ARP, vyčerpaný fond adres, pomalé DNS)
- Je na cestě správné MTU/MSS? (bit DF, tunely, PMTUD)
- Je směrování symetrické? (ECMP, PBR, NAT)
- Nedegraduje QoS klíčové třídy? (zahazování paketů v prioritní frontě, aktivní shaping)
- Nezablokovaly provoz bezpečnostní prvky? (IPS, GeoIP, politika firewallu)
Tabulka běžných příznaků a příčin
| Příznak | Pravděpodobná příčina | Ověření/řešení |
| Vysoká latence na WAN | Řazení paketů do front, bufferbloat | AQM (FQ-CoDel), shaping podle CIR, audit QoS |
| Náhodné výpadky | Kolísání linky, změny topologie STP | Změny topologie v syslogu/STP, výměna kabelu nebo hardwaru |
| Vypadává VPN | MTU v tunelu, opětovná výměna klíčů, ztráty | Omezení MSS, PMTUD, profil SA, stabilita RTT |
| Pomalé weby | DNS, handshake TLS, přetížená cesta | RUM a syntetické testy, RTT TCP SYN/ACK, změna peeringu |
| Špatná Wi-Fi | CCI/ACI, nízké SNR, „přilepení“ klientů | Audit RRM, minimální RSSI, band steering, kanály |
Správa konfigurací a inventář
- Inventarizace: jedinečné identifikátory zařízení, modulů a rozhraní; mapy topologie (L2/L3) a závislostí.
- Zálohy: verze konfigurací, referenční obraz; automatické zálohy při změně (spouštěč syslogu, webhook API).
Soulad s předpisy, audit a připravenost na forenzní analýzu
- Uchovávání dat: pcap krátkodobě (minuty–hodiny), data o tocích (dny–měsíce), logy (měsíce–roky podle regulace).
- Časová synchronizace: jednotný čas pro korelaci událostí; ověřování zdrojů NTP.
- Soukromá data: minimalizace osobních údajů (PII) v datech o tocích a logu; řízení přístupu k telemetrii.
Osvědčené postupy pro dlouhodobou stabilitu
- Definujte SLO pro klíčové služby a měřte je z pohledu uživatele (syntetické testy + RUM).
- Standardizujte politiky QoS napříč okrajovými zařízeními i jádrem sítě; kontrolujte zahazování paketů ve frontách.
- Automatizujte konfiguraci (deklarativní IaC), ověřujte změny offline a používejte canary nasazení.
- Udržujte „source of truth“ a grafy topologie; vizualizujte závislosti (aplikace ↔ síť).
- Pravidelně testujte obnovu (záloha/obnovení), plán DR a simulujte výpadky (game days).
Závěr
Profesionální diagnostika a správa síťového provozu kombinuje kvalitní telemetrii, promyšlené QoS, robustní směrování, automatizaci a jasně definované provozní procesy. Díky měřitelným SLI/SLO, konzistentním konfiguracím a průběžné analýze toků lze předcházet incidentům, rychle řešit problémy a dlouhodobě optimalizovat náklady i uživatelskou zkušenost.
