Diagnostika a správa síťového provozu: protokoly a nástroje pro monitoring

Diagnostika a správa síťového provozu: Protokoly a nástroje pro monitoring

Cíle diagnostiky a správy síťového provozu

Diagnostika a správa síťového provozu (Network Operations & Observability) zahrnuje systematické měření, analýzu a řízení toků dat napříč vrstvami OSI s cílem zajistit dostupnost, výkon, bezpečnost a předvídatelnost. Klíčové je stanovit metriky kvality (SLI/SLO), vybudovat sběr telemetrie v reálném čase a uplatňovat řízení provozu (QoS, shaping, směrování) i procesy reakce na incidenty.

Referenční rámec: vrstvy OSI/TCP/IP a typické poruchy

  • L1–L2 (fyzická/linková): chybovost na portech, nesoulad duplexu, smyčky STP, chyby VLAN/Trunk, rušení RF u Wi-Fi.
  • L3 (síťová): chybné směrovací tabulky, asymetrické cesty, MTU/fragmentace, zahazování paketů podle ACL.
  • L4–L7 (transportní/aplikační): vyčerpání portů, retransmise TCP, chyby TLS, latence DNS, problémy služeb.

Klíčové metriky a ukazatele (SLI/SLO)

kategorie Metrika Interpretace
Dostupnost Uptime, Loss (%) Ztráta paketů < 0,1–1 % u interaktivních služeb
Výkon Latency, Jitter (ms) Hlas/VC: RTT < 150 ms, jitter < 30 ms
Propustnost Throughput (Mb/s) 95. percentil při zátěži
Spolehlivost TCP Retrans (%), Out-of-order Retrans < 2–3 % u WAN
Bezpečnost Flows/min, anomálie Detekce DDoS, skenování portů, exfiltrace dat

Sběr telemetrie: NetFlow/IPFIX, sFlow a streamovaná telemetrie

  • NetFlow/IPFIX: vzorkovaný/nevzorkovaný export toků (5-tuple, bajty, pakety, trvání, ToS/DSCP); vhodné pro plánování kapacity a detekci anomálií.
  • sFlow: vzorkování paketů na L2–L4 + čítače; velmi dobře škálovatelné pro top-of-rack a fabric datového centra.
  • Model-driven telemetry: gNMI/GPB/JSON, modely YANG; push stream oproti SNMP pull, nižší latence a režie.
  • SNMPv3: základní čítače (ifIn/OutErrors, Discards), teplota/napájení; vyžaduje autorizaci a šifrování.

Aktivní a pasivní měření

  • Aktivní: ping, traceroute/mtr, TWAMP/OWAMP (jednosměrné/obousměrné zpoždění, jitter, ztráty), syntetické transakce HTTP/DNS.
  • Pasivní: span/tap + pcap (tcpdump, Wireshark), NetFlow/IPFIX, sondy eBPF v hostitelích.
  • RUM (Real User Monitoring): měření z prohlížeče/klienta – DNS/TCP/TLS/TTFB, latence z pohledu uživatele.

Diagnostické nástroje a postupy

  • L2: show interfaces (CRC, FCS, alignment), show spanning-tree, sousedé LLDP/CDP, flapping MAC tabulky.
  • L3: show ip route, traceroute (asymetrie), zjišťování MTU cesty (ping -M do, bit DF), analýza ECMP.
  • L4–L7: tcpdump/pcap (SYN, SYN/ACK, velikost okna, SACK, RTT), analýza handshaku TLS, stavové kódy HTTP a TTFB.
  • Wi-Fi: spektrální analýza, režie beacon/probe, využití kanálu, opakované pokusy, MCS, roaming (802.11k/v/r).

Řešení problémů krok za krokem (runbook)

  1. Potvrzení příznaku: reprodukce, sběr časových značek, ověření rozsahu (hostitel/zóna/lokalita).
  2. Rychlá telemetrie: ping/jitter/loss, mtr; kontrola chyb portů, CPU, paměti a teplot.
  3. Izolace vrstvy: ARP/ND, DHCP/DNS, smyčky L2, směrování, ACL/NAT, TLS.
  4. Hypotéza a test: změna cesty, značení DSCP, snížení MSS/MTU, dočasné vypnutí offloadů.
  5. Náprava: politika QoS, změna směrování, rate-limit/shaping, oprava hardwaru/kabelu, aktualizace firmwaru.
  6. Post-mortem: strom příčin (5× proč), akční úkoly, aktualizace runbooku.

QoS: klasifikace, značení a plánování front

  • Klasifikace: L2 CoS (802.1p), L3 DSCP (EF, AFxy, CSx), NBAR/L7; mapování do výstupních front.
  • Fronty: CBWFQ, LLQ (prioritní fronta pro hlas/video), WRED/ECN jako signál přetížení.
  • Shaping vs. Policing: shaping vyrovnává špičky (token bucket), policing zahazuje pakety nebo mění jejich značení; shaping používejte na okrajích WAN.
  • Bufferbloat a AQM: FQ-CoDel/PIE zkracují latenci při plném zatížení.

Směrování a řízení cest

  • IGP: OSPF/ISIS – páteřní síť, ladění cost/metric, LFA/FRR pro rychlou rekonvergenci.
  • BGP: směrování podle politik, MED/LocalPref/prepending AS-Path; blackhole/RPZ pro zmírnění dopadů DDoS.
  • SD-WAN: dynamický výběr cesty (SLA: loss/latency/jitter), FEC, duplikace paketů; segmentace provozu.

Adresace, MTU a fragmentace

  • IPv4/IPv6: SLAAC/DHCPv6, zabezpečení ND (RA-Guard), dual-stack oproti NAT64/DNS64.
  • MTU: Path MTU Discovery, úprava MSS na okraji tunelů (IPsec/GRE/VXLAN) k eliminaci fragmentace.

DNS, DHCP, NTP a jejich vliv na výkon

  • DNS: latence překladu jmen, míra zásahů do cache, ECS (EDNS Client Subnet) v sítích CDN, režie DNSSEC.
  • DHCP: vyčerpání fondů adres, chybné relaye (IP helper), konflikty adres.
  • NTP/PTP: nekonzistentní čas komplikuje korelaci logů; PTP pro nízkolatenční finanční/OT sítě.

Observabilita: logy, metriky, trasy a události

  • Centralizace: syslog (strukturovaný), NetFlow/IPFIX, SNMP trapy do SIEM/TSDB; korelace s metrikami APM aplikací.
  • Distribuované trasování: OpenTelemetry – propojení síťových a aplikačních tras (span/trace id).
  • Dashboardy: 95./99. percentil latence, vytížení linek, chybovost portů, mapy závislostí.

Automatizace a deklarativní správa

  • Konfigurační modely: YANG/NETCONF/RESTCONF, gNMI; „source of truth“ (Git) a kanály CI/CD.
  • Šablony: Jinja2, validace podle schémat; testy tranzitní sítě (Batfish) před nasazením.
  • Soulad s předpisy: detekce odchylek konfigurace, automatická náprava, řízení přístupu podle rolí.

Bezpečnost provozu (NDR, IDS/IPS, Zero Trust)

  • NDR/IDS: behaviorální analýza toků (DGA, beaconing), otisky TLS (JA3/JA4), detekce laterálního pohybu.
  • Segmentace: VRF/VLAN/SGT/ACL, mikrosegmentace (hostitelský firewall, SDP).
  • Šifrování: IPsec/DTLS/MACsec; vliv na MTU a telemetrii (omezená viditelnost na L7).
  • DDoS: RTBH, flowspec, čištění provozu; rate-limit řídicí roviny (CoPP).

Wi-Fi a mobilní přístup jako součást správy provozu

  • RRM: plánování kanálů, šířky (2,4: 20 MHz; 5: 40/80 MHz podle hustoty; 6 GHz přednostně 80 MHz), vyvážení vysílacího výkonu.
  • Zkušenost klientů: rozložení SNR, opakované pokusy, doba roamingu, kategorie zařízení; band steering a minimální RSSI.
  • Kvalita hlasu/VC: správné nastavení SSID (co nejméně SSID), WMM/EDCA, mapování DSCP přes WLAN, limity PPS.

Plánování kapacity a modelování

  • Analýza trendů: 95. percentil využití linek, špičky, denní/měsíční sezónnost.
  • Scénáře „co kdyby“: simulace přesměrování, výpadků a migrací (např. změny Anycastu, nový uplink).
  • CDN/Peering: optimalizace cest k uzlům pro doručování obsahu, měření RTT k anycastovým IP adresám.

Provozní procesy: NOC, incidenty a řízení změn

  • Řízení incidentů: závažnost, SLA, eskalační matice; komunikační šablony.
  • Řízení problémů: analýza hlavní příčiny (RCA), prevence opakování, znalostní báze.
  • Řízení změn: údržbová okna, testy před změnou, plán návratu k předchozímu stavu, canary nasazení.

Kontrolní seznam pro rychlou diagnostiku

  1. Je problém lokální, nebo plošný? (telemetrie, heatmapy, stav uplinků)
  2. Nejsou na portech chyby? Odpovídá duplex, rychlost a optika? (CRC, LOS, vysílací/přijímací výkon)
  3. Fungují ARP/ND/DHCP/DNS? (úskalí: zastaralé záznamy ARP, vyčerpaný fond adres, pomalé DNS)
  4. Je na cestě správné MTU/MSS? (bit DF, tunely, PMTUD)
  5. Je směrování symetrické? (ECMP, PBR, NAT)
  6. Nedegraduje QoS klíčové třídy? (zahazování paketů v prioritní frontě, aktivní shaping)
  7. Nezablokovaly provoz bezpečnostní prvky? (IPS, GeoIP, politika firewallu)

Tabulka běžných příznaků a příčin

Příznak Pravděpodobná příčina Ověření/řešení
Vysoká latence na WAN Řazení paketů do front, bufferbloat AQM (FQ-CoDel), shaping podle CIR, audit QoS
Náhodné výpadky Kolísání linky, změny topologie STP Změny topologie v syslogu/STP, výměna kabelu nebo hardwaru
Vypadává VPN MTU v tunelu, opětovná výměna klíčů, ztráty Omezení MSS, PMTUD, profil SA, stabilita RTT
Pomalé weby DNS, handshake TLS, přetížená cesta RUM a syntetické testy, RTT TCP SYN/ACK, změna peeringu
Špatná Wi-Fi CCI/ACI, nízké SNR, „přilepení“ klientů Audit RRM, minimální RSSI, band steering, kanály

Správa konfigurací a inventář

  • Inventarizace: jedinečné identifikátory zařízení, modulů a rozhraní; mapy topologie (L2/L3) a závislostí.
  • Zálohy: verze konfigurací, referenční obraz; automatické zálohy při změně (spouštěč syslogu, webhook API).

Soulad s předpisy, audit a připravenost na forenzní analýzu

  • Uchovávání dat: pcap krátkodobě (minuty–hodiny), data o tocích (dny–měsíce), logy (měsíce–roky podle regulace).
  • Časová synchronizace: jednotný čas pro korelaci událostí; ověřování zdrojů NTP.
  • Soukromá data: minimalizace osobních údajů (PII) v datech o tocích a logu; řízení přístupu k telemetrii.

Osvědčené postupy pro dlouhodobou stabilitu

  • Definujte SLO pro klíčové služby a měřte je z pohledu uživatele (syntetické testy + RUM).
  • Standardizujte politiky QoS napříč okrajovými zařízeními i jádrem sítě; kontrolujte zahazování paketů ve frontách.
  • Automatizujte konfiguraci (deklarativní IaC), ověřujte změny offline a používejte canary nasazení.
  • Udržujte „source of truth“ a grafy topologie; vizualizujte závislosti (aplikace ↔ síť).
  • Pravidelně testujte obnovu (záloha/obnovení), plán DR a simulujte výpadky (game days).

Závěr

Profesionální diagnostika a správa síťového provozu kombinuje kvalitní telemetrii, promyšlené QoS, robustní směrování, automatizaci a jasně definované provozní procesy. Díky měřitelným SLI/SLO, konzistentním konfiguracím a průběžné analýze toků lze předcházet incidentům, rychle řešit problémy a dlouhodobě optimalizovat náklady i uživatelskou zkušenost.