Cíle základní údržby OS
Základní údržba a správa operačního systému (OS) směřuje k zajištění dostupnosti, bezpečnosti, výkonu a předvídatelnosti prostředí, ve kterém běží aplikace a služby. Klíčovým principem je opakovatelnost a auditovatelnost – vše, co provádíte ručně, by mělo být možné zdokumentovat, automatizovat a znovu spustit bez závislosti na konkrétní osobě.
Plán údržby: perioda, odpovědnosti a okna
- Definujte okna údržby: pravidelné časy pro aktualizace, restartování a testy obnovy.
- Matice odpovědností (RACI): kdo schvaluje, provádí, kontroluje a informuje.
- Standardní provozní postupy (SOP): krokové návody pro běžné úkony, návrat k předchozímu stavu a eskalaci.
Aktualizace a správa balíčků
Aktualizace řeší bezpečnostní zranitelnosti, chyby i výkon. V distribucích Linuxu používejte správce balíčků (apt, dnf/yum, zypper, pacman), ve Windows Windows Update a případně winget nebo WSUS. Doporučení:
- Segmentace: vývoj → testování → předprodukční prostředí → produkční prostředí (kanárkové zavádění).
- Kategorizace oprav: bezpečnostní (urgentní) versus funkční (plánované).
- Závislosti: kontrola kolizí verzí a změn konfigurace.
- Automatizace: plánované úlohy s oznámením výsledku a přehledným protokolem.
Zálohování a obnova (BCP/DR)
- Strategie 3–2–1: 3 kopie, 2 různá média, 1 kopie mimo pracoviště.
- Typy záloh: plná, přírůstková, rozdílová; rotace podle hodnoty dat.
- Obnovitelnost: pravidelné testy obnovy (na úrovni souborů i bare-metal) s metrikami RTO/RPO.
- Šifrování a integrita: ochrana klíčů, kontrolní součty, podpisy.
Správa uživatelů, identit a přístupů
- Princip nejmenších oprávnění (PoLP): přidělujte pouze nezbytné role a skupiny.
- Centralizace správy identit: LDAP/AD, SSO, MFA; lokální účty pouze výjimečně a s auditováním.
- Privilegovaný přístup: profily
sudo, přístup Just-in-Time, kontrola sdílených tajemství. - Životní cyklus účtů: nástup, změna, odchod; pravidelný proces opětovné certifikace.
Bezpečnostní zpevnění
- Minimální instalace: odstraňte nepotřebné balíčky, služby a porty.
- Konfigurace jádra a služeb: sysctl, firewall (iptables/nftables, Windows Firewall), vypnutí SMBv1 a zastaralých protokolů.
- Ochrana před malwarem: seznamy reputace, antivirus/EDR, izolace služeb (sandbox, AppArmor/SELinux).
- Šifrování: disk (LUKS/BitLocker), data při přenosu (TLS), správná správa certifikátů.
- Zásady pro hesla a klíče: plány rotace, KMS, audit klíčového materiálu.
Monitoring, metriky a upozorňování
- Sběr metrik: CPU, paměť, I/O, latence, teplota, využití disku, stav služeb.
- Správa protokolů: centralizace (SIEM/ELK), doba uchovávání, korelace událostí.
- Prahové hodnoty a SLO: definujte limity a výstrahy s potlačením duplicit (deduplikací).
- Runbooky: pro každou výstrahu existuje jasný postup řešení a matice kontaktů.
Výkon a kapacitní plánování
- Profilování zátěže: typické špičky, sezónnost, kombinace zátěže (CPU-bound, IO-bound, RAM-bound).
- Optimalizace: plánovač, prioritizace procesů, NUMA, hugepages pro specifické typy zátěže.
- Vrstvy mezipaměti a úložiště: správná volba souborového systému (ext4, XFS, ZFS, ReFS), TRIM, zarovnání, úrovně RAID.
- Kapacitní modely: scénáře „co když“, kapacitní rezerva, práh pro vertikální či horizontální škálování.
Síťová konfigurace a údržba
- Evidence rozhraní a VLAN: standardizace názvů, MTU, QoS.
- Firewall a ACL: výchozí zákaz, výslovně povolená pravidla, revize pravidel.
- DNS/DHCP: spolehlivé překládání názvů, split-horizon, rezervace, krátké TTL u měnících se služeb.
- Bezpečný vzdálený přístup: SSH s klíči, RDP přes VPN, bastion host, záznam relací.
Automatizace a konfigurace jako kód
- Správa konfigurace: deklarativní nástroje (Ansible, Puppet, Chef) a idempotentní playbooky.
- Šablony a proměnné: oddělení tajemství (Vault), opětovné využití konfigurací napříč prostředími.
- CI/CD pro správu OS: pipeline pro testování playbooků, linting, kanárkové zavádění.
- Plánovač úloh: systemd timers/cron s protokoly a oznámeními; vyhýbejte se „tichým“ skriptům.
Správa služeb a procesů
- Správce služeb: systemd/sc, zásady obnovy (Restart=on-failure), kontroly stavu.
- Jednoúčelové jednotky: oddělte dlouhodobě běžící služby od jednorázových úloh; po dokončení běhu vyčistěte prostředí.
- Ukládání stavů: vyhněte se nekontrolovanému zapisování do dočasných umístění (tmp, var-run), standardizujte adresáře.
Provoz v kontejnerech a virtualizaci
- Zlatý obraz: verze OS a základní bezpečnostní konfigurace jako šablona (VM/kontejner).
- Hygiena kontejnerů: minimální image, pevně určené verze, provoz bez oprávnění root, systém souborů pouze pro čtení, profily seccomp.
- Orchestrace: kontroly připravenosti a živosti, limity zdrojů, průběžná aktualizace, tajemství z externích KMS.
Správa protokolů a audit
- Normalizace: jednotný formát a časová pásma (UTC), synchronizace času (NTP/Chrony).
- Doba uchovávání a právní požadavky: odstupňovaná doba uchovávání, ochrana proti manipulaci (úložiště WORM).
- Detekce anomálií: korelace, výchozí profil chování, výstrahy při odchylkách.
Správa konfigurace a verzování
- Repozitář konfigurací: Git s pull requesty, revizí kódu a značkami verzí.
- Řízení změn: tiket RFC, hodnocení rizik, plán návratu, komunikace se zainteresovanými stranami.
- Detekce odchylek: porovnání aktuálního stavu s deklarativní konfigurací, automatická náprava.
Ochrana koncových bodů a EDR
- Evidence zařízení: CMDB s vazbou na vlastnictví a kritičnost.
- Zásady pro zařízení: šifrování, firewall, omezení USB, seznam povolených aplikací.
- EDR/XDR: detekce chování, izolace hostitele, forenzní stopy.
Správa času a synchronizace
- NTP/Chrony: redundantní zdroje času, monitoring odchylek.
- Časové pásmo: standardizace na UTC na serverech; správné zobrazování v aplikacích.
Správa úložišť a souborových systémů
- Kontrola stavu disků: SMART, prediktivní výměny, monitoring latencí.
- Integrita souborových systémů: pravidelné kontroly, snímky (LVM/ZFS), kvóty a deduplikace tam, kde to dává smysl.
- Zálohy konfigurací úložišť: řadiče RAID/NAS/SAN, multipath, verze firmwaru.
Licencování a compliance
- Evidence licencí: OS a komerční komponenty, konec podpory.
- Konfigurační benchmarky: interní standardy a rámce (podobné CIS), pravidelné kontroly shody.
- Záznam změn: auditní stopa pro externí audit a rekonstrukci incidentu.
Reakce na incidenty a správa problémů
- Runbook pro incidenty: detekce, třídění, zmírnění dopadů, komunikace, evidence.
- Analýza po incidentu: bez obviňování, akční položky s termíny, měření regresí.
- Proaktivní správa problémů: hledání kořenových příčin opakujících se potíží.
Dokumentace, inventář a znalostní báze
- CMDB: vztahy mezi aktivy: služby → servery → konfigurace → závislosti.
- Runbooky a znalostní báze: stručné postupy s přílohami (příkazy, očekávané výstupy).
- Aktualizace dokumentace: povinný krok v každém RFC/PR; dokumentace je výstupem každého vydání.
Pravidelné kontroly provozního stavu
- Stav služeb: běžící jednotky, nefunkční jednotky, počet restartů.
- Disk a souborový systém: volné místo, využití i-uzlů, fragmentace, stav snímků.
- Bezpečnost: neúspěšná přihlášení, změny sudoers, expirované certifikáty.
- Zálohy: poslední úspěšná záloha, velikost rozdílové zálohy, rychlost obnovy.
Osvědčené postupy pro heterogenní prostředí (Linux/Windows/BSD)
- Standardizace: společné zásady protokolování, instalace oprav, pojmenování, označování v cloudu.
- Nástroje na míru: PowerShell DSC/GPO pro Windows; systemd/Ansible pro Linux/BSD.
- Integrace do SIEM/CMDB: jednotné identifikátory hostitelů a služeb.
Kontrolní seznam základní údržby OS
- Aktuální úroveň oprav a naplánované okno pro restartování.
- Vynucené šifrování disku a správná rotace klíčů/certifikátů.
- Funkční zálohy a provedený test obnovy během posledních 90 dnů.
- Centralizované protokoly a aktivní výstrahy pro klíčové metriky.
- Aktualizované SOP/runbooky, CMDB a dokumentace změn.
- Audity účtů, skupin a privilegovaných přístupů.
- Kontrola kapacity (disk, RAM, CPU) a plán škálování.
Závěr
Kvalitní základní údržba OS je disciplína, která kombinuje procesy, automatizaci a průběžné měření. Standardizujte prostředí, spravujte konfiguraci jako kód, vyhodnocujte rizika a udržujte připravené scénáře pro obnovu a řešení incidentů. Dlouhodobě tak snížíte MTTR, zvýšíte dostupnost a předejdete neplánovaným výpadkům i bezpečnostním incidentům.
