Usługi / Administracja IT
OperacjeDay-2 z właścicielem, oknem i śladem
Przejmujemy albo wspieramy utrzymanie: hosty, wirtualizację, tożsamość, kopie i dyżur. Proxmox albo inna platforma ma mapę. Grafana pokazuje zdrowie. Backup ma test restore. Zmiana ma okno, nie przypadek.
Jedna mapa systemów, jeden kanał eskalacji
Administracja bez obserwowalności reaguje po fakcie. Backup bez restore to założenie. Składamy konsolę platformy, klaster, alerty i kopie w jeden dyżur.
- Patch management obejmuje hosty, hypervisory i gości, z kolejnością zależną od HA.
- Tożsamość i MFA są częścią retaineru, nie osobnym projektem raz na rok.
Datacenter, który widać w jednej konsoli
Proxmox VE na klastrze: węzły, VM, kontenery, storage i HA. Patch i migracja żywej maszyny są w kalendarzu. Dostęp root nie jest codziennym narzędziem.
Inwentarz
Maszyny, CT, sieć i storage z właścicielem. Złote obrazy zamiast ręcznego installera na każdej VM.
Okna
Aktualizacje węzłów i gości z PDB albo kolejnością HA. Cofnięcie jest w planie, nie w nadziei.
Dostęp
Konta imienne, 2FA, osobny jump. Log każdego logowania i zadania w klastrze.
Pojemność
CPU, RAM i storage z progiem. Rozbudowa zanim gość zacznie swapować.
Kontenery pod tą samą opieką co VM
Gdy część usług jest na klastrze, administracja obejmuje węzły, certyfikaty, storage class i upgrade. Nie zostawiamy Kubernetesu jako wyspy poza dyżurem.
Węzły
Patch OS, kubelet i runtime w oknie. Drain i cordon, nie reboot w południe.
Addony
Ingress, DNS, storage, cert-manager. Wersje i backup konfiguracji są spisane.
Obserwacja
Zdrowie poda i węzła w Grafanie, nie tylko w dashboardzie ad hoc.
Granica
RBAC i NetworkPolicy. Administracja nie oznacza cluster-admin na stałe.
Alert zanim użytkownik zadzwoni
Host, VM, klaster i usługa mają dashboard. Disk, certyfikat, backup i kolejka mają próg. Dyżur dostaje priorytet i runbook, nie zrzut z Nagiosa bez kontekstu.
Zakres
Linux, Windows tam gdzie jest, baza, kolejka, HTTP. Jedna lista ciszy na utrzymanie.
Priorytet
P1 to utrata usługi. P3 to zbliżający się certyfikat. Nie wszystko budzi o trzeciej.
Korelacje
Host i aplikacja obok siebie. Awaria storage nie wygląda jak tajemniczy timeout API.
Raport
Tydzień: ile alertów, ile okien, co zostało otwarte. Materiał na przegląd z Wami.
Kopia, którą da się odtworzyć
Proxmox Backup Server albo drugi tor poza lokalizacją. Retencja, immutability i test restore są w umowie. Nieudane zadanie to alert, nie cichy mail.
Zakres
VM, CT, bazy i konfiguracja. Sekret vault poza tym samym bucktem co dane aplikacji.
RPO i RTO
Spisane per system. Restore pojedynczego pliku i całej maszyny są ćwiczone.
Osobny tor
Druga kopia na innych kontach. Ransomware na produkcji nie kasuje jedynej kopii.
Ludzie
Kto odtwarza, w jakiej kolejności, z jakim DNS. Playbook dostępny offline.
Od przejęcia do rytmu tygodnia
Najpierw inwentaryzacja i dostęp. Potem baseline monitoringu i kopii. Na końcu okna, IAM i raport.
- Przejęcie Mapa hostów, kont, kopii, kto ma klucz, jaki SLA.
- Baseline Monitoring, backup, pierwsze okna, wyłączenie zbędnego dostępu.
- Rytm Patch, przegląd alertów, test restore, wniosek o zmianę.
- Dyżur Eskalacja, raport, materiał pod audyt zmian.
Omówimy mapę systemów, dyżur i okna
Na tej podstawie przygotujemy zakres opieki administracyjnej.
Skontaktuj się