Zapasowe centrum danych – jak zapewnić ciągłość działania firmy po awarii?
Zapasowe centrum danych to druga, niezależna lokalizacja, do której można przenieść działanie kluczowych systemów IT w przypadku awarii podstawowego środowiska. Nie musi być stale wykorzystywane z pełną mocą, ale powinno być przygotowane tak, aby w określonym czasie przejąć najważniejsze aplikacje, dane i usługi przedsiębiorstwa.
Takie rozwiązanie jest jednym z elementów Disaster Recovery, czyli planu odtwarzania systemów po awarii. NIST wskazuje, że planowanie awaryjne może obejmować między innymi przeniesienie systemów do alternatywnej lokalizacji, wykorzystanie zapasowego sprzętu oraz procedury umożliwiające odzyskanie usług po poważnym zakłóceniu.
Dlaczego sam backup może nie wystarczyć?
Kopia zapasowa chroni dane, ale nie oznacza jeszcze, że firma szybko wznowi pracę.
Jeżeli główny serwer ulegnie awarii, przedsiębiorstwo może posiadać aktualny backup, a jednocześnie nie mieć przygotowanego środowiska, w którym można go natychmiast odtworzyć.
Do uruchomienia systemu potrzebne są również:
- serwery lub maszyny wirtualne,
- konfiguracja sieci,
- systemy operacyjne,
- bazy danych,
- odpowiednie licencje,
- dostęp użytkowników,
- połączenia z innymi aplikacjami,
- procedura przełączenia usług.
Dlatego plan ciągłości działania powinien obejmować zarówno dane, jak i infrastrukturę potrzebną do ich wykorzystania. NIST definiuje plan awaryjny jako zestaw działań obejmujących reakcję na zdarzenie, operacje zapasowe i odzyskiwanie systemów, których celem jest zachowanie dostępności kluczowych zasobów.
Jak działa zapasowe centrum danych?
W podstawowej lokalizacji działają systemy wykorzystywane na co dzień. W drugim ośrodku przygotowywane jest natomiast środowisko, które może przejąć ich funkcje po awarii.
W zależności od potrzeb dane mogą być przesyłane do lokalizacji zapasowej:
- okresowo w formie kopii,
- w określonych odstępach czasu,
- poprzez regularną replikację,
- niemal na bieżąco w przypadku najbardziej krytycznych systemów.
Im częściej synchronizowane są dane i im bardziej gotowa jest infrastruktura zapasowa, tym szybciej można zazwyczaj przywrócić działalność.
Przykładem takiego rozwiązania jest oferowane przez Polcom zapasowe centrum danych. Operator posiada dwa własne ośrodki data center w Skawinie i Alwerni, które są połączone dwoma niezależnymi trasami światłowodowymi i mogą być wykorzystywane do budowy środowisk zapasowych.
RTO – jak szybko system powinien wrócić do działania?
Nie każda aplikacja wymaga natychmiastowego odtworzenia. Dlatego przed projektowaniem środowiska zapasowego należy określić znaczenie poszczególnych systemów.
Jednym z najważniejszych wskaźników jest RTO – Recovery Time Objective. Określa on maksymalny akceptowalny czas, w którym system powinien zostać ponownie uruchomiony po awarii.
Jeżeli parametr RTO dla systemu sprzedażowego wynosi dwie godziny, infrastruktura i procedury powinny umożliwiać jego odzyskanie w tym czasie.
Nie ma jednak sensu ustalać najkrótszego możliwego RTO dla każdej aplikacji. Polcom zwraca uwagę, że wymagania powinny wynikać z rzeczywistej krytyczności systemu – rygorystyczne parametry dla aplikacji pomocniczej mogą jedynie niepotrzebnie zwiększać koszt całego rozwiązania.
RPO – ile danych firma może utracić?
Drugim ważnym parametrem jest RPO, czyli Recovery Point Objective. Określa maksymalną dopuszczalną utratę danych wyrażoną jako punkt w czasie, do którego powinny zostać odtworzone informacje.
Jeżeli RPO wynosi godzinę, firma zakłada, że po awarii może być konieczne odtworzenie danych sprzed maksymalnie godziny.
W praktyce krótsze RPO wymaga częstszej synchronizacji lub replikacji. Dlatego przedsiębiorstwo powinno najpierw określić znaczenie danych, a dopiero później dobierać technologię.
Dla systemu raportowego dopuszczalna może być utrata danych z kilku godzin. W przypadku systemu produkcyjnego, sprzedażowego czy transakcyjnego wymagania mogą być znacznie bardziej restrykcyjne.
Druga lokalizacja powinna być rzeczywiście niezależna
Zapasowe centrum danych powinno ograniczać ryzyko sytuacji, w której to samo zdarzenie unieruchamia lokalizację podstawową i zapasową.
Dlatego znaczenie ma odpowiednia odległość między ośrodkami oraz niezależność:
- zasilania,
- łączy telekomunikacyjnych,
- infrastruktury technicznej,
- urządzeń,
- systemów chłodzenia,
- dostępu fizycznego.
Jednocześnie lokalizacje nie mogą być od siebie całkowicie odizolowane – potrzebne jest wydajne połączenie umożliwiające przesyłanie danych i replikację.
Polcom wykorzystuje w tym celu dwa własne ośrodki w Skawinie i Alwerni. Firma wskazuje, że centra mają zbliżoną strukturę i poziom usług, a połączenie pomiędzy nimi pozwala budować redundantne środowiska.
Co właściwie powinno znaleźć się w ośrodku zapasowym?
Zakres zależy od znaczenia systemów i przyjętego scenariusza Disaster Recovery.
Środowisko może obejmować:
- zapasowe maszyny wirtualne,
- przestrzeń dyskową,
- repliki baz danych,
- systemy sieciowe,
- kopie konfiguracji,
- systemy bezpieczeństwa,
- zapasowe łącza,
- przygotowane procedury uruchamiania aplikacji.
W bardziej rozbudowanym modelu firma może potrzebować również miejsca pracy dla pracowników, jeśli zdarzenie uniemożliwia korzystanie z głównej siedziby.
Ważniejsza od infrastruktury jest procedura przełączenia
Posiadanie dwóch centrów danych nie wystarczy, jeśli firma nie wie, kiedy i w jaki sposób uruchomić środowisko zapasowe.
Plan Disaster Recovery powinien jasno określać:
- jakie zdarzenie uruchamia procedurę,
- kto podejmuje decyzję o przełączeniu,
- które systemy są uruchamiane jako pierwsze,
- jak sprawdzana jest poprawność danych,
- jak użytkownicy uzyskują dostęp,
- kto odpowiada za komunikację,
- w jaki sposób następuje późniejszy powrót do środowiska podstawowego.
Usługa Disaster Recovery Polcom obejmuje właśnie scenariusz przełączenia funkcji podstawowego ośrodka do centrum zapasowego, przy czym szczegółowy plan jest dostosowywany do charakteru działalności klienta.
Disaster Recovery trzeba regularnie testować
Jednym z największych błędów jest przygotowanie planu, który przez kolejne lata pozostaje wyłącznie dokumentem.
Środowisko IT cały czas się zmienia. Pojawiają się nowe aplikacje, aktualizacje, integracje, użytkownicy i inne wymagania biznesowe. Procedura działająca dwa lata wcześniej może nie odpowiadać aktualnej architekturze.
Test powinien sprawdzić między innymi:
- czy replikowane dane są dostępne,
- jak długo trwa uruchomienie środowiska,
- czy aplikacje startują w odpowiedniej kolejności,
- czy działają integracje,
- czy użytkownicy mogą się zalogować,
- czy osiągnięto zakładane RTO i RPO.
Polcom wskazuje testy odtworzeniowe jako warunek oceny, czy przyjęte wartości RTO i RPO są rzeczywiście osiągalne.
Jak ustalić kolejność odtwarzania systemów?
Firma powinna rozpocząć od analizy wpływu poszczególnych aplikacji na działalność.
Najwyższy priorytet powinny otrzymać systemy, bez których przedsiębiorstwo szybko przestaje realizować kluczowe procesy. Mogą to być na przykład:
- ERP,
- system produkcyjny,
- system magazynowy,
- platforma sprzedażowa,
- system finansowy,
- kluczowe bazy danych.
Dopiero później można odtwarzać aplikacje pomocnicze, archiwa czy systemy raportowe.
Takie podejście pozwala skoncentrować zasoby na tych obszarach, w których koszt przestoju jest największy, zamiast projektować całe środowisko według najbardziej restrykcyjnych parametrów.
Ciągłość działania wymaga planu, infrastruktury i ludzi
Zapasowe centrum danych może znacząco ograniczyć skutki poważnej awarii, ale nie jest samodzielnym rozwiązaniem problemu. Musi być elementem szerszego planu obejmującego replikację, backup, odpowiedzialność zespołu oraz procedury reagowania.
Polcom łączy w swoim portfolio zapasowe data center, Disaster Recovery, biuro zapasowe oraz inne usługi wspierające Business Continuity.
Najważniejszym celem jest szybkie odtwarzanie systemów po awarii zgodnie z wymaganiami konkretnego przedsiębiorstwa. Nie każda firma potrzebuje identycznego środowiska zapasowego, ale każda organizacja zależna od systemów IT powinna wiedzieć, ile czasu może działać bez swoich najważniejszych aplikacji i jak je odzyska, jeśli podstawowa infrastruktura przestanie być dostępna.
Przeczytaj poprzedni artykuł!
Jak trenować skuteczniej, gdy brakuje czasu na długie wizyty na siłowni?
