Lista kontrolna przeglądu projektu dotycząca niezawodności

Ta lista kontrolna przedstawia zestaw zaleceń, których można użyć do oceny strategii niezawodności, odporności i odzyskiwania po awarii w projekcie architektury. W celu zapewnienia niezawodności zidentyfikuj najlepszą infrastrukturę i projekt aplikacji dla swojego obciążenia roboczego. Podejmij te decyzje na podstawie wymagań biznesowych mapowanych na metryki docelowe dostępności i możliwości odzyskiwania.

Aby zaimplementować niezawodny projekt, dokładnie rozważ punkty decyzyjne w projekcie i pamiętaj o tym, jak te decyzje wpływają na obciążenie. Ta lista kontrolna i towarzyszące przewodniki zawierają zasoby ułatwiające podejmowanie tych decyzji. Spraw, aby niezawodność obciążeń była istotnym aspektem cyklu projektowania, rozwijania i eksploatacji.

Lista kontrolna

Podejdź do projektowania z naciskiem na niezawodność, aby zapewnić, że tworzysz projekt, który jest odporny, łatwy w zarządzaniu i powtarzalny. Jeśli nie uwzględnisz praktyk dotyczących niezawodności i rozważysz kompromisy, projekt jest potencjalnie zagrożony. Starannie zastanów się nad wszystkimi punktami, które zostały uwzględnione na liście kontrolnej, aby zaszczepić zaufanie do sukcesu systemu.

  Code Zalecenie
☐ RE:01 Skoncentruj się na projektowaniu pracy, aby była prosta i efektywna. Użyj praktycznego podejścia, aby uniknąć niepotrzebnej złożoności podczas spełniania celów i wymagań biznesowych.
☐ RE:02 Identyfikowanie i ocenianie przepływów użytkowników i systemów. Użyj skali krytycznej na podstawie wymagań biznesowych, aby określić priorytety przepływów.
☐ RE:03 Użyj analizy trybu awarii (FMA), aby zidentyfikować potencjalne błędy w obciążeniu. Zidentyfikuj zależności i punkty awarii oraz opracuj strategie ograniczania ryzyka dla tych awarii.
☐ RE:04 Zdefiniuj cele niezawodności i odzyskiwania dla Twojego obciążenia. Użyj celów, aby kierować projektem i jako podstawę modelu zdrowia.
☐ RE:05 Dodaj nadmiarowość na różnych poziomach, szczególnie w przypadku przepływów krytycznych, aby pomóc spełnić cele dotyczące niezawodności. Rozważ nadmiarowe składniki infrastruktury, takie jak zasoby obliczeniowe i sieć, a także wiele wystąpień rozwiązania.
☐ RE:06 Zaimplementuj terminową i niezawodną strategię skalowania na poziomie aplikacji, danych i infrastruktury. Bazuj strategię skalowania na rzeczywistych lub przewidywanych wzorcach użycia i minimalizuj interwencję ręczną.
☐ RE:07 Wzmocnij odporność swojego obciążenia roboczego, wdrażając środki samoodnowy i samonaprawy. Korzystaj z wbudowanych funkcji i dobrze ugruntowanych wzorców chmurowych, aby zapewnić, że obciążenie pozostaje funkcjonalne w trakcie incydentów i odzyskuje sprawność po ich wystąpieniu.
☐ RE:08 Przetestuj scenariusze odporności i dostępności, stosując zasady inżynierii chaosu. Użyj testów niezawodności, aby sprawdzić, czy Twoje obciążenie robocze może wytrzymać awarie, skalować się odpowiednio do zapotrzebowania i odzyskiwać sprawność w ramach zdefiniowanych celów.
☐ RE:09 Zaimplementuj strukturizowane, przetestowane i udokumentowane plany odzyskiwania po awarii odpowiadające celom odzyskiwania. Plany muszą obejmować wszystkie składniki i cały system.
☐ RE:10 Ciągłe mierzenie i śledzenie kondycji systemu przy użyciu wskaźników czasu pracy i niezawodności w składnikach i przepływach krytycznych. Upewnij się, że te dane są zachowywane i dostępne do obsługi terminowego wykrywania, reagowania i analizy po zdarzeniu.

Następne kroki

Zalecamy zapoznanie się z kompromisami dotyczącymi niezawodności, aby zapoznać się z innymi pojęciami.

kompromisy niezawodności