Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
"Lift and shift" w kontekście obliczeń o wysokiej wydajności (HPC) głównie odnosi się do procesu przenoszenia środowiska lokalnego i obciążeń roboczych do chmury. Idealnie modyfikacje powinny być ograniczone do minimum (na przykład aplikacje, harmonogramy zadań i ich konfiguracje powinny pozostać w większości takie same). Dostosowania w zakresie magazynowania i sprzętu są naturalne, ponieważ zasoby różnią się między rozwiązaniami lokalnymi a platformami chmurowymi. Dzięki podejściu lift and shift organizacje mogą szybciej zacząć korzystać z chmury.
Typowa rycina przedstawia lokalny klaster HPC w środowisku produkcyjnym, który producent sprzętu często dostarcza. Taka lokalna infrastruktura obejmuje zestaw węzłów obliczeniowych, które mogą, ale nie muszą, współpracować z obrazami maszyn wirtualnych i kontenerami. Takie węzły wykonują zadania zarządzane przez harmonogram zadań, którymi mogą być zazwyczaj Slurm, PBS lub LSF. Obciążenia pochodzą od wielu użytkowników, którzy mają związek z zarządzaniem tożsamością. Zwykle istnieją katalogi domowe, dyski tymczasowe i długoterminowe przechowywanie danych. Dostępne są również pewne formy monitorowania w celu sprawdzenia wydajności zadań i kondycji węzłów obliczeniowych. Użytkownicy mogą uzyskać dostęp do środowiska za pośrednictwem wiersza poleceń, przeglądarek lub technologii zdalnej wizualizacji. Całe środowisko jest hostowane w prywatnej sieci, więc użytkownicy mają możliwość dostępu do ośrodka obliczeniowego, albo przez VPN, albo przez portal.
Jak widać w tym dokumencie, środowisko w chmurze zgodne z modelem Infrastructure-as-a-Service, koncepcyjnie rzecz biorąc, nie różni się tak bardzo. Niektóre technologie wymagają aktualizacji, a niektóre kroki podczas migracji z lokalnych środowisk do chmury są konieczne.
W związku z tym niniejszy dokument:
- Przegląda opcje procesu migracji.
- Zapewnia wskazówki dotyczące produktów i najlepszych praktyk dla każdego komponentu.
- Oraz przedstawia zalecenia, aby uniknąć pułapek w procesie.
Zanim przejdziemy do opisu architektury, warto zrozumieć różne persony w tym kontekście, ich potrzeby i oczekiwania.
Osoby i doświadczenie użytkownika
Istnieją różne osoby, które muszą uzyskać dostęp do środowiska HPC. Ich działania i sposób, w jaki wchodzą w interakcje ze środowiskiem, różnią się znacznie.
Użytkownik końcowy (inżynier / naukowiec / badacz)
Ta persona reprezentuje eksperta w danej dziedzinie (na przykład biologa, fizyka, inżyniera itp.), który chce przeprowadzać eksperymenty (czyli przesyłać zadania) i analizować wyniki. Użytkownicy końcowi współpracują z administratorami systemu, aby dostosować środowisko komputerowe, gdy zajdzie taka potrzeba. Mogą mieć pewne doświadczenie w korzystaniu z narzędzi opartych na CLI, ale niektórzy z nich mogą polegać wyłącznie na portalach internetowych lub interfejsach graficznych użytkownika przez VDI do przesyłania swoich zadań i interakcji z wygenerowanymi wynikami.
Nowe odpowiedzialności w środowisku HPC w chmurze:
- Użytkownik końcowy nie powinien mieć żadnych nowych obowiązków opartych na pracy zarówno administratora HPC, jak i administratora chmury. W zależności od środowiska lokalnego, użytkownicy końcowi mają dostęp do większej pojemności i różnorodności zasobów obliczeniowych, co pozwala im być bardziej produktywnymi.
Administrator HPC
Osoba ta posiada wiedzę z zakresu HPC i jest odpowiedzialna za wdrażanie początkowej infrastruktury obliczeniowej oraz jej dostosowanie do potrzeb biznesowych i użytkowników końcowych. Ta persona jest również odpowiedzialna za sprawdzanie stanu zdrowia systemu oraz rozwiązywanie problemów. Administratorzy HPC mogą wygodnie uzyskiwać dostęp do architektury i jej komponentów za pośrednictwem interfejsu wiersza polecenia, zestawów SDK i portali internetowych. Są także pierwszym punktem kontaktu, gdy użytkownicy końcowi napotykają jakiekolwiek problemy z środowiskiem komputerowym.
Nowe odpowiedzialności w środowisku HPC w chmurze:
- Zarządzanie zasobami i usługami chmurowymi (np. maszynami wirtualnymi, przechowywaniem danych, siecią) za pośrednictwem platform zarządzania chmurą.
- Implementacja i zarządzanie klastrami oraz zasobami za pomocą nowych narzędzi do orkiestracji zasobów (na przykład, CycleCloud).
- Optymalizacja wdrażania aplikacji poprzez zrozumienie szczegółów infrastruktury (tj. typy maszyn wirtualnych, opcje przechowywania i sieci).
- Optymalizacja wykorzystania zasobów i kosztów poprzez zastosowanie funkcji specyficznych dla chmury, takich jak automatyczne skalowanie i instancje tymczasowe.
Administrator chmury
Ta persona współpracuje z administratorem HPC, aby pomóc w wdrażaniu i utrzymaniu infrastruktury komputerowej. Ta osoba nie jest (koniecznie) ekspertem HPC, lecz ekspertem w chmurze z głęboką wiedzą na temat IT infrastruktury firmy, w tym konfiguracji/polityki sieci, praw dostępu użytkowników i urządzeń użytkowników. W zależności od przypadku, administrator HPC i administrator Cloud mogą być tą samą osobą.
Nowe odpowiedzialności w środowisku HPC w chmurze:
- Współpraca z administratorami HPC, aby zapewnić płynną integrację obciążeń HPC z infrastrukturą chmury.
- Monitorowanie i zarządzanie wydajnością, bezpieczeństwem i zgodnością infrastruktury chmurowej.
- Pomoc w konfiguracji rozwiązań sieciowych i pamięci masowej opartych na chmurze w celu obsługi obciążeń HPC.
Menedżer biznesowy / właściciel
Ta persona reprezentuje osobę, która jest odpowiedzialna za biznes, co obejmuje dbanie o budżet i projekty mające na celu realizację celów organizacyjnych. W przypadku tej osoby komponent księgowy architektury jest istotny dla zrozumienia kosztów dla każdego projektu. Ta persona współpracuje z administratorami HPC i użytkownikami końcowymi, aby zrozumieć potrzeby platformy, w tym potrzeby dotyczące magazynowania, sieci i zasobów obliczeniowych. Oni również planują przyszłe obciążenia pracą.
Nowe odpowiedzialności w środowisku HPC w chmurze:
- Analizowanie szczegółowych raportów kosztów i metryk użycia dostarczanych przez dostawców usług chmurowych w celu zarządzania budżetami i prognozowania wydatków.
- Podejmowanie strategicznych decyzji opartych na wykorzystaniu zasobów chmurowych i możliwościach optymalizacji kosztów.
- Planowanie i zatwierdzanie inwestycji w infrastrukturę chmurową, aby wspierać przyszłe obciążenia HPC oraz cele biznesowe.
Przegląd architektury typu Lift and Shift
Produkcyjne środowisko HPC w chmurze składa się z kilku komponentów. Istnieją pewne kluczowe komponenty potrzebne do stworzenia środowiska, takie jak harmonogram zadań, dostawca zasobów, wskaźnik wejścia dla użytkownika do dostępu do środowiska, urządzenia obliczeniowe i magazynujące, i inne. Gdy środowisko wchodzi do produkcji, monitorowanie, obserwowalność, kontrole zdrowia, bezpieczeństwo, zarządzanie tożsamością, odpowiedzialność, różne opcje przechowywania oraz inne komponenty zaczynają odgrywać kluczową rolę.
Istnieją również rozszerzenia, które mogą być wdrożone, takie jak węzły logowania, przenośniki danych, użycie kontenerów, menedżery licencji oraz inne elementy zależące od instalacji.
To środowisko produkcyjne może mieć różne komponenty do skonfigurowania. Dlatego osoby odpowiedzialne za wdrażanie i zarządzanie środowiskiem stają się kluczowe dla zautomatyzowania jego początkowego wdrożenia oraz odpowiednio jego późniejszego ulepszania. Bardziej zaawansowane instalacje mogą również mieć szablony (lub specyfikacje) środowiska z wersjami oprogramowania i konfiguracjami, które są bardziej optymalne i odpowiednio przetestowane. Gdy środowisko jest już produkcyjne i zawiera wszystkie wymagane komponenty, z czasem mogą być konieczne dostosowania, aby sprostać wymaganiom użytkowników, w tym zmiany typów maszyn wirtualnych lub opcji/możliwości przechowywania danych.
Tworzenie instancji architektury chmury HPC w modelu lift and shift
Tutaj dostarczamy więcej szczegółów dotyczących każdego komponentu architektury, w tym wskazówki do oficjalnych produktów Azure, blogi technologiczne z najlepszymi praktykami, repozytoria git oraz linki do rozwiązań niezwiązanych z produktami.
Szybki start. Aby szybko rozpocząć tworzenie środowiska HPC w chmurze z podstawowymi blokami budulcowymi, zalecamy użycie Azure CycleCloud Slurm workspace.