Planera din lokala HPC-migrering till molnet

"Lift and shift" i samband med högprestandaberäkning (HPC) syftar främst på processen att migrera en lokal miljö och arbetsbelastning till molnet. Helst hålls ändringarna till ett minimum (till exempel program, jobbschemaläggare och deras konfigurationer bör förbli mestadels desamma). Det är naturligt att göra justeringar i lagring och maskinvara eftersom resurserna skiljer sig från lokala till molnplattformar. Med lift and shift-metoden kan organisationer börja dra nytta av molnet snabbare.

Följande bild representerar ett typiskt lokalt HPC-kluster i en produktionsmiljö som maskinvarutillverkaren ofta levererar. En sådan lokal miljö består av en uppsättning beräkningsnoder som kanske inte fungerar med avbildningar och containrar för virtuella datorer. Sådana noder kör arbetsbelastningar som hanteras av en jobbschemaläggare, vilket vanligtvis kan vara Slurm, PBS eller LSF. Arbetsbelastningarna kommer från flera användare som har identitetshantering associerad med dem. Vanligtvis finns det hemkataloger, scratch-diskar och långsiktig lagring. Det finns också möjlighet till någon form av övervakning för att kontrollera prestanda för jobb och hälsotillstånd för beräkningsnoder. Användare kan komma åt miljön via kommandoraden, webbläsare eller någon form av fjärrvisualiseringsteknik. Hela miljön finns i ett privat nätverk, så användarna har någon mekanism för att komma åt beräkningsanläggningen, antingen via VPN eller via portalen.

Diagram som visar befintlig lokal miljöarkitektur.

Som vi ser i hela det här dokumentet är miljön i molnet som följer modellen Infrastruktur som en tjänst, konceptuellt sett, inte så annorlunda. Vissa tekniker behöver vissa uppdateringar och vissa steg under migreringen från den lokala miljön till molnet är nödvändiga.

Det här dokumentet är därför:

  • Går igenom alternativen för migreringsprocessen.
  • Ger tips till produkter och metodtips för varje komponent.
  • Och ger rekommendationer för att undvika fallgropar i processen.

Innan du hoppar in i arkitekturbeskrivningen är det relevant att förstå de olika personas i det här sammanhanget, deras behov och förväntningar.

Personas och användarupplevelse

Det finns olika personer som behöver komma åt HPC-miljön. Deras aktiviteter och hur de interagerar med miljön varierar ganska mycket.

Slutanvändare (ingenjör/forskare/forskare)

Denna persona representerar ämnesexperten (till exempel biolog, fysiker, ingenjör osv.) som vill köra experiment (det vill säga skicka jobb) och analysera resultat. Slutanvändarna interagerar med systemadministratörer för att finjustera databehandlingsmiljön när det behövs. De kan ha viss erfarenhet av att använda CLI-baserade verktyg, men vissa av dem kan bara förlita sig på webbportaler eller grafiska användargränssnitt via VDI för att skicka sina jobb och interagera med de genererade resultaten.

Nya ansvarsområden i molnets HPC-miljö:

  • Slutanvändare bör inte ha något nytt ansvar baserat på arbetet från både HPC-administratören och molnadministratören. Beroende på den lokala miljön har slutanvändarna tillgång till en större kapacitet och en mängd olika databehandlingsresurser för att bli mer produktiva.

HPC-administratör

Denna persona representerar den som har HPC-expertis och ansvarar för att distribuera den ursprungliga databehandlingsinfrastrukturen och anpassa den efter företagets och slutanvändarens behov. Den här personen ansvarar också för att verifiera systemets hälsa och utföra felsökning. HPC-administratörer har bekväm åtkomst till arkitekturen och dess komponenter via CLI, SDK:er och webbportaler. De är också den första kontaktpunkten när slutanvändarna ställs inför några utmaningar med databehandlingsmiljön.

Nya ansvarsområden i molnets HPC-miljö:

  • Hantera molnresurser och -tjänster (till exempel virtuella datorer, lagring, nätverk) via molnhanteringsplattformar.
  • Implementera och hantera kluster och resurser via nya verktyg för resursorkestrering (till exempel CycleCloud).
  • Optimera programdistributionen genom att förstå infrastrukturinformation (d.v.s. VM-typer, lagring och nätverksalternativ).
  • Optimera resursanvändning och kostnader med hjälp av molnspecifika funktioner som autoskalning och spot-instanser.

Molnadministratör

Den här personen arbetar med HPC-administratören för att distribuera och underhålla databehandlingsinfrastrukturen. Den här personen är inte (nödvändigtvis) en HPC-expert, utan en molnexpert med djup kunskap om företagets övergripande IT-infrastruktur, inklusive nätverkskonfigurationer/principer, användaråtkomsträttigheter och användarenheter. Beroende på fallet kan HPC-administratören och molnadministratören vara samma person.

Nya ansvarsområden i molnets HPC-miljö:

  • Samarbeta med HPC-administratörer för att säkerställa sömlös integrering av HPC-arbetsbelastningar med molninfrastruktur.
  • Övervaka och hantera prestanda, säkerhet och efterlevnad för molninfrastruktur.
  • Hjälpa till med konfigurationen av molnbaserade nätverks- och lagringslösningar för att stödja HPC-arbetsbelastningar.

företagsledare/ägare

Denna persona representerar den som ansvarar för verksamheten, vilket inkluderar att ta hand om budget och projekt för att uppfylla organisationens mål. För den här personen är redovisningskomponenten i arkitekturen relevant för att förstå kostnaderna för varje projekt. Den här personen arbetar med HPC-administratörer och slutanvändare för att förstå plattformsbehov, inklusive lagring, nätverk, databehandlingsresurser. De planerar även för framtida arbetsbelastningar.

Nya ansvarsområden i molnets HPC-miljö:

  • Analysera detaljerade kostnadsrapporter och användningsstatistik som tillhandahålls av molntjänstleverantörer för att hantera budgetar och prognoskostnader.
  • Fatta strategiska beslut baserat på användning av molnresurser och möjligheter till kostnadsoptimering.
  • Planera och godkänna investeringar i molninfrastruktur för att stödja framtida HPC-arbetsbelastningar och affärsmål.

Översikt över lift- och skiftarkitektur

Diagram som visar målarkitekturen för HPC Cloud.

En HPC-produktionsmiljö i molnet består av flera komponenter. Det finns några viktiga komponenter för att skapa en miljö, till exempel en jobbschemaläggare, en resursprovider, en startpekare som användaren kan använda för att komma åt miljön, beräknings- och lagringsenheterna, bland annat. När miljön kommer in i produktion börjar övervakning, observerbarhet, hälsokontroller, säkerhet, identitetshantering, ansvarsskyldighet, olika lagringsalternativ, bland andra komponenter, spela en viktig roll.

Det finns också tillägg som kan finnas på plats, till exempel inloggningsnoder, dataflyttare, användning av containrar, licenshanterare, bland annat som är beroende av installationen.

Den här miljön på produktionsnivå kan ha olika komponenter som ska konfigureras. Därför blir miljöansvariga och administratörer viktiga för att automatisera den inledande distributionen och uppgradera den längs vägen, respektive. Mer avancerade installationer kan också ha miljömallar (eller specifikationer) med programvaruversioner och konfigurationer som är mer optimala och testade korrekt. När miljön är i produktion med alla nödvändiga komponenter på plats, över tid, kan justeringar krävas för att uppfylla användarnas krav, inklusive ändringar i VM-typer eller lagringsalternativ/funktioner.

Implementera lyft och skift HPC-molnarkitektur

Här ger vi mer information om varje arkitekturkomponent, inklusive pekare till officiella Azure-produkter, tekniska bloggar med några metodtips, git-lagringsplatser och länkar till icke-produktlösningar.

Snabbstart. För en snabbstartslösning för att skapa en HPC-miljö i molnet med grundläggande byggstenar rekommenderar vi att du använder Azure CycleCloud Slurm-arbetsytan.