Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Platforma sztucznej inteligencji to miejsce, w którym organizacja działa i obsługuje modele sztucznej inteligencji. Zapewnia perymetr sieciowy, model tożsamości, płaszczyznę danych i przydział limitów dla modeli, wdrożeń, indeksów, ewaluacji i powiązanych zasobów. Microsoft Foundry i Azure Machine Learning to dwie platformy sztucznej inteligencji Azure. Każde wdrożenie dowolnej usługi tworzy nowe wystąpienie.
Twoja organizacja musi zdecydować, jak rozmieścić środowiska obciążeń AI pomiędzy instancjami platformy AI. Możesz odizolować każde środowisko, takie jak deweloperskie, testowe lub produkcyjne, w osobnej instancji platformy. Możesz również zezwolić wielu obciążeniom roboczym lub środowiskom na współużytkowanie jednego wystąpienia. Ta decyzja, często określana jako colocation, wpływa na skalę skutków problemów operacyjnych lub incydentów związanych z bezpieczeństwem. Wpływa również na granice zgodności i koszty platformy.
Zalecenie: Ustanów zasady dla całej organizacji, które definiują domyślne wymagania dotyczące izolacji, zatwierdzone granice udostępniania, kryteria wyjątków i oddzielne oczekiwania dotyczące środowisk platformy sztucznej inteligencji w środowisku produkcyjnym i przedprodukcyjnym.
Wskazówki dotyczące decyzji:
1. Definiowanie granic udostępniania platformy sztucznej inteligencji
Każda organizacja potrzebuje granic, między którymi obciążenia robocze nigdy nie mogą współdzielić tej samej instancji platformy AI. Ta granica ma zastosowanie w każdym środowisku, w tym w środowiskach produkcyjnych i przedprodukcyjnych. Obciążenia robocze w obrębie tej samej granicy mogą potencjalnie współdzielić wystąpienie platformy. Obciążenia w różnych granicach nie mogą.
Dlaczego warto wyznaczać granice udostępniania? Bez wspólnie ustalonych granic zespoły odpowiedzialne za obciążenia domyślnie sięgają po wzorzec, który w danym momencie jest najwygodniejszy, a platforma AI z czasem gromadzi sprzeczne wymagania. W czasie tworzy niespójne modele własności, sprzeczne wymagania dotyczące zgodności, niejasne alokacje kosztów i wspólne ryzyko operacyjne w przypadku niepowiązanych obciążeń. Na przykład niepowiązane obszary biznesowe mogą współdzielić ten sam przydział w ramach tego samego wystąpienia platformy, aby obniżyć koszty. Wynikiem jest platforma sztucznej inteligencji z niespójnymi granicami ładu, które stają się trudne do zrozumienia i inspekcji.
Wspólne granice. Wybierz model granic, który jest zgodny ze sposobem, w jaki organizacja już przypisuje odpowiedzialność i zarządza decyzjami technologicznymi. Typowe modele obejmują:
Granica jednostki biznesowej jest optymalna pod kątem wspólnej odpowiedzialności operacyjnej i finansowania
Granica domeny danych optymalizuje się pod kątem typowych wymagań dotyczących zgodności i obsługi danych
Obszar odpowiedzialności właściciela produktu jest zoptymalizowany pod kątem wspólnego cyklu życia prac inżynieryjnych i operacji platformowych
W obrębie tego obszaru zespoły nadal mogą wybierać dedykowane wystąpienia platformy, jeśli potrzeba izolacji jest uzasadniona. Poza granicą udostępnianie nie jest dozwolone.
Znajdź, co działa najlepiej. Żaden pojedynczy model nie jest powszechnie poprawny. Spójność ma znaczenie bardziej niż wybrany model, ponieważ wyraźnie wymuszony model granic zapewnia czytelność ładu w miarę rozwoju platformy sztucznej inteligencji.
2. Definiowanie zasad udostępniania platformy sztucznej inteligencji w środowisku produkcyjnym
Współdzielenie platformy AI w środowisku produkcyjnym to praktyka polegająca na uruchamianiu więcej niż jednego produkcyjnego środowiska obciążeń AI w tym samym zasobie Microsoft Foundry lub obszarze roboczym Azure Machine Learning. Na platformie Azure wystąpienie platformy AI definiuje granicę sieci, granicę tożsamości i granicę limitów przydziału dla środowisk obciążenia, które z niego korzystają. Z tego powodu organizacje powinny zdefiniować określone zasady dotyczące udostępniania platformy sztucznej inteligencji w środowisku produkcyjnym.
2.1 Domyślnie stosuj jedno wystąpienie platformy AI dla każdego obciążenia produkcyjnego
Środowiska produkcyjne sztucznej inteligencji powinny domyślnie korzystać z izolacji środowiska produkcyjnego. Nie kolokuj wielu obciążeń produkcyjnych w tym samym zasobie Microsoft Foundry lub Azure Machine Learning obszarze roboczym, chyba że istnieje udokumentowany wyjątek. Dedykowana instancja platformy AI dla każdego środowiska produkcyjnego powinna być standardem. Traktuj udostępnianie platformy sztucznej inteligencji jako wyjątek, a nie domyślną praktykę.
Dlaczego wybierać izolację jako rozwiązanie domyślne? Udostępnione platformy sztucznej inteligencji również tworzą wspólne ryzyko operacyjne. Problem z zabezpieczeniami, błędna konfiguracja, awaria usługi lub zdarzenie wyczerpania limitu przydziału może mieć wpływ na każde współlokowane środowisko obciążenia. Izolacja zmniejsza również ryzyko przypadkowego narażenia na dostęp między obciążeniami i uniemożliwia jednemu obciążeniu korzystanie z pojemności procesora GPU lub limitu przydziału wymaganego przez inne obciążenie. Środowiska produkcyjne zwykle mają najwyższy wpływ na działalność biznesową i ekspozycję na przepisy. Większość organizacji wymaga wyraźnych granic własności i silnej izolacji operacyjnej dla tych środowisk.
Kompromis: Izolacja zwiększa koszty i koszty związane z zarządzaniem. Każda instancja platformy wiąże się z własnym narzutem operacyjnym w zakresie sieci, zarządzania tożsamością, monitorowania i operacji. Organizacje muszą zrównoważyć te koszty z korzyściami operacyjnymi i zabezpieczeniami silniejszymi.
2.2 Zezwolenie na kolokację produkcyjną za pomocą udokumentowanego wyjątku
Kolokacja zmniejsza obciążenie i konsoliduje operacje platformy. Jeśli na przykład przypadki użycia współużytkują te same źródła danych co dane wejściowe, kolokacja nie wymaga skonfigurowania łączności i uwierzytelniania z platformy sztucznej inteligencji do tych zasobów dla każdego przypadku użycia. Kompromis: Udostępnianie wystąpień platformy AI w środowisku produkcyjnym powoduje również połączenie obszaru oddziaływania awarii, granicy izolacji tożsamości i wspólnej puli limitów wszystkich obciążeń korzystających z tego samego wystąpienia.
Charakterystyka kolokacji: Dopuść współdzielenie wystąpień Microsoft Foundry lub Azure Machine Learning przez obciążenia produkcyjne tylko wtedy, gdy spełniony jest każdy z poniższych warunków:
Wszystkie współumieszczone obciążenia podlegają tym samym regulacjom, tej samej klasyfikacji danych, wymaganiom dotyczącym rezydencji danych oraz standardom postępowania z danymi.
Wszystkie obciążenia działają wewnątrz tej samej granicy sieci, tej samej przestrzeni nazw DNS i tej samej granicy tożsamości.
Organizacja akceptuje wspólne ryzyko awarii i wspólne ryzyko wyczerpania limitu przydziału, które wprowadza kolokacja.
Koszt lub koszty operacyjne oddzielnych wystąpień znacznie przewyższają korzyść izolacji. Sama presja kosztowa nie jest wystarczającym uzasadnieniem.
Zespół akceptuje, że podział obciążeń jest później kosztowny. Stan platformy AI nie przenosi się bezproblemowo między instancjami i często wymaga odtworzenia lub ponownej konfiguracji.
Kompromis: Każda współdzielona instancja platformy AI wymaga wyraźnie wskazanego właściciela platformy odpowiedzialnego za zarządzanie limitami, konfigurację sieci, przeglądy uprawnień dostępu, operacje związane z cyklem życia oraz koordynację incydentów.
2.3 Segmentowe przypadki użycia środowiska produkcyjnego w ramach wystąpienia platformy sztucznej inteligencji
Niezależnie od tego, czy instancja platformy jest izolowana, czy współdzielona, użyj funkcji segmentacji dostępnych w produkcie, aby rozdzielić przypadki użycia. Traktuj każdy odrębny przypadek użycia, taki jak całkowicie odrębne środowiska użytkownika w ramach jednego obciążenia, jako własne wdrożenie logiczne wewnątrz wystąpienia platformy. Przykład:
W usłudze Microsoft Foundry utwórz jeden projekt dla każdego przypadku użycia w zasobie Foundry.
W Azure Machine Learning użyj obszaru roboczego hub z obszarami roboczymi projektu w celu segmentowania przypadków użycia.
Te konstrukty zapewniają każdemu przypadkowi użycia własne zasoby i przypisania ról. Mają wspólny zestaw składników infrastruktury na potrzeby zabezpieczeń i łączności. Nie musisz aprowizować nowego wystąpienia dla każdego scenariusza.
Jeśli kolokacja jest dozwolona w ramach procesu wyjątku, podnieś poziom tego oddzielenia produktu od rekomendacji do wymuszonego wymagania zasad.
Jeśli obciążenie wymaga złożonej segmentacji w wielu projektach Foundry lub obszarach roboczych usługi Azure Machine Learning, należy ponownie ocenić, czy obecny model udostępniania nadal zapewnia akceptowalną prostotę operacyjną i izolację.
Aby uzyskać podstawowe informacje na temat konstrukcji stanowiących podstawę tych decyzji, zobacz zasoby Microsoft Foundry i obszary robocze usługi Azure Machine Learning.
3. Definiowanie zasad udostępniania platformy sztucznej inteligencji przedprodukcyjnej
Środowiska przedprodukcyjne odwracają domyślne ustawienie produkcyjne. Środowiska przedprodukcyjne obejmują środowiska deweloperskie, testowe i stagingowe. Te środowiska obsługują eksperymentowanie i walidację wersji wstępnej. Dedykowane instancje zasobów platformy AI rzadko uzasadniają swój koszt w tych warstwach. Ustawienie domyślne dla wystąpienia współużytkowanego na warstwę środowiska.
Dlaczego kolokacja w środowiskach przedprodukcyjnych? Współdzielona instancja przedprodukcyjnej platformy AI umożliwia zespołom ponowne wykorzystanie infrastruktury Azure AI zamiast wdrażania oddzielnych instancji dla każdego nowego przypadku użycia. Zespoły obciążeń mogą ponownie używać wdrożonych modeli, zatwierdzonej łączności sieciowej, istniejących integracji danych i ustanowionych konfiguracji zabezpieczeń. Takie podejście przyspiesza eksperymentowanie i zmniejsza powtarzające się prace konfiguracyjne. Jest to najcenniejsze, gdy zespoły biznesowe oceniają możliwości nowych scenariuszy sztucznej inteligencji lub weryfikacji rozwiązań na wczesnym etapie.
Kiedy nie kolokować w środowisku przedprodukcyjnym. Użyj dedykowanej instancji przedprodukcyjnej dla każdego obciążenia, gdy przetwarza ono dane objęte regulacjami w środowisku testowym lub musi odwzorowywać topologię środowiska produkcyjnego na potrzeby walidacji wydajności. Należy traktować to wymaganie jako wyjątek i wymagać jawnego zatwierdzenia przed aprowizowaniem.
Kompromis: Kolokacja na etapie przedprodukcyjnym obniża koszt niewykorzystanych mocy i pozwala utrzymać mniejsze zasoby platformy. Jednak naraża każde obciążenie robocze na zakłócenia ze strony eksperymentów innego zespołu. Nieprawidłowo skonfigurowane zadanie dostrajania lub niekontrolowane uruchomienie ewaluacji może zużywać współdzielony limit i spowalniać pracę innych zespołów. Wyniki testów uzyskane we współdzielonej instancji także nie zawsze pozwalają przewidzieć zachowania w środowisku produkcyjnym. Obciążenia z ścisłą wydajnością lub weryfikacją zgodności wymagają dedykowanego środowiska pomimo wyższych kosztów.