Microsoft Foundry - oceny ryzyka i bezpieczeństwa. Informacja o przejrzystości

Co to jest notatka dotycząca przezroczystości

System sztucznej inteligencji obejmuje nie tylko technologię, ale także osoby, które będą jej używać, osoby, których to dotyczy, oraz środowisko, w którym jest wdrażane. Utworzenie systemu dopasowanego do zamierzonego celu wymaga zrozumienia, jak działa technologia, jakie są jej możliwości i ograniczenia oraz jak osiągnąć najlepszą wydajność. Notatki dotyczące przejrzystości Microsoftu mają na celu pomóc w zrozumieniu, jak działa nasza technologia sztucznej inteligencji, jakie wybory mogą podejmować właściciele systemu, które wpływają na wydajność i zachowanie systemu, oraz podkreślić znaczenie uwzględniania całego systemu, w tym technologii, ludzi i środowiska. Możesz użyć notatek przezroczystości podczas opracowywania lub wdrażania własnego systemu lub udostępniać je osobom, które będą korzystać z systemu lub mają na nie wpływ.

Uwagi dotyczące przejrzystości Microsoft są częścią szerszego wysiłku firmy, aby w praktyce wprowadzić nasze zasady sztucznej inteligencji. Aby dowiedzieć się więcej, zobacz Microsoft zasady sztucznej inteligencji.

Podstawy oceny ryzyka i bezpieczeństwa Microsoft Foundry

Wprowadzenie

Modele Foundry oferowane przez Azure zostały ocenione przez firmę Microsoft zgodnie ze standardami firmy Microsoft dotyczącymi odpowiedzialnej sztucznej inteligencji. Wszystkie inne modele, w tym modele Anthropic i otwarte modele pochodzące z Hugging Face Hub lub Fireworks AI, to produkty niezwiązane z Microsoftem zgodnie z Warunkami Produktu i nie zostały ocenione przez Microsoft.

Niezależnie od tego, czy model jest sprzedawany przez Azure, czy jest produktem bez Microsoft, klienci powinni przeprowadzać własne oceny ryzyka i bezpieczeństwa. Oceny ryzyka i bezpieczeństwa narzędzia Foundry umożliwiają użytkownikom ocenę danych wyjściowych generatywnej aplikacji sztucznej inteligencji pod kątem zagrożeń tekstowych: nienawistnej i niesprawiedliwej treści, treści seksualnej, brutalnej treści, treści związanej z samookaleczeniem, bezpośrednich i pośrednich luk w zabezpieczeniach typu jailbreak oraz materiałów chronionych w treściach. Oceny bezpieczeństwa mogą również pomóc w generowaniu zestawów danych do przeciwdziałania, aby przyspieszyć i rozszerzyć operację typu red-teaming. Oceny bezpieczeństwa rozwiązania Foundry odzwierciedlają zobowiązania Microsoft w celu zapewnienia, że systemy sztucznej inteligencji są tworzone bezpiecznie i odpowiedzialnie, operacjonalizując nasze zasady odpowiedzialnej sztucznej inteligencji.

Kluczowe terminy

  • Nienawistne i niesprawiedliwe treści (dla tekstu i obrazów) odnoszą się do dowolnego języka lub obrazów odnoszących się do nienawiści lub niesprawiedliwych reprezentacji osób i grup społecznych wraz z czynnikami, w tym między innymi z rasą, pochodzeniem etnicznym, narodowością, płcią, orientacją seksualną, religią, statusem imigracyjnym, zdolnością, wyglądem osobistym i rozmiarem ciała. Niesprawiedliwość występuje, gdy systemy sztucznej inteligencji traktują lub reprezentują grupy społeczne nierówno, tworząc lub przyczyniając się do nierówności społecznych.
  • Treści seksualne (w przypadku tekstu i obrazów) obejmują język lub obrazy dotyczące anatomicznych narządów i narządów płciowych, romantycznych relacji, aktów przedstawianych w kategoriach erotycznych, ciąży, fizycznych aktów seksualnych (w tym napaści lub przemocy seksualnej), prostytucji, pornografii i wykorzystywania seksualnego.
  • Treści brutalne (w przypadku tekstu i obrazów) obejmują język lub obrazy dotyczące działań fizycznych mających na celu zranienie, uszkodzenie lub zabicie kogoś lub coś. Zawiera również opisy broni i pistoletów (oraz powiązanych podmiotów, takich jak producenci i stowarzyszenia).
  • Zawartość związana z samookaleczeniami (w przypadku tekstu i obrazów) obejmuje język lub obrazy dotyczące działań mających na celu zranienie, uszkodzenie ciała lub odebranie sobie życia.
  • Chroniona zawartość materiału (tekst) zawiera znaną zawartość tekstową, na przykład teksty piosenek, artykuły, przepisy i wybraną zawartość internetową, które mogą być wyjściowe przez duże modele językowe. Wykrywając i uniemożliwiając wyświetlanie materiałów chronionych, organizacje mogą zachować zgodność z prawami własności intelektualnej i zachować oryginalność zawartości.
  • Chroniona zawartość materiałowa (w przypadku obrazów) odnosi się do niektórych chronionych treści wizualnych chronionych przez prawa autorskie, takie jak logo i marki, dzieła sztuki lub fikcyjne znaki. System używa modelu podstaw obrazu do tekstu w celu określenia, czy taka zawartość jest obecna.
  • Bezpośrednie ataki jailbreaku, bezpośrednie ataki poleceń lub ataki polegające na wstrzykiwaniu poleceń użytkownika odnoszą się do użytkowników manipulujących poleceniami w celu wstrzyknięcia szkodliwych wejść do LLM w celu zniekształcenia działań i wyników. Przykładem polecenia jailbreak jest wykonanie komendy "DAN" (Do Anything Now), która może skłonić LLM do generowania niewłaściwej zawartości lub ignorowania ograniczeń narzuconych przez system.
  • Pośrednie jailbreak, pośrednie ataki na zapytania lub ataki polegające na iniekcji zapytań pomiędzy domenami odnoszą się do sytuacji, gdy złośliwe instrukcje są ukryte w danych, które system sztucznej inteligencji przetwarza lub na podstawie których generuje zawartość. Te dane mogą obejmować wiadomości e-mail, dokumenty, witryny internetowe lub inne źródła, które nie są bezpośrednio tworzone przez dewelopera lub użytkownika, i mogą prowadzić do niewłaściwego generowania zawartości lub ignorowania ograniczeń narzuconych przez system.
  • Współczynnik wad (ryzyko zawartości) jest definiowany jako procent wystąpień w zestawie danych testowych, które przekraczają próg w skali ważności w całym rozmiarze zestawu danych.
  • Red-teaming historycznie opisał systematyczne ataki niepożądane na potrzeby testowania luk w zabezpieczeniach. Wraz z rozwojem dużych modeli językowych (LLM) termin ten rozszerzył się poza tradycyjne cyberbezpieczeństwo i ewoluował we wspólnym użyciu, aby opisać wiele rodzajów sondowania, testowania i atakowania systemów sztucznej inteligencji. Dzięki LLMs zarówno łagodne, jak i niepożądane użycie może produkować potencjalnie szkodliwe dane wyjściowe, które mogą przyjmować wiele form, w tym szkodliwe treści, takie jak nienawistne przemówienie, podżeganie lub gloryfikacja przemocy, odniesienie do treści związanych z samookaleczeniami lub treści seksualnych.

Możliwości

Zachowanie systemu

Usługa Foundry aprowizuje dopracowany model Azure OpenAI GPT-4o i organizuje ataki typu podrzutek na aplikację w celu wygenerowania wysokiej jakości zestawu danych testowych. Następnie konfiguruje inny model GPT-4o w celu dodania adnotacji do zestawu danych testowych w zakresie treści i bezpieczeństwa. Użytkownicy udostępniają wygenerowany punkt końcowy aplikacji sztucznej inteligencji, który chce przetestować, a oceny bezpieczeństwa wygenerują statyczny zestaw danych testowych względem tego punktu końcowego wraz z etykietą ryzyka zawartości (bardzo niska, niska, średnia, wysoka) lub etykietą wykrywania ryzyka zawartości (prawda lub fałsz) i uzasadnieniem etykiety wygenerowanej przez sztuczną inteligencję.

Przypadki użycia

Zamierzone zastosowania

Oceny bezpieczeństwa nie są przeznaczone do użycia w żadnym celu innym niż ocena zagrożeń związanych z zawartością i lukami w zabezpieczeniach typu jailbreak aplikacji AI generującej:

  • Ocena przed wdrożeniem aplikacji generatywnej sztucznej inteligencji: Korzystając z kreatora oceny w portalu Foundry lub Python SDK dla usług AI Azure, automatyczne oceny bezpieczeństwa mogą ocenić potencjalne zagrożenia związane z zawartością lub bezpieczeństwem.
  • Rozszerzanie operacji red-teaming: Za pomocą symulatora przeciwnika, oceny bezpieczeństwa mogą symulować interakcje przeciwnika z generatywną aplikacją sztucznej inteligencji, aby zidentyfikować ryzyko związane z zawartością i bezpieczeństwem.
  • Przekazywanie zawartości i zagrożeń bezpieczeństwa osobom biorącym udział w projekcie Foundry: za pomocą portalu Foundry możesz udostępnić dostęp do projektu Foundry z wynikami oceny bezpieczeństwa audytorom lub uczestnikom projektu zgodności.

Zagadnienia dotyczące wybierania przypadku użycia

Zachęcamy klientów do korzystania z ocen bezpieczeństwa rozwiązania Foundry w swoich innowacyjnych rozwiązaniach lub aplikacjach. Poniżej przedstawiono jednak niektóre zagadnienia dotyczące wybierania przypadku użycia:

  • Oceny bezpieczeństwa powinny obejmować udział ludzi w procesie: Używanie automatycznych ocen bezpieczeństwa, takich jak oceny bezpieczeństwa Foundry, powinno obejmować recenzentów, takich jak eksperci z dziedziny, aby ocenić, czy aplikacja generatywnej sztucznej inteligencji została dokładnie przetestowana przed wdrożeniem do użytkowników końcowych.
  • Oceny bezpieczeństwa nie obejmują całkowitego kompleksowego pokrycia: Chociaż oceny bezpieczeństwa mogą zapewnić możliwość rozszerzenia testowania pod kątem potencjalnych zagrożeń związanych z zawartością lub bezpieczeństwem, nie zaprojektowano jej w celu zastąpienia ręcznych operacji red-teaming specjalnie dostosowanych do domeny aplikacji, przypadków użycia i typu użytkowników końcowych.
  • Obsługiwane scenariusze:
    • W przypadku symulacji kontradyktoryjnej: odpowiadanie na pytania, czaty wielotaktowe, podsumowywanie, wyszukiwanie, przepisywanie tekstu, generowanie treści niepodstawionej i podstawionej.
    • W przypadku automatycznej adnotacji: odpowiadanie na pytania i czat wieloełowy.
  • Obecnie usługa jest najlepiej używana w domenie angielskiej tylko w przypadku generowania tekstu. Dodatkowe funkcje, w tym obsługa wielu modeli, będą brane pod uwagę w przyszłych wersjach.
  • Zakres zagrożeń związanych z zawartością oferowanych w ocenach bezpieczeństwa jest wybrany jako próbka z ograniczonej liczby tematów i grup marginalizowanych.
    • Wskaźnik nienawiści i niesprawiedliwości obejmuje ograniczony zakres wsparcia dla pewnych marginalizowanych grup w kontekście czynnika demograficznego, jakim jest płeć (na przykład mężczyźni, kobiety, osoby niebinarne) oraz rasa, przodkowie, etniczność i narodowość (na przykład czarnoskórzy, Meksykanie, Europejczycy). Nie wszystkie grupy marginalizowane w zakresie płci i rasy, przodków, pochodzenia etnicznego i narodowości są objęte. Inne czynniki demograficzne, które są istotne dla nienawiści i niesprawiedliwości, nie mają obecnie zasięgu (na przykład niepełnosprawności, seksualności, religii).
    • Metryki dotyczące treści związanych z seksem, przemocą i samookaleczeniami opierają się na wstępnej koncepcji tych szkód, które są mniej rozwinięte niż nienawiść i niesprawiedliwość. Oznacza to, że możemy wysuwać mniej rygorystyczne twierdzenia dotyczące zakresu pomiarów i tego, jak dobrze pomiary reprezentują różne sposoby, w jakie mogą wystąpić te szkody. Pokrycie dla tych typów treści obejmuje ograniczoną liczbę tematów związanych z seksem (na przykład przemoc seksualna, relacje, akty seksualne), przemoc (na przykład nadużycie, ranie innych, porwanie) i samookaleczenie (na przykład celowa śmierć, celowe uszkodzenie ciała, zaburzenia odżywiania).
  • Oceny bezpieczeństwa rozwiązania Foundry nie zezwalają obecnie na wtyczki ani rozszerzalność.
  • Aby zapewnić aktualność jakości i poprawić zakres, będziemy dążyć do regularnych terminów przyszłych wydań ulepszeń w możliwościach symulacji przeciwdziałania i adnotacji usługi.

Ograniczenia techniczne, czynniki operacyjne i zakresy

  • Dziedzina dużych modeli językowych (LLMs) nadal rozwija się w szybkim tempie, wymagając ciągłego ulepszania technik oceny w celu zapewnienia bezpiecznego i niezawodnego wdrożenia systemu sztucznej inteligencji. Oceny bezpieczeństwa rozwiązania Foundry odzwierciedlają zaangażowanie Microsoft w kontynuowanie innowacji w dziedzinie oceny LLM. Staramy się dostarczyć najlepsze narzędzia ułatwiające ocenę bezpieczeństwa aplikacji sztucznej inteligencji generacyjnej, ale uznajemy, że skuteczna ocena to ciągła praca w toku.
  • Możliwość dostosowania ocen bezpieczeństwa usługi Foundry jest obecnie ograniczona. Oczekujemy, że użytkownicy będą podawać końcowy punkt aplikacji generatywnej sztucznej inteligencji, a nasza usługa wygeneruje statyczny zestaw danych oznaczony pod kątem ryzyka związanego z zawartością.
  • Na koniec należy zauważyć, że ten system nie automatyzuje żadnych akcji ani zadań, zapewnia tylko ocenę wygenerowanych danych wyjściowych aplikacji sztucznej inteligencji, które powinny być przeglądane przez człowieka podejmującego decyzje w pętli przed podjęciem decyzji o wdrożeniu generowania aplikacji sztucznej inteligencji lub systemu w środowisku produkcyjnym dla użytkowników końcowych.

Wydajność systemu

Najlepsze rozwiązania dotyczące poprawy wydajności systemu

  • W przypadku uwzględniania domeny, która może traktować część zawartości bardziej wrażliwie niż inna, rozważ dostosowanie progu do obliczenia współczynnika wad.
  • Podczas korzystania z automatycznych ocen bezpieczeństwa może czasami wystąpić błąd dotyczący stopnia zagrożenia zawartości lub uzasadnienia tego ryzyka w etykietach generowanych przez sztuczną inteligencję. Istnieje ręczna kolumna opinii użytkownika, która umożliwia walidację wyników zautomatyzowanej oceny bezpieczeństwa z udziałem człowieka.

Ocena bezpieczeństwa odlewni

Metody oceny

W przypadku wszystkich obsługiwanych typów ryzyka treści wewnętrznie sprawdziliśmy jakość, porównując wskaźnik przybliżonych dopasowań między ludzkimi etykietami, przy użyciu skali surowości 0–7, a automatycznymi adnotacjami oceny bezpieczeństwa również opartymi na skali surowości 0–7 w tych samych zestawach danych. W przypadku każdego obszaru ryzyka mieliśmy zarówno ludzkich etykietujących, jak i automatycznego adnotatora, którzy oznaczali 500 angielskich jednokrotnych tekstów, 250 jednokrotnych generacji tekstu na obraz, oraz 250 wielomodalnych tekstów z generacjami obrazów do tekstu. Ludzcy etykietujący i zautomatyzowany adnotator nie używali dokładnie tych samych wersji wytycznych dotyczących adnotacji; chociaż wytyczne zautomatyzowanego adnotatora wynikały z wytycznych dla ludzi, od tego czasu rozeszły się na różne sposoby, przy czym wytyczne dotyczące nienawiści i niesprawiedliwości najbardziej się różnicowały. Pomimo tych niewielkich do umiarkowanych różnic, uważamy, że nadal przydatne jest udostępnianie ogólnych trendów i spostrzeżeń z naszego porównania przybliżonych dopasowań. W naszych porównaniach szukaliśmy dopasowań z tolerancją 2-poziomową (gdzie etykieta ludzka dokładnie pasowała do etykiety automatycznej adnotacji lub mieściła się w 2 poziomach powyżej lub poniżej dotkliwości), dopasowań z tolerancją 1-poziomową oraz dopasowań z tolerancją 0-poziomową.

Wyniki oceny

Ogólnie rzecz biorąc, zauważyliśmy wysoką liczbę przybliżonych dopasowań w kontekście ryzyka samookaleczenia i treści seksualnych przy różnych poziomach tolerancji. W przypadku przemocy i nienawiści i niesprawiedliwości przybliżona stopa dopasowania między poziomami tolerancji była niższa. Wyniki te były częściowo spowodowane zwiększoną rozbieżnością w treści wytycznych adnotacji dla ludzkich etykietujących w porównaniu z automatycznymi adnotatorami, a częściowo zwiększoną ilością zawartości i złożoności w określonych wytycznych.

Chociaż nasze porównania są między jednostkami, które stosowały nieco do umiarkowanie różnych wytycznych adnotacji (i w związku z tym nie są standardowymi porównaniami zgodności modelu ludzkiego), porównania te stanowią oszacowanie jakości, jakiej możemy oczekiwać od ocen bezpieczeństwa w Foundry, biorąc pod uwagę parametry tych porównań. W szczególności przyjrzeliśmy się tylko przykładom w języku angielskim, więc nasze ustalenia mogą nie uogólniać innych języków. Ponadto każdy przykładowy zestaw danych składał się tylko z jednej wypowiedzi, a więc potrzeba więcej eksperymentów w celu zweryfikowania uogólnienia wyników oceny w scenariuszach wielowypowiedziowych (na przykład rozmowy tam i z powrotem, w tym zapytań użytkowników i odpowiedzi systemowych). Typy próbek używanych w tych zestawach danych oceny mogą również znacznie wpływać na przybliżoną częstotliwość dopasowywania między etykietami ludzkimi a automatycznym adnotacją — jeśli próbki są łatwiejsze do etykietowania (na przykład jeśli wszystkie próbki są wolne od ryzyka związanego z zawartością), możemy oczekiwać, że przybliżona częstotliwość dopasowania będzie wyższa. Jakość danych etykietowanych przez ludzi do oceny może również mieć wpływ na uogólnienie naszych ustaleń.

Ocenianie i integrowanie ocen bezpieczeństwa Foundry do użytku własnego.

Pomiar i ocena aplikacji generowania sztucznej inteligencji stanowią kluczową część całościowego podejścia do zarządzania ryzykiem sztucznej inteligencji. Oceny bezpieczeństwa rozwiązania Foundry uzupełniają się i powinny być używane razem z innymi praktykami zarządzania ryzykiem sztucznej inteligencji. Eksperci z dziedziny i recenzenci human-in-the-loop powinni zapewnić odpowiedni nadzór podczas korzystania z ocen bezpieczeństwa wspomaganych AI w cyklu projektowania, opracowywania i wdrażania aplikacji generatywnej AI. Należy zrozumieć ograniczenia i zamierzone zastosowania ocen bezpieczeństwa, uważając, aby nie polegać na danych wyjściowych generowanych przez oceny bezpieczeństwa wspomagane przez sztuczną inteligencję firmy Foundry w izolacji.

Ze względu na niedeterministyczny charakter LLMs może wystąpić fałszywie ujemne lub pozytywne wyniki, takie jak wysoki poziom brutalnej zawartości oceniany jako "bardzo niski" lub "niski". Ponadto wyniki oceny mogą mieć różne znaczenie dla różnych odbiorców. Na przykład oceny bezpieczeństwa mogą wygenerować etykietę dla "niskiej" dotkliwości brutalnej zawartości, która może nie być zgodna z definicją recenzenta, jak poważna może być konkretna brutalna zawartość. W portalu Foundry udostępniamy ludzką kolumnę opinii z kciukami w górę i kciukami w dół podczas wyświetlania wyników oceny, które wystąpienia zostały zatwierdzone lub oznaczone jako nieprawidłowe przez recenzenta ludzkiego. Rozważ kontekst, w jakim wyniki twoich ocen mogą być interpretowane w celu podejmowania decyzji przez innych. Dziel się wynikami swoich ocen z innymi, uwzględniając odpowiedni poziom kontroli, stosowny do poziomu ryzyka w środowisku, w którym działa każda aplikacja wykorzystująca generatywną sztuczną inteligencję.

Dowiedz się więcej o odpowiedzialnej sztucznej inteligencji

Dowiedz się więcej o ocenach bezpieczeństwa Foundry