Hugging Face-Modelle in Microsoft Foundry (Vorschau)

Von Hugging Face veröffentlichte Modelle stehen im Foundry-Modellkatalog zur Bereitstellung in Microsoft Foundry zur Verfügung. In der aktuellen Foundry-Umgebung verwenden diese Modelle verwaltete Rechenressourcen.

In diesem Artikel lernen Sie bereitstellbare Hugging Face-Modelle kennen, stellen eines mit verwalteten Rechenressourcen bereit und rufen den Endpunkt aus Ihrer Anwendung auf.

Verwenden Sie in der Modellsuche den Filter In meinem Projekt verfügbar, um die Hugging Face-Modelle zu finden, die Sie in Ihrem aktuellen Projekt bereitstellen können. Um alle Hugging Face-veröffentlichten Modelle anzuzeigen, legen Sie den Verfügbarkeitsfilter auf "Alle Modelle" fest. Wenn ein Modell derzeit nicht in Foundry verfügbar ist, wird auf der Modellkarte eine Schaltfläche " Weiter in Foundry " (klassisch) angezeigt, sodass Sie in Foundry (klassisch) bereitstellen können.

Important

Die verwaltete Rechenkapazität von Foundry ist derzeit als Vorschau verfügbar. Vorschaufeatures sind möglicherweise nicht in allen Regionen verfügbar und unterliegen ergänzenden Bedingungen. Weitere Informationen finden Sie unter Supplementale Nutzungsbedingungen für Microsoft Azure Previews.

Hugging Face Modelle in Foundry sind weltweit verfügbar. Informationen zur allgemeinen Dienstverfügbarkeit nach Region finden Sie unter Azure Produkte nach Region.

Verantwortungsvolle Verwendung von Hugging Face-Modellen

Modelle, die von Hugging Face stammen, sind Nicht-Microsoft Produkte, die nicht von Microsoft getestet oder ausgewertet werden. Bevor Sie ein Modell bereitstellen, stellen Sie sicher, dass es für Ihren spezifischen Anwendungsfall geeignet ist, einschließlich der Bewertung rechtlicher oder exportkontrollrechtlicher Überlegungen und der Durchführung eigener Modellrisiko- und Sicherheitsbewertungen. Erfahren Sie mehr über Risikobewertungen und Sicherheitsbewertungen für Foundry und Sicherheitsmaßnahmen von Hugging Face für Modelle, die in Foundry verfügbar sind.

Important

Modelle von Hugging Face unterliegen den Lizenzbedingungen von Drittanbietern, die auf der Detailseite des Hugging Face-Modells verfügbar sind. Es liegt in Ihrer Verantwortung, die Lizenzbedingungen des Modells einzuhalten.

Voraussetzungen

  • Ein Foundry-Projekt.
  • Die folgenden Rollenzuweisungen im Geltungsbereich des Foundry-Kontos:
    • Cognitive Services Contributor (oder Foundry Owner / Foundry Account Owner), um Bereitstellungen verwalteter Rechenressourcen zu erstellen, zu aktualisieren und zu löschen.
    • Foundry-Benutzer, um die Bereitstellung mit Microsoft Entra ID über das Playground, SDK oder REST aufzurufen. Rollendefinitionen finden Sie unter Rollenbasierte Zugriffssteuerung in Foundry.
  • Verfügbares verwaltetes GPU-Computekontingent in Ihrem Azure-Abonnement für die ausgewählte Beschleunigerfamilie. Das von Foundry verwaltete Compute-Kontingent ist vom Azure-VM-Kontingent getrennt und verwendet einen anderen Anfragepfad. Wechseln Sie im Foundry-Portal zu "Kontingent>verwaltetesComputeanforderungskontingent> verwalten>", um Ihre aktuelle Zuordnung zu überprüfen oder eine Erhöhung anzufordern. Ausführliche Anleitungen finden Sie unter "Weiteres Kontingent anfordern".

Ein Hugging Face-Modell bereitstellen

Suchen und Auswählen des Modells

  1. Wechseln Sie im Findry-Portal in der oberen Navigationsleiste zu "Entdecken ", und wählen Sie dann im linken Bereich " Modelle " aus.

  2. Wählen Sie im Filter "Sammlungen " die Option "Hugging Face " aus, um verfügbare Hugging Face-veröffentlichte Modelle anzuzeigen.

  3. Wählen Sie den Filter "In meinem Project verfügbar" aus, um nur Modelle anzuzeigen, die Sie derzeit in Ihrer project und Region bereitstellen können.

  4. Wählen Sie im Filter BereitstellungsoptionenVerwaltete Rechenleistung aus, um nur Modelle anzuzeigen, die für die Bereitstellung mit verwalteter Rechenleistung verfügbar sind.

  5. Wählen Sie eine Modellkachel aus, um die Modelldetailseite zu öffnen.

Konfigurieren und Bereitstellen

  1. Wählen Sie auf der Modelldetailseite die Option "Bereitstellen" aus. Diese Aktion öffnet den Bereitstellungskonfigurationsbereich mit Standardauswahl.

  2. Geben Sie einen Bereitstellungsnamen ein. Sie benötigen einen Bereitstellungsnamen und dürfen keinen Punkt (.) enthalten. Verwenden Sie nur alphanumerische Zeichen, Unterstriche und Bindestriche, und verwenden Sie 2 bis 64 Zeichen.

  3. Wählen Sie die Bereitstellungsvorlage aus.

  4. Wählen Sie den Beschleunigertyp aus, der Ihrer Modellgröße und Ihren Leistungsanforderungen entspricht. Das Portal filtert die verfügbaren Optionen vorab nach kompatiblen Beschleunigern.

  5. Geben Sie die Instanzanzahl an:

    • Verwenden Sie 1 Instanz für Tests und Entwicklung.
    • Verwenden Sie für die Produktion 2 oder mehr Instanzen, um die Verfügbarkeit sicherzustellen und Datenverkehrsspitzen abzufangen.
  6. Klicken Sie auf Bereitstellen. Der Bereitstellungsprozess dauert in der Regel mehrere Minuten. Wenn dies abgeschlossen ist, zeigt das Portal die Seite mit den Bereitstellungsdetails mit:

    • Die Endpunkt-URL zum Aufrufen des Modells
    • API-Schlüssel für die Authentifizierung
    • Bereitstellungsstatus und Protokolle

Bereitstellen mit Python SDK (Alternative)

Wenn Sie die Automatisierung bevorzugen, verwenden Sie das Python Management SDK, um dieselbe verwaltete Computebereitstellung zu erstellen. Ersetzen Sie Platzhalter durch Werte aus Ihrem Abonnement und ausgewähltem Modell.

Um Werte für MODEL und TEMPLATE abzurufen, öffnen Sie die Karte mit den Modelldetails und den Bereitstellungsassistenten im Foundry-Portal und kopieren Sie dann die vollqualifizierten Registrierungsressourcen-IDs.

python -m pip install --upgrade azure-identity azure-mgmt-cognitiveservices openai
from azure.identity import DefaultAzureCredential
from azure.mgmt.cognitiveservices import CognitiveServicesManagementClient

SUBSCRIPTION_ID = "<your-subscription-id>"
RESOURCE_GROUP = "<your-resource-group>"
ACCOUNT_NAME = "<your-foundry-account>"
DEPLOYMENT_NAME = "<your-deployment-name>"

MODEL = "azureml://registries/azure-huggingface/models/<model-id>/versions/<version>"
TEMPLATE = "azureml://registries/azure-huggingface/deploymenttemplates/<template-id>/labels/<label>"

client = CognitiveServicesManagementClient(
   DefaultAzureCredential(), SUBSCRIPTION_ID
)

deployment = client.managed_compute_deployments.begin_create_or_update(
   resource_group_name=RESOURCE_GROUP,
   account_name=ACCOUNT_NAME,
   deployment_name=DEPLOYMENT_NAME,
   resource={
      "sku": {"name": "GlobalManagedCompute", "capacity": 1},
      "properties": {
         "model": MODEL,
         "deploymentTemplate": TEMPLATE,
         "acceleratorType": "<accelerator-type>",
         "versionUpgradeOption": "OnceNewDefaultVersionAvailable",
      },
   },
).result()

print(f"State: {deployment.properties.provisioning_state}")
print(f"ID: {deployment.id}")

Ihre Bereitstellung überprüfen und verwenden

Überprüfen Sie nach Abschluss der Bereitstellung den Endpunkt, bevor Sie ihn in Ihre Anwendung integrieren:

  1. Bestätigen Sie, dass der Bereitstellungsstatus auf der Seite mit den Bereitstellungsdetails erfolgreich ist.

  2. Führen Sie eine Testableitung von der Seite mit den Bereitstellungsdetails aus, um zu bestätigen, dass das Modell eine erfolgreiche Antwort für Ihren Aufgabentyp zurückgibt.

  3. Wenn die Bereitstellung fehlschlägt, überprüfen Sie die Bereitstellungsprotokolle. Überprüfen Sie dann das GPU-Kontingent und die regionale Verfügbarkeit für das ausgewählte Modell und den Beschleunigertyp. Das von Foundry verwaltete Compute-Kontingent ist vom Azure-VM-Kontingent getrennt. Weitere Informationen zu Kontingentüberprüfungen und Erhöhung von Anforderungen finden Sie unter "Weiteres Kontingent anfordern".

Aufrufen des Endpunkts aus Ihrer Anwendung

Nachdem die Verifizierung erfolgreich ist, rufen Sie Ihre Bereitstellung über die Basis-URL des einheitlichen Foundry-Endpunkts auf:

https://<account>.services.ai.azure.com/openai/v1/

Legen Sie in Anforderungstexten das model-Feld auf Ihren Bereitstellungsnamen und nicht auf die Modell-ID fest.

Python OpenAI SDK mit Microsoft Entra ID

from azure.identity import DefaultAzureCredential, get_bearer_token_provider
from openai import OpenAI

ACCOUNT_NAME = "<your-foundry-account>"
DEPLOYMENT_NAME = "<your-deployment-name>"

token_provider = get_bearer_token_provider(
   DefaultAzureCredential(),
   "https://cognitiveservices.azure.com/.default",
)

client = OpenAI(
   base_url=f"https://{ACCOUNT_NAME}.services.ai.azure.com/openai/v1",
   api_key=token_provider,
)

response = client.chat.completions.create(
   model=DEPLOYMENT_NAME,
   messages=[{"role": "user", "content": "What is the capital of Nigeria?"}],
)

print(response.choices[0].message.content)

Python OpenAI SDK mit API-Schlüssel

from azure.identity import DefaultAzureCredential
from azure.mgmt.cognitiveservices import CognitiveServicesManagementClient
from openai import OpenAI

SUBSCRIPTION_ID = "<your-subscription-id>"
RESOURCE_GROUP = "<your-resource-group>"
ACCOUNT_NAME = "<your-foundry-account>"
DEPLOYMENT_NAME = "<your-deployment-name>"

mgmt = CognitiveServicesManagementClient(
   DefaultAzureCredential(), SUBSCRIPTION_ID
)
api_key = mgmt.accounts.list_keys(RESOURCE_GROUP, ACCOUNT_NAME).key1

client = OpenAI(
   base_url=f"https://{ACCOUNT_NAME}.services.ai.azure.com/openai/v1",
   api_key=api_key,
)

response = client.chat.completions.create(
   model=DEPLOYMENT_NAME,
   messages=[{"role": "user", "content": "What is the capital of Nigeria?"}],
)

print(response.choices[0].message.content)

Testen des Endpunkts mit cURL

Verwenden Sie eine cURL-Anforderung, um Ihre Bereitstellung außerhalb des Portals zu überprüfen. Ersetzen Sie die Endpunkt-URL, den API-Schlüssel und den Modellnamen durch Ihre Bereitstellungswerte.

curl -X POST "https://<your-foundry-account>.services.ai.azure.com/openai/v1/chat/completions" \
   -H "Content-Type: application/json" \
   -H "api-key: <your-api-key>" \
   -d '{
      "messages": [{"role": "user", "content": "What is the capital of Nigeria?"}],
      "temperature": 0.2,
      "max_tokens": 256,
      "model": "<your-deployment-name>"
   }'

Eine erfolgreiche Antwort gibt HTTP 200 zurück und enthält choices[0].message.content.

Wie Hugging Face Modelle in Foundry funktionieren

Hugging-Face-Modelle in Foundry verwenden den verwalteten Computebereitstellungspfad, der einen dedizierten GPU-gestützten Endpunkt für die Inferenz erstellt.

Auf hoher Ebene:

  • Sie entdecken Hugging Face-Modelle im Modellkatalog.
  • Sie filtern nach Modellen, die in Ihrem aktuellen Projekt bereitgestellt werden können.
  • Sie stellen ein unterstütztes Modell bereit; Foundry stellt dedizierte GPU-Computeinstanzen zur Verfügung und macht einen Endpunkt verfügbar.
  • Sie rufen über den Endpunkt die Bereitstellung auf, indem Sie die von Foundry verwaltete Compute-Preisgestaltung verwenden.

Verwaltete Rechenleistung bietet dedizierte GPU-Recheninstanzen, endpunktbasierten Inferenzzugriff und die Abrechnung über das Preismodell für verwaltete Rechenleistung von Foundry Models. Aktuelle Tarife und Abrechnungsdetails finden Sie unter Foundry Models Pricing – Managed Compute.

Informationen zu Bereitstellungskonzepten finden Sie unter Managed Compute in Microsoft Foundry.

Datenhosting und Modellgewichtung

Für Hugging Face Modelle, die über Foundry verfügbar sind, werden Modellgewichte auf Azure gespeichert. Dieses Verhalten unterscheidet sich von den von Hugging Face veröffentlichten Modellen in Foundry (klassisch) und Azure Machine Learning, bei denen die Modellgewichte bei der Bereitstellung aus dem Hugging Face Hub heruntergeladen werden.

Bereitstellbare Hugging Face-Modelle entdecken

Verwenden Sie im Modellkatalog die Modellfilter, um die Suche auf von Hugging Face veröffentlichte Modelle einzugrenzen. Um sich auf Modelle zu konzentrieren, die Sie jetzt bereitstellen können, aktivieren Sie "In meinem Project verfügbar".

Wenn Sie diesen Filter aktivieren, zeigt der Katalog nur Modelle an, die derzeit im ausgewählten Projektkontext bereitgestellt werden können. In dieser gefilterten Ansicht wird ein Modell angezeigt, wenn alle folgenden Bedingungen erfüllt sind:

  • Das Modell befindet sich im Foundry-Modellkatalog.
  • Ihr Abonnement verfügt über ein verfügbares Kontingent für verwaltete GPU-Rechenressourcen für mindestens einen kompatiblen Beschleunigertyp.
  • Das Modell ist in der Azure Region Ihres Projekts verfügbar.

Wenn ein Modell, das Sie sehen, nicht angezeigt wird, überprüfen Sie ihr Kontingent und die Regionsabdeckung in Foundry, bevor Sie zu Foundry (klassisch) wechseln.

Unterstützte Modelle

Foundry unterstützt Hugging Face-Modelle, die alle folgenden Kriterien erfüllen:

  • Erfordert die Tags Transformers, Diffusers oder Sentence-Transformers auf dem Hugging-Face-Hub.
  • Sie verfügen über eine zulässige Lizenz (z. B. Apache 2.0, MIT oder OpenRAIL-M), die kommerzielle Nutzung und Umverteilung zulässt.
  • Verwenden Sie eine unterstützte Aufgabe wie chat-completion, image-to-text oder embeddings.
  • Die Modellgewichte liegen im Safetensors-Format vor, und das Modell benötigt trust_remote_code nicht.

Sicherheitsanforderungen

Vor der Bereitstellung werden alle Modelle in der Hugging Face Collection obligatorischen Sicherheitsüberprüfungen unterzogen:

  • Schadsoftwareüberprüfung: Der Prozess überprüft Modelle, um eingebettete Schadsoftware oder schädliche Binärdateien zu identifizieren.
  • Codeüberprüfung: Der Prozess verbietet Modelle, die erfordern trust_remote_code=True , es sei denn, Hugging Face überprüft sie explizit, oder sie stammen aus vertrauenswürdigen Organisationen.
  • Sichere Formaterzwingung: Modellgewichtungen müssen im Safetensors-Format vorliegen, um Risiken aus auf Pickle basierenden Formaten zu beseitigen.
  • Validierungsprüfungen: Der Prozess testet vor der Veröffentlichung alle Kombinationen aus Modell, Laufzeit und Beschleuniger auf API-Konformität und Performance.

Weitere Details finden Sie in der Sicherheitsdokumentation zu Hugging Face.

Wählen Sie Foundry oder Foundry (klassisch) aus.

Verwenden Sie die folgende Tabelle, um zu bestimmen, welche Erfahrung Zu Ihrem Szenario passt:

Szenario Verwendung
Das Modell ist in Ihrem aktuellen Projekt verfügbar. Giesserei
Modellgewichtungen, die direkt aus Azure stammen Giesserei
Der Zugriff auf das Modell ist auf dem Hugging-Face-Hub eingeschränkt Gießerei (klassisch)
Das Modell wird für Ihr aktuelles Projekt nicht angezeigt. Gießerei (klassisch)
Modellgewichtungen, die direkt vom Hugging Face Hub stammen Gießerei (klassisch)

Wenn ein Modell in Foundry nicht verfügbar ist

Einige Hugging Face-veröffentlichte Modelle sind möglicherweise derzeit nicht in Foundry verfügbar. In diesem Fall zeigt die Modellkarte eine Schaltfläche " Weiter in Foundry" (klassisch) an. Wählen Sie diese Option aus, um die entsprechende Ansicht in Foundry (klassisch) zu öffnen.

Foundry (klassisch) bleibt der Fallbackpfad für Hugging Face-veröffentlichte Modelle, die in der aktuellen Foundry-Projekterfahrung nicht verfügbar sind. Weitere Informationen zu den Funktionen für die Bereitstellung verwalteter Compute-Ressourcen in der aktuellen Foundry-Umgebung finden Sie unter Verwalteter Compute in Microsoft Foundry. Sie können ein Modell auch über das Hugging Face auf Microsoft Foundry Feedback Portal anfordern.

Informationen zu Unterschieden zwischen den aktuellen und klassischen Erfahrungen finden Sie unter Migrieren aus dem Foundry-Portal (klassisch).

FAQ

Sind zugriffsbeschränkte Hugging Face-Modelle in Foundry verfügbar?

No. Zugriffsbeschränkte Hugging Face-Modelle sind in Foundry nicht verfügbar. Modelle mit Zugriffsbeschränkung erfordern vor der Nutzung eine Authentifizierung sowie die Genehmigung des Modellautors. Verwenden Sie Foundry (klassisch) für die Unterstützung von Gated-Modellen. Siehe Bereitstellen von Modellen aus dem Hugging Face Hub für verwaltete Rechenressourcen (klassisch).

Kann ich Hugging Face-Modelle mit verwalteten CPU-Rechenressourcen bereitstellen?

Verwaltete Compute-Bereitstellungen für Hugging-Face-Modelle verwenden GPU-Beschleuniger der Enterprise-Klasse. Wenn Sie einen anderen Bereitstellungspfad benötigen, sollten Sie "Foundry" (klassisch) in Betracht ziehen.

Was sollte ich tun, wenn das gewünschte Modell in Foundry nicht verfügbar ist?

Siehe " Wenn ein Modell in Foundry nicht verfügbar ist.

Wie finde ich nur Modelle, die jetzt bereitgestellt werden können?

Legen Sie im Modellkatalog den Filter "Sammlungen" auf "Hugging Face" fest, legen Sie die Bereitstellungsoptionen auf "Verwaltete Berechnung" fest, und aktivieren Sie dann den Filter "Verfügbar" in meinem Project-Filter, um nur Modelle anzuzeigen, die derzeit in Ihrer project und Region bereitgestellt werden können.