Distributionsöversikt för Microsoft Foundry-modeller

Microsoft Foundry Models är navet för att identifiera och distribuera ett brett utbud av AI-modeller för generativa AI-program. Om du vill göra en modell tillgänglig för slutsatsdragningsbegäranden distribuerar du den. Foundry erbjuder två distributionsalternativ beroende på modelltyp och infrastrukturbehov.

Tips

Du behöver inte alltid skapa en distribution. Med omedelbar åtkomst (förhandsversion) anropar du modeller som stöds med namn och börjar köra slutsatsdragning omedelbart – ingen distribution krävs.

Driftsättningsalternativ

Foundry innehåller två distributionsalternativ:

  • Serverlöst API – För Foundry-modeller, inklusive Foundry-modeller som säljs av Azure och välj Modeller från partner och community. Det här alternativet är den föredragna och mest kompatibla distributionssökvägen. Den innehåller standard, etablerat dataflöde, batch- och utvecklardistributionstyper.
  • Hanterad beräkning (förhandsversion) – För modeller med öppen källkod, partner och anpassade modeller som körs på dedikerad GPU-kapacitet som Foundry hanterar åt dig.

Foundry väljer lämpligt distributionsalternativ baserat på vilken modell du väljer.

Om du bara behöver prova en modell som stöds kan du hoppa över distributionen helt och använda omedelbar åtkomst (förhandsversion) som anropar modeller efter namn utan att skapa ett serverlöst API eller hanterad beräkningsdistribution.

Diagram som visar val mellan omedelbar åtkomst, serverlösa API-distributionstyper efter startordning och hanterad beräkning.

En fullständig kapacitetsjämförelse finns i Jämförelse av distributionsalternativ.

Serverlöst API

Serverlöst API är det föredragna distributionsalternativet i Foundry. Den stöder det bredaste utbudet av funktioner och distributionstyper.

Vilka modeller använder serverlösa API-distributioner?

Alla Foundry-modeller, inklusive Foundry-modeller som säljs av Azure och väljer Modeller från partner och community, använder serverlösa API-distributioner. Foundry-modeller som säljs av Azure innehåller alla Azure OpenAI-modeller och utvalda modeller från de främsta leverantörerna som debiteras via din Azure-prenumeration, som omfattas av Azure serviceavtal och stöds av Microsoft. Modeller från partner och community som använder serverlösa API-distributioner omfattar Anthropic modeller och specifika modeller från partner som Mistral, Cohere och Meta.

Serverlösa API-funktioner

Stöd för serverlösa API-distributioner:

  • Flera distributionstyper (eller distributions-SKU:er) – Global Standard, Data Zone Standard, Standard (enskild region), etablerad, batch med mera. Varje typ styr var data bearbetas och hur du betalar. Mer information finns i Distributionstyper för Microsoft Foundry Models.
  • Flexibilitet för databehandling – Välj region, datazon (USA, EU eller APAC) eller global bearbetning baserat på dina efterlevnadskrav.
  • Content-filtrering – Inbyggda Azure AI Innehållsäkerhet filter med anpassningsbara konfigurationer.
  • Nyckellös autentisering – Microsoft Entra ID (rekommenderas) och nyckelbaserad autentisering.
  • Privat nätverk – Integrering av virtuellt nätverk för säker åtkomst.
  • Etablerat dataflöde – Reservera kapacitet med etablerade dataflödesenheter (PTUs) för förutsägbara prestanda med låg latens. Mer information finns i Etablerat dataflöde.

Resurskrav

Serverlösa API-distributioner är tillgängliga i:

  • Foundry-resurser – Den primära resurstypen för nya Foundry-projekt. Ingen AI Hub krävs.
  • Azure OpenAI-resurser – Om du använder Azure OpenAI-resurser visar modellkatalogen endast Azure OpenAI-modeller för distribution. Uppgradera till en Foundry-resurs för åtkomst till den fullständiga uppsättningen foundry-modeller.

Information om hur du kommer igång med serverlös API-distribution finns i Distribuera Microsoft Foundry-modeller i Foundry-portalen eller Distribuera modeller med hjälp av Azure CLI och Bicep.

Distribution av hanterade beräkningar (förhandsversion)

Note

Hanterad beräkning i Foundry finns för närvarande i offentlig förhandsversion. Den här förhandsversionen tillhandahålls utan ett serviceavtal och vi rekommenderar det inte för produktionsarbetsbelastningar. Vissa funktioner kanske inte stöds eller kan vara begränsade. Mer information finns i Kompletterande villkor för användning av Microsoft Azure-förhandsversioner.

Hanterad beräkning i Foundry (förhandsversion) är en hanterad GPU-plattform som en tjänst (PaaS) som är värd för modeller med öppen källkod och anpassad vikt på dedikerad GPU-kapacitet. Du får tillgång till hanterade beräkningsdriftsättningar via samma Foundry-projektslutpunkt som andra driftsättningstyper, utan virtuella datorer, kluster eller körningsmiljöer för servering som du behöver hantera. Foundry dimensionerar driftsättningen, provisionerar acceleratorerna och håller körmiljön uppdaterad med säkerhetskorrigeringar.

Viktigt

Hanterad beräkning stöder modeller med öppen källkod, partner, bransch och anpassade modeller. Hanterade beräkningsdistributioner hanteras på slutpunkten för det enhetliga Foundry-projektet med samma autentiserings-, nätverks- och SDK-yta.

Vilka modeller använder hanterad beräkning?

Du kan distribuera modeller från Hugging Face Collection med hjälp av hanterad beräkning. Exempel inkluderar:

  • Qwen-modeller
  • NVIDIA Nemotron-modeller
  • Valda metamodeller
  • Valda Mistral-modeller

Microsoft Foundrys katalog innehåller ett stort och växande urval av modeller med öppen källkod och partner. Den aktuella katalogen finns i modellkatalogen.

Hanterade beräkningsfunktioner

Hanterad beräkning (förhandsversion) stöder:

  • Enhetlig Foundry-slutpunkt och autentisering — Använd samma slutpunkt för projektet, API-nycklar, Microsoft Entra ID och privata nätverk som för distributioner med betalning per token och etablerad genomströmning. Slutsatsdragningsvägar använder <endpoint>/managed-deployments/<deployment-name>/. Chat-completions-kompatibla runtider fungerar också på standardrouten /openai/v1/ med OpenAI SDK:t.
  • Dimensionering av modellinstanser – Driftsättningar dimensioneras utifrån modellen. Du behöver inte välja SKU:er för virtuella datorer eftersom Foundry väljer GPU:er per instans baserat på modellstorlek, arkitektur, kontextlängd och om arbetsbelastningen är optimerad för svarstid eller dataflöde.
  • Optimerade slutsatsdragningskörningar – Microsoft kuraterade vLLM-, SGLang- och NVIDIA NIM-containrar med kontinuerlig batchbearbetning och tensorparallellitet.
  • Acceleratorfamiljer – A100 (80 GB), H100 (80 GB) och MI300X (192 GB).
  • Automatisk skalning och skalning till noll – Skala automatiskt från livetrafik eller skala manuellt. Konfigurera en tidsgräns för inaktivitet så att distributionen skalas till noll när ingen trafik kommer, vilket gör att faktureringen stoppas omedelbart.
  • Körmiljöer som hanteras av Microsoft – Microsoft äger körmiljöer för distribution, basavbildningar för containrar och säkerhetskorrigeringar. Uppdateringar appliceras automatiskt på aktiva driftsättningar.
  • Observerbarhetsmått – Varje distribution genererar API-anropsantal efter statuskod och percentiler för svarstid. Chattkompletteringsmodeller returnerar också antal indata- och utdata-token, percentiler för tid till första token (TTFT) och percentiler för total svarstid, grupperade efter tid.

Fakturering och kvot

Hanterad beräkningsfakturering sker per timme per accelerator-SKU, med dataflöde per GPU som underliggande faktureringsenhet. Automatisk skalning och skalning till noll anpassar kostnaden efter den faktiska trafiken så att debiteringen upphör omedelbart när instanserna skalas ned.

Kvoten beviljas per accelerator-SKU och region genom kvotprocessen för Foundry och är separat från Azure VM-kvot. Virtuella Azure-datorer är ett IaaS-erbjudande (infrastruktur som en tjänst) med regionala SKU:er. Hanterad beräkning är ett PaaS-erbjudande som i första hand utgår från bearbetning i Global och Data Zone. Befintlig Azure VM-kvot kan inte tillämpas på en hanterad beräkningsdistribution.

Hanterad beräkning är för närvarande tillgänglig för global distribution. Prisberäkningar finns i priskalkylatorn Azure.

Kom igång

Information om hur du kommer igång med hanterad beräkningsdistribution finns i Distribuera modeller med öppen källkod med hanterad beräkning.

Jämförelse av distributionsalternativ

Använd serverlöst API när det är möjligt. I följande tabell jämförs funktionerna mellan de två distributionsalternativen:

Note

Direktåtkomst (förhandsversion) är inte ett distributionsalternativ i den här jämförelsen. Den anropar modeller som stöds efter namn utan att skapa ett serverlöst API eller hanterad beräkningsdistribution.

Kapacitet Serverlöst API Hanterad beräkning
Vilka modeller kan distribueras? Alla Foundry-modeller, inklusive Foundry-modeller som säljs av Azure och välj modeller från partner och community Modeller med öppen källkod och partner från modellkatalogen, NVIDIA NIM och branschmodeller
Distributionsresurs gjuteriresurs Gjuteri projekt
Kräver AI Hub Nej Nej
Alternativ för databehandling Regional, data-zon, global Global
Privata nätverk Ja Ja
Innehållsfiltrering Inbyggda och anpassningsbara Inte tillgängligt i offentlig förhandsversion
Nyckellös autentisering Ja (Microsoft Entra ID och nyckelbaserad) Ja (Microsoft Entra ID och nyckelbaserad)
Fakturering Tokenanvändning eller allokerade dataflödesenheter Per timme och accelerator-SKU

Tips

Detaljerad prisinformation finns i Planera och hantera kostnader för Microsoft Foundry.