Implementatieoverzicht voor Microsoft Foundry-modellen

Microsoft Foundry Models is de hub voor het detecteren en implementeren van een breed scala aan AI-modellen voor generatieve AI-toepassingen. Als u een model beschikbaar wilt maken voor deductieaanvragen, implementeert u het. Foundry biedt twee implementatieopties, afhankelijk van het modeltype en uw infrastructuurbehoeften.

Tip

U hoeft niet altijd een implementatie te maken. Met directe toegang (preview) roept u ondersteunde modellen aan op naam en start u onmiddellijk deductie uit te voeren, zonder dat er implementatie is vereist.

Implementatieopties

Foundry biedt twee implementatieopties:

  • Serverloze API: Voor Foundry-modellen, waaronder Foundry-modellen die worden verkocht door Azure en selecteer modellen van partners en community's. Deze optie is het voorkeurs- en meest geschikte implementatiepad. Het omvat de standaard, ingerichte doorvoer, batch- en ontwikkelaarsimplementatietypen.
  • Beheerde rekenkracht (preview) - Voor opensource-, partner- en aangepaste modellen die worden uitgevoerd op toegewezen GPU-capaciteit die Foundry voor u beheert.

Foundry selecteert de juiste implementatieoptie op basis van het model dat u kiest.

Als u alleen een ondersteund model hoeft te proberen, kunt u de implementatie volledig overslaan en directe toegang (preview) gebruiken, die modellen op naam aanroept zonder een serverloze API of beheerde rekenimplementatie te maken.

Diagram met de keuze tussen directe toegang, serverloze API-implementatietypen per startvolgorde en beheerde berekening.

Zie Vergelijking van implementatieopties voor een vergelijking van volledige mogelijkheden.

Serverloze API

Serverloze API is de voorkeursimplementatieoptie in Foundry. Het biedt ondersteuning voor het breedste scala aan mogelijkheden en implementatietypen.

Welke modellen maken gebruik van serverloze API-implementaties?

Alle Foundry-modellen, waaronder Foundry-modellen die door Azure worden verkocht en selecteer Modellen van partners en community, gebruiken serverloze API-implementaties. Foundry-modellen die door Azure worden verkocht, omvatten alle Azure OpenAI-modellen en geselecteerde modellen van topproviders die worden gefactureerd via uw Azure-abonnement, gedekt door Azure serviceovereenkomsten en ondersteund door Microsoft. Modellen van partners en community's die gebruikmaken van serverloze API-implementaties omvatten Anthropic modellen en specifieke modellen van partners zoals Mistral, Cohere en Meta.

Serverloze API-mogelijkheden

Ondersteuning voor serverloze API-implementaties:

  • Meerdere implementatietypen (of implementatie-SKU’s) — Global Standard, Data Zone Standard, Standard (één regio), geprovisioneerd, batch en meer. Elk type bepaalt waar gegevens worden verwerkt en hoe u betaalt. Zie Deployment-typen voor Microsoft Foundry Models voor meer informatie.
  • Flexibiliteit voor gegevensverwerking : kies regionale, gegevenszone (VS, EU of APAC) of wereldwijde verwerking op basis van uw nalevingsvereisten.
  • Content filtering : ingebouwde Azure AI Content Veiligheid filters met aanpasbare configuraties.
  • Sleutelloze verificatie — Microsoft Entra ID (aanbevolen) en verificatie op basis van sleutels.
  • Privénetwerken : integratie van virtuele netwerken voor beveiligde toegang.
  • Ingerichte doorvoer: gereserveerde capaciteit met ingerichte doorvoereenheden (PTU's) voor voorspelbare prestaties met lage latentie. Zie Ingerichte doorvoer voor meer informatie.

Resourcevereisten

Serverloze API-implementaties zijn beschikbaar in:

  • Foundry-resources : het primaire resourcetype voor nieuwe Foundry-projecten. Er is geen AI Hub vereist.
  • Azure OpenAI-resources— Als u Azure OpenAI-resources gebruikt, worden in de modelcatalogus alleen Azure OpenAI-modellen weergegeven voor implementatie. Voer een upgrade uit naar een Foundry-resource voor toegang tot de volledige set Foundry-modellen.

Zie Deploy Microsoft Foundry Models in the Foundry portal of Deploy models using Azure CLI and Bicep om aan de slag te gaan met serverloze API-implementaties.

Implementatie van beheerde rekenkracht (preview)

Note

Beheerde rekenkracht in Foundry is momenteel beschikbaar als openbare preview. Deze preview wordt aangeboden zonder een service level agreement en we raden deze niet aan voor productieworkloads. Bepaalde functies worden mogelijk niet ondersteund of hebben mogelijk beperkte mogelijkheden. Zie Aanvullende gebruiksvoorwaarden voor Microsoft Azure Previews voor meer informatie.

Beheerde rekenkracht in Foundry (preview) is een beheerde GPU-platform-as-a-service (PaaS) die opensource- en aangepaste modellen host op toegewezen GPU-capaciteit. U krijgt toegang tot beheerde rekendeployments via hetzelfde Foundry-projecteindpunt als andere deploymenttypen, zonder dat u zelf virtuele machines, clusters of serving-runtimes hoeft te beheren. Foundry maakt de implementatie groot, richt de accelerators in en houdt de runtime gepatcht.

Belangrijk

Beheerde rekenkracht ondersteunt opensource-, partner-, branche- en aangepaste modellen. Beheerde rekenimplementaties worden geleverd op het eindpunt van het unified Foundry-project, met behulp van dezelfde verificatie, netwerken en SDK-oppervlak.

Welke modellen maken gebruik van beheerde berekeningen?

U kunt modellen implementeren vanuit de Hugging Face Collection met behulp van beheerde berekeningen. Enkele voorbeelden:

  • Qwen-modellen
  • NVIDIA Nemotron-modellen
  • Geselecteerde metamodellen
  • Geselecteerde Mistrale modellen

Microsoft Foundry's catalogus bevat een grote en groeiende selectie van opensource- en partnermodellen. Zie de modelcatalogus voor de huidige catalogus.

Mogelijkheden voor beheerde berekeningen

Beheerde rekenresources (Preview) ondersteunt:

  • Unified Foundry-eindpunt en -verificatie: gebruik hetzelfde projecteindpunt, API-sleutels, Microsoft Entra ID en privénetwerken als betalen per token en ingerichte doorvoerimplementaties. Inferentieroutes gebruiken <endpoint>/managed-deployments/<deployment-name>/. Runtimes die compatibel zijn met chatcompletions werken ook via de standaardroute /openai/v1/ met de OpenAI SDK.
  • Dimensionering van modelinstanties — Implementaties worden gedimensioneerd in modelgerichte termen. U hoeft geen SKU's voor virtuele machines te kiezen, omdat Foundry GPU's per exemplaar kiest op basis van modelgrootte, architectuur, contextlengte en of de workload is geoptimaliseerd voor latentie of doorvoer.
  • Geoptimaliseerde inferentie-runtimes — door Microsoft samengestelde vLLM-, SGLang- en NVIDIA NIM-containers met continue batchverwerking en tensorparallelisme.
  • Acceleratorfamilies : A100 (80 GB), H100 (80 GB) en MI300X (192 GB).
  • Automatisch schalen en schalen naar nul : automatisch schalen vanuit live verkeer of handmatig schalen. Configureer een time-out voor inactiviteit, zodat de implementatie naar nul wordt geschaald wanneer er geen verkeer binnenkomt, waardoor de facturering onmiddellijk stopt.
  • Door Microsoft beheerde runtimeomgevingen — Microsoft is eigenaar van runtimeomgevingen voor uitvoering, basiscontainerimages en beveiligingspatches. Updates worden automatisch toegepast op live-implementaties.
  • Metrische gegevens over waarneembaarheid : elke implementatie verzendt het aantal API-aanroepen op statuscode en percentielen voor reactietijd. Modellen voor chatvoltooiing verzenden ook het aantal invoer- en uitvoertoken, TTFT-percentielen (time-to-first-token) en het totale aantal percentielen voor reactietijd, gegroepeerd op tijd.

Facturering en quotum

Facturering voor beheerde compute gebeurt per uur per accelerator-SKU, waarbij de doorvoer per GPU de onderliggende factureringseenheid is. Automatisch schalen en naar nul schalen stemmen de kosten af op het daadwerkelijke verkeer, zodat de facturatie onmiddellijk stopt wanneer instanties worden teruggeschaald.

Quotum wordt per SKU van de accelerator per regio toegekend via het Foundry-quotumproces en staat los van het Azure VM-quotum. Azure Virtual Machines is een infrastructuur-als-een-serviceaanbod (IaaS) met regionale SKU's; beheerde rekenkracht is een PaaS-aanbod waarbij Global- en Data Zone-verwerking vooropstaan. Bestaande Azure VM-quotum kan niet worden toegepast op een beheerde rekenprocesimplementatie.

Beheerde berekening is momenteel beschikbaar voor wereldwijde implementatie. Zie de Azure prijscalculator voor prijsramingen.

Aan de slag gaan

Zie Opensource-modellen implementeren met beheerde berekeningen om aan de slag te gaan met beheerde rekenkracht.

Vergelijking van implementatieopties

Gebruik waar mogelijk serverloze API . In de volgende tabel worden de mogelijkheden voor de twee implementatieopties vergeleken:

Note

Directe toegang (preview) is geen implementatieoptie in deze vergelijking. Het roept ondersteunde modellen op naam aan zonder een serverloze API of beheerde rekenimplementatie te maken.

Vermogen Serverloze API Beheerde rekenkracht
Welke modellen kunnen worden geïmplementeerd? Alle Foundry Models, waaronder Foundry Models verkocht door Azure en geselecteerde modellen van partners en de community Opensource- en partnermodellen uit de modelcatalogus, NVIDIA NIM en branchemodellen
Inzetresource Gieterijhulpbron Gieterijproject
Vereist AI Hub Nee Nee
Opties voor gegevensverwerking Regionaal, gegevenszone, globaal Wereldwijd
Privénetwerken Ja Ja
Inhoudsfiltering Ingebouwd en aanpasbaar Niet beschikbaar in openbare preview
Sleutelloze verificatie Ja (Microsoft Entra ID en op basis van sleutels) Ja (Microsoft Entra ID en op basis van sleutels)
Facturering Tokengebruik of geconfigureerde doorvoereenheden Per uur per SKU van de accelerator

Tip

Zie Plan en beheer de kosten voor Microsoft Foundry voor gedetailleerde prijsinformatie.