Notitie
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen u aan te melden of de directory te wijzigen.
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen de mappen te wijzigen.
Microsoft Foundry Models is de hub voor het detecteren en implementeren van een breed scala aan AI-modellen voor generatieve AI-toepassingen. Als u een model beschikbaar wilt maken voor deductieaanvragen, implementeert u het. Foundry biedt twee implementatieopties, afhankelijk van het modeltype en uw infrastructuurbehoeften.
Tip
U hoeft niet altijd een implementatie te maken. Met directe toegang (preview) roept u ondersteunde modellen aan op naam en start u onmiddellijk deductie uit te voeren, zonder dat er implementatie is vereist.
Implementatieopties
Foundry biedt twee implementatieopties:
- Serverloze API: Voor Foundry-modellen, waaronder Foundry-modellen die worden verkocht door Azure en selecteer modellen van partners en community's. Deze optie is het voorkeurs- en meest geschikte implementatiepad. Het omvat de standaard, ingerichte doorvoer, batch- en ontwikkelaarsimplementatietypen.
- Beheerde rekenkracht (preview) - Voor opensource-, partner- en aangepaste modellen die worden uitgevoerd op toegewezen GPU-capaciteit die Foundry voor u beheert.
Foundry selecteert de juiste implementatieoptie op basis van het model dat u kiest.
Als u alleen een ondersteund model hoeft te proberen, kunt u de implementatie volledig overslaan en directe toegang (preview) gebruiken, die modellen op naam aanroept zonder een serverloze API of beheerde rekenimplementatie te maken.
Zie Vergelijking van implementatieopties voor een vergelijking van volledige mogelijkheden.
Serverloze API
Serverloze API is de voorkeursimplementatieoptie in Foundry. Het biedt ondersteuning voor het breedste scala aan mogelijkheden en implementatietypen.
Welke modellen maken gebruik van serverloze API-implementaties?
Alle Foundry-modellen, waaronder Foundry-modellen die door Azure worden verkocht en selecteer Modellen van partners en community, gebruiken serverloze API-implementaties. Foundry-modellen die door Azure worden verkocht, omvatten alle Azure OpenAI-modellen en geselecteerde modellen van topproviders die worden gefactureerd via uw Azure-abonnement, gedekt door Azure serviceovereenkomsten en ondersteund door Microsoft. Modellen van partners en community's die gebruikmaken van serverloze API-implementaties omvatten Anthropic modellen en specifieke modellen van partners zoals Mistral, Cohere en Meta.
Serverloze API-mogelijkheden
Ondersteuning voor serverloze API-implementaties:
- Meerdere implementatietypen (of implementatie-SKU’s) — Global Standard, Data Zone Standard, Standard (één regio), geprovisioneerd, batch en meer. Elk type bepaalt waar gegevens worden verwerkt en hoe u betaalt. Zie Deployment-typen voor Microsoft Foundry Models voor meer informatie.
- Flexibiliteit voor gegevensverwerking : kies regionale, gegevenszone (VS, EU of APAC) of wereldwijde verwerking op basis van uw nalevingsvereisten.
- Content filtering : ingebouwde Azure AI Content Veiligheid filters met aanpasbare configuraties.
- Sleutelloze verificatie — Microsoft Entra ID (aanbevolen) en verificatie op basis van sleutels.
- Privénetwerken : integratie van virtuele netwerken voor beveiligde toegang.
- Ingerichte doorvoer: gereserveerde capaciteit met ingerichte doorvoereenheden (PTU's) voor voorspelbare prestaties met lage latentie. Zie Ingerichte doorvoer voor meer informatie.
Resourcevereisten
Serverloze API-implementaties zijn beschikbaar in:
- Foundry-resources : het primaire resourcetype voor nieuwe Foundry-projecten. Er is geen AI Hub vereist.
- Azure OpenAI-resources— Als u Azure OpenAI-resources gebruikt, worden in de modelcatalogus alleen Azure OpenAI-modellen weergegeven voor implementatie. Voer een upgrade uit naar een Foundry-resource voor toegang tot de volledige set Foundry-modellen.
Zie Deploy Microsoft Foundry Models in the Foundry portal of Deploy models using Azure CLI and Bicep om aan de slag te gaan met serverloze API-implementaties.
Implementatie van beheerde rekenkracht (preview)
Note
Beheerde rekenkracht in Foundry is momenteel beschikbaar als openbare preview. Deze preview wordt aangeboden zonder een service level agreement en we raden deze niet aan voor productieworkloads. Bepaalde functies worden mogelijk niet ondersteund of hebben mogelijk beperkte mogelijkheden. Zie Aanvullende gebruiksvoorwaarden voor Microsoft Azure Previews voor meer informatie.
Beheerde rekenkracht in Foundry (preview) is een beheerde GPU-platform-as-a-service (PaaS) die opensource- en aangepaste modellen host op toegewezen GPU-capaciteit. U krijgt toegang tot beheerde rekendeployments via hetzelfde Foundry-projecteindpunt als andere deploymenttypen, zonder dat u zelf virtuele machines, clusters of serving-runtimes hoeft te beheren. Foundry maakt de implementatie groot, richt de accelerators in en houdt de runtime gepatcht.
Belangrijk
Beheerde rekenkracht ondersteunt opensource-, partner-, branche- en aangepaste modellen. Beheerde rekenimplementaties worden geleverd op het eindpunt van het unified Foundry-project, met behulp van dezelfde verificatie, netwerken en SDK-oppervlak.
Welke modellen maken gebruik van beheerde berekeningen?
U kunt modellen implementeren vanuit de Hugging Face Collection met behulp van beheerde berekeningen. Enkele voorbeelden:
- Qwen-modellen
- NVIDIA Nemotron-modellen
- Geselecteerde metamodellen
- Geselecteerde Mistrale modellen
Microsoft Foundry's catalogus bevat een grote en groeiende selectie van opensource- en partnermodellen. Zie de modelcatalogus voor de huidige catalogus.
Mogelijkheden voor beheerde berekeningen
Beheerde rekenresources (Preview) ondersteunt:
-
Unified Foundry-eindpunt en -verificatie: gebruik hetzelfde projecteindpunt, API-sleutels, Microsoft Entra ID en privénetwerken als betalen per token en ingerichte doorvoerimplementaties. Inferentieroutes gebruiken
<endpoint>/managed-deployments/<deployment-name>/. Runtimes die compatibel zijn met chatcompletions werken ook via de standaardroute/openai/v1/met de OpenAI SDK. - Dimensionering van modelinstanties — Implementaties worden gedimensioneerd in modelgerichte termen. U hoeft geen SKU's voor virtuele machines te kiezen, omdat Foundry GPU's per exemplaar kiest op basis van modelgrootte, architectuur, contextlengte en of de workload is geoptimaliseerd voor latentie of doorvoer.
- Geoptimaliseerde inferentie-runtimes — door Microsoft samengestelde vLLM-, SGLang- en NVIDIA NIM-containers met continue batchverwerking en tensorparallelisme.
- Acceleratorfamilies : A100 (80 GB), H100 (80 GB) en MI300X (192 GB).
- Automatisch schalen en schalen naar nul : automatisch schalen vanuit live verkeer of handmatig schalen. Configureer een time-out voor inactiviteit, zodat de implementatie naar nul wordt geschaald wanneer er geen verkeer binnenkomt, waardoor de facturering onmiddellijk stopt.
- Door Microsoft beheerde runtimeomgevingen — Microsoft is eigenaar van runtimeomgevingen voor uitvoering, basiscontainerimages en beveiligingspatches. Updates worden automatisch toegepast op live-implementaties.
- Metrische gegevens over waarneembaarheid : elke implementatie verzendt het aantal API-aanroepen op statuscode en percentielen voor reactietijd. Modellen voor chatvoltooiing verzenden ook het aantal invoer- en uitvoertoken, TTFT-percentielen (time-to-first-token) en het totale aantal percentielen voor reactietijd, gegroepeerd op tijd.
Facturering en quotum
Facturering voor beheerde compute gebeurt per uur per accelerator-SKU, waarbij de doorvoer per GPU de onderliggende factureringseenheid is. Automatisch schalen en naar nul schalen stemmen de kosten af op het daadwerkelijke verkeer, zodat de facturatie onmiddellijk stopt wanneer instanties worden teruggeschaald.
Quotum wordt per SKU van de accelerator per regio toegekend via het Foundry-quotumproces en staat los van het Azure VM-quotum. Azure Virtual Machines is een infrastructuur-als-een-serviceaanbod (IaaS) met regionale SKU's; beheerde rekenkracht is een PaaS-aanbod waarbij Global- en Data Zone-verwerking vooropstaan. Bestaande Azure VM-quotum kan niet worden toegepast op een beheerde rekenprocesimplementatie.
Beheerde berekening is momenteel beschikbaar voor wereldwijde implementatie. Zie de Azure prijscalculator voor prijsramingen.
Aan de slag gaan
Zie Opensource-modellen implementeren met beheerde berekeningen om aan de slag te gaan met beheerde rekenkracht.
Vergelijking van implementatieopties
Gebruik waar mogelijk serverloze API . In de volgende tabel worden de mogelijkheden voor de twee implementatieopties vergeleken:
Note
Directe toegang (preview) is geen implementatieoptie in deze vergelijking. Het roept ondersteunde modellen op naam aan zonder een serverloze API of beheerde rekenimplementatie te maken.
| Vermogen | Serverloze API | Beheerde rekenkracht |
|---|---|---|
| Welke modellen kunnen worden geïmplementeerd? | Alle Foundry Models, waaronder Foundry Models verkocht door Azure en geselecteerde modellen van partners en de community | Opensource- en partnermodellen uit de modelcatalogus, NVIDIA NIM en branchemodellen |
| Inzetresource | Gieterijhulpbron | Gieterijproject |
| Vereist AI Hub | Nee | Nee |
| Opties voor gegevensverwerking | Regionaal, gegevenszone, globaal | Wereldwijd |
| Privénetwerken | Ja | Ja |
| Inhoudsfiltering | Ingebouwd en aanpasbaar | Niet beschikbaar in openbare preview |
| Sleutelloze verificatie | Ja (Microsoft Entra ID en op basis van sleutels) | Ja (Microsoft Entra ID en op basis van sleutels) |
| Facturering | Tokengebruik of geconfigureerde doorvoereenheden | Per uur per SKU van de accelerator |
Tip
Zie Plan en beheer de kosten voor Microsoft Foundry voor gedetailleerde prijsinformatie.
Verwante inhoud
- Deploymenttypen voor Microsoft Foundry Models
- Implementeer Microsoft Foundry-modellen in de Foundry-portal
- Implementeer modellen met behulp van de Azure CLI en Bicep
- Foundry-modellen verkocht door Azure
- Foundry Models van partners en de gemeenschap
- overzicht van Microsoft Foundry Models
- Beheerde rekenkracht in Microsoft Foundry