Notitie
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen u aan te melden of de directory te wijzigen.
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen de mappen te wijzigen.
Wanneer u een model in Microsoft Foundry implementeert, kiest u een implementatietype dat bepaalt:
- Waar uw gegevens worden verwerkt (globaal, gegevenszone of één regio)
- Hoe u betaalt (betalen per token of gereserveerde capaciteit)
- Prestatiekenmerken (afwijking van latentie, doorvoerlimieten)
Deze implementatietypen zijn van toepassing op de optie voor serverloze API-implementatie . Opensource- en aangepaste modellen die gebruikmaken van beheerde berekeningen , gebruiken deze typen niet. Zie Het implementatieoverzicht voor Microsoft Foundry-modellen voor de verschillende opties.
De service biedt drie hoofdcategorieën: standaard (betalen per token), ingericht (gereserveerde capaciteit) en batch (asynchrone verwerking met korting). Er is ook een type ontwikkelaar beschikbaar voor een verfijnde modelevaluatie. Binnen de standaard- en ingerichte categorieën kunt u globale, gegevenszone of regionale verwerking kiezen op basis van uw nalevingsvereisten.
Tip
U hoeft niet altijd een implementatie te maken. Met directe toegang (preview) roept u ondersteunde modellen aan op naam en start u onmiddellijk deductie uit te voeren, zonder dat er implementatie is vereist.
Belangrijk
Gegevenslocatie voor alle implementatietypen: Gegevens die in rust zijn opgeslagen, blijven in de aangewezen Azure geografie. Inferentiegegevens worden echter als volgt verwerkt:
- Global types: kunnen worden verwerkt in elke Azure-regio
- Gegevenszonetypen: de service verwerkt gegevens alleen binnen de Microsoft opgegeven gegevenszone (VS, EU of Azië en Stille Oceaan (APAC)).
- Standaardtypen (één regio): de service verwerkt gegevens in de implementatieregio.
Beginnen met Global Standard
Voor de meeste workloads begint u met Global Standard. Het wordt eerst gestart wanneer een nieuw model wordt uitgebracht, de laagste prijs heeft en de breedste regiodekking biedt. Ga alleen naar een ander implementatietype als u een specifieke reden hebt, zoals gegevenslocatie, gereserveerde doorvoer of asynchrone batchverwerking.
Nieuwe implementatietypen worden beschikbaar in een setvolgorde: Globaal, vervolgens Gegevenszone en vervolgens één regio. Implementatietypen voor één regio komen voor het laatst binnen, hebben geen gegarandeerde beschikbaarheidsdatum en zijn afhankelijk van capaciteit die vrijkomt wanneer oudere modellen buiten gebruik worden gesteld. Zie Model starten en beschikbaarheid voor de gezaghebbende startvolgorde.
Vergelijking van implementatietypen
Met directe modellen kunt u deductie uitvoeren zonder een implementatie te maken, zodat ze geen implementatietypen zijn. Zie Direct toegang tot modellen als u een model wilt uitproberen.
| Implementatietype | SKU-code | Gegevensverwerking | Facturering | Het beste voor |
|---|---|---|---|---|
| Algemene standaard | GlobalStandard |
Elke Azure regio | Betalen per token | Algemene workloads, hoogste quotum |
| Globaal voorzien | GlobalProvisionedManaged |
Elke Azure regio | Gereserveerde PTU | Voorspelbare hoge doorvoer |
| Globale batch | GlobalBatch |
Elke Azure regio | 50% korting, 24 uur | Grote asynchrone opdrachten |
| Standaard gegevenszone | DataZoneStandard |
Binnen de gegevenszone | Betalen per token | Naleving van de gegevenszone EU/US/APAC |
| Gegevenszone geconfigureerd | DataZoneProvisionedManaged |
Binnen de gegevenszone | Gereserveerde PTU | Gegevenszone + voorspelbare doorvoer |
| Gegevenszonebatch | DataZoneBatch |
Binnen de gegevenszone | 50% korting | Grote asynchrone taken met gegevenszone |
| Standaard | Standard |
Eén regio | Betalen per token | Regionale naleving, laag volume |
| Regionaal voorzien | ProvisionedManaged |
Eén regio | Gereserveerde PTU | Regionale naleving en doorvoer |
| Ontwikkelaar | DeveloperTier |
Elke Azure regio | Betalen per token | Alleen een aangepaste modelevaluatie (levensduur van 24 uur, geen SLA of gegevenslocatiegarantie) |
Opmerking
Niet alle modellen ondersteunen alle implementatietypen. Controleer Foundry Models verkocht door Azure voor de beschikbaarheid van modellen per implementatietype en regio.
SLA-garanties variëren per implementatietype. Ingerichte typen bieden gegarandeerde doorvoer en een lagere latentievariantie. Standaardtypen bieden de best effort-service. Ontwikkelaarsimplementaties bevatten geen SLA. Zie de SLA Azure voor Azure OpenAI Service voor meer informatie.
Tip
Zie Azure OpenAI Service prijzen voor gedetailleerde prijzen.
Het juiste implementatietype kiezen
Gebruik de volgende tabel voor een snelle aanbeveling en verfijn deze vervolgens met de volgende criteria.
| Requirement | Aanbevolen niveau |
|---|---|
| Standaard: nieuwste modellen, laagste prijs, breedste regio's | Algemene standaard |
| Gereserveerde, voorspelbare doorvoer | Globaal geprovisioneerd |
| Verwerking binnen een gegevenszone behouden | Data Zone Standard of Data Zone Provisioned |
| Gegevenslocatie plus gereserveerde doorvoer | Gegevenszone voorzien |
| Verwerking vastmaken aan één regio | Standaard of regionaal ingericht (indien ondersteund) |
| Grote asynchrone taken tegen lagere kosten | Global Batch of Data Zone Batch (indien ondersteund) |
| Een nauwkeurig afgestemd model evalueren (tijdelijk, geen SLA) | Ontwikkelaar |
Op basis van gegevenslocatievereisten
- Geen beperkingen: Global Standard of Global Provisioned gebruiken
- Eu-, VS- of APAC-gegevenszone: gegevenszonestandaard of gegevenszone gebruiken die is ingericht in een regio binnen die gegevenszone
- Alleen één regio: Standaard of Regionaal ingericht gebruiken
Zie Data Zone-implementaties voor de exacte regio's in elke gegevenszone.
Op werkbelastingpatroon
- Snel aan de slag, prototypen of een nieuw model proberen: gebruik directe toegang (preview) ( geen implementatie nodig)
- Variabel, bursty verkeer: Standard of Global Standard gebruiken (betalen per token)
- Consistent hoog volume: Ingerichte typen gebruiken (gereserveerde capaciteit)
- Grote batchtaken (niet tijdgevoelig): Gebruik Global Batch of Data Zone Batch (50% kostenbesparingen)
- Nauwkeurig afgestemde modelevaluatie: Ontwikkelaars gebruiken (geen SLA, laagste kosten)
Volgens latentievereiste
- Variantie met lage latentie vereist: Ingerichte typen gebruiken
- Afwijking van latentie acceptabel: Standaardtypen gebruiken
- Een nauwkeurig afgestemd model evalueren: Gebruik ontwikkelaars (geen SLA; niet bedoeld voor latentiegevoelige workloads).
Locaties voor gegevensverwerking
Standaardimplementaties en ingerichte implementaties bieden beide drie opties voor gegevensverwerking: globaal, gegevenszone en één regio (Azure geografie). Globale standaard is een veelvoorkomend startpunt voor de meeste workloads.
Wereldwijde implementaties
Globale implementaties maken gebruik van de globale infrastructuur van Azure om verkeer dynamisch te routeren naar beschikbare datacenters. Wereldwijde implementaties bieden de hoogste initiële doorvoerlimieten en de breedste beschikbaarheid van modellen.
Voor workloads met een hoog volume kan er een verhoogde latentievariatie optreden. Als u een lagere latentievariantie op schaal nodig hebt, gebruikt u ingerichte implementatietypen.
Globale implementaties ontvangen eerst nieuwe modellen en functies.
Implementaties van gegevenszones
Voor globale implementatietypen kan de service prompts en antwoorden verwerken in elke geografische locatie waar het model wordt geïmplementeerd. Voor implementatietypen van de gegevenszone verwerkt de service alleen prompts en antwoorden binnen de opgegeven gegevenszone:
- Verenigde Staten: de service verwerkt gegevens overal in de VS.
- Europese Unie: De dienst verwerkt gegevens binnen de Azure EU-gegevensgrens.
- Azië en Stille Oceaan: de service verwerkt gegevens binnen de APAC-gegevenszone.
De EU-gegevenszone volgt de Azure EU-gegevensgrens, waaronder landen en regio's van de Europese Vrijhandelsassociatie (EVA), zoals Noorwegen en Zwitserland, naast eu-lidstaten. De APAC-gegevenszone omvat meerdere Regio's in Azië en Stille Oceaan. Microsoft kan regio's toevoegen aan een van beide gegevenszones zonder voorafgaande kennisgeving om de capaciteit en beschikbaarheid te verbeteren. Zie voor de huidige uitsplitsing per regio de sectie Beschikbaarheid van modelregio's per implementatietype van Foundry-modellen die worden verkocht door Azure.
Opmerking
Met global Standard en Data Zone Standard implementatietypen, als de primaire regio een onderbreking van de service ondervindt, wordt al het verkeer dat in eerste instantie naar deze regio wordt gerouteerd, beïnvloed. Zie de handleiding voor hoge beschikbaarheid en herstel na noodgevallen voor meer informatie.
Algemene standaard
- SKU-naam in code:
GlobalStandard
Global Standard-implementaties maken gebruik van de globale infrastructuur van Azure om verkeer dynamisch te routeren naar beschikbare datacenters. Dit implementatietype biedt het hoogste standaardquotum en elimineert de noodzaak om taken over meerdere resources te verdelen.
Klanten met een hoog consistent volume kunnen meer latentievariabiliteit ervaren. De drempelwaarde wordt per model ingesteld. Zie de pagina Quota voor meer informatie. Voor toepassingen waarvoor een lagere latentievariantie nodig is bij een groot workloadgebruik, kunt u overwegen om ingerichte doorvoer te gebruiken.
Global Standard ondersteunt prioriteitsverwerking voor snellere reactietijden op basis van betalen per gebruik. Zie Prioriteitsverwerking voor Foundry-modellen voor meer informatie.
Globaal geprovisioneerd
- SKU-naam in code:
GlobalProvisionedManaged
Globale ingerichte implementaties maken gebruik van de globale infrastructuur van Azure om verkeer dynamisch te routeren naar beschikbare datacenters. Dit implementatietype biedt gereserveerde modelverwerkingscapaciteit voor voorspelbare doorvoer, waarbij wereldwijde routering wordt gecombineerd met gegarandeerde capaciteit.
Met ingerichte doorvoer koopt u een vast aantal ingerichte doorvoereenheden (PTU's) die een specifiek verwerkingscapaciteitsniveau garanderen. Dit implementatietype biedt een lagere en consistentere latentie dan Global Standard. Zie Concepten voor voorziene doorvoer voor meer informatie.
Globale batch
- SKU-naam in code:
GlobalBatch
Global Batch verwerkt grootschalige en grote verwerkingstaken. U kunt asynchrone groepen aanvragen verwerken met een afzonderlijk quotum en een omlooptijd van 24 uur, tegen 50% minder kosten dan Global Standard. Met batchverwerking, in plaats van één aanvraag tegelijk te verzenden, verzendt u een groot aantal aanvragen in één bestand. Globale batch-aanvragen hebben een afzonderlijk geënqueueerd tokenquotum, wat elke verstoring van uw onlineworkloads voorkomt.
Veelvoorkomende gebruiksvoorbeelden:
- Grootschalige gegevensverwerking: gegevenssets parallel analyseren.
- Inhoudsgeneratie: Maak grote hoeveelheden tekst, zoals productbeschrijvingen of artikelen.
- Documentbeoordeling en samenvatting: lange documenten verwerken en samenvatten.
- Automatisering van klantondersteuning: meerdere query's tegelijk verwerken.
- Gegevensextractie en -analyse: gegevens extraheren en analyseren uit grote hoeveelheden ongestructureerde gegevens.
- NLP-taken (Natural Language Processing): Sentimentanalyse of vertaling uitvoeren op grote gegevenssets.
Opmerking
Batch-implementaties ruilen real-time reactietijd in voor kostenbesparingen. Batch-aanvragen hebben geen realtime SLA. Ze zijn gericht op voltooiing binnen 24 uur, maar kunnen langer duren.
Standaard gegevenszone
- SKU-naam in code:
DataZoneStandard
Standaardimplementaties voor gegevenszones routeren dynamisch verkeer naar datacenters binnen de Microsoft gedefinieerde gegevenszone (VS, EU of APAC). Dit implementatietype biedt hogere standaardquota dan implementatietypen voor één regio, terwijl gegevens binnen de opgegeven zone worden opgeslagen.
Klanten met een hoog consistent volume kunnen meer latentievariabiliteit ervaren. De drempelwaarde wordt per model ingesteld. Zie de pagina quota en limieten voor meer informatie. Overweeg ingerichte implementatietypen voor workloads waarvoor een afwijking met lage latentie op grote volumes is vereist.
Data Zone Standard biedt ondersteuning voor prioriteitsverwerking voor snellere reactietijden op basis van betalen per gebruik. Zie Prioriteitsverwerking voor Foundry-modellen voor meer informatie.
Gegevenszone voorzien
- SKU-naam in code:
DataZoneProvisionedManaged
Implementaties met ingerichte gegevenszone routeren verkeer dynamisch binnen de door Microsoft opgegeven gegevenszone (VS, EU of APAC), waarbij tevens gereserveerde modelverwerkingscapaciteit wordt geboden. Dit implementatietype combineert de naleving van de gegevenszone met een hoge en voorspelbare doorvoer.
Batch van gegevenszone
- SKU-naam in code:
DataZoneBatch
Data Zone Batch-implementaties bieden dezelfde functionaliteit als Global Batch, waaronder 50% kostenbesparingen en 24-uurs turnaround. Verkeer wordt alleen doorgestuurd naar datacenters binnen de Microsoft gedefinieerde gegevenszone (VS, EU of APAC).
Standaard
- SKU-naam in code:
Standard
Standaardimplementaties maken gebruik van facturering per token. U betaalt alleen voor wat u verbruikt. Modellen die beschikbaar zijn in elke regio en doorvoer, zijn mogelijk beperkt.
Standaardimplementaties zijn geschikt voor workloads met een laag tot gemiddeld volume met een hoge burstiviteit. Klanten met een hoog consistent volume kunnen meer latentievariabiliteit ervaren.
Regionaal voorzien
- SKU-naam in code:
ProvisionedManaged
Met regionale ingerichte implementaties kunt u de hoeveelheid doorvoer opgeven die u nodig hebt in een implementatie. De service wijst vervolgens de benodigde modelverwerkingscapaciteit toe en zorgt ervoor dat deze gereed is voor u. Doorvoer wordt gedefinieerd in termen van ingerichte doorvoereenheden (PTU's). Dit is een genormaliseerde manier om de doorvoer voor uw implementatie weer te geven. Elk modelversiepaar vereist verschillende hoeveelheden PTU's om te implementeren en biedt verschillende hoeveelheden doorvoer per PTU. De minimale PTU-vereisten variëren per model. Zie Concepten voor ingerichte doorvoer voor de huidige minimum- en beschikbare capaciteit.
Ontwikkelaar (voor nauwkeurig afgestemde modellen)
- SKU-naam in code:
DeveloperTier
Het implementatietype Ontwikkelaar is alleen ontworpen voor een nauwkeurig afgestemde modelevaluatie. Het biedt kostenefficiënte tests van aangepaste modellen, maar bevat geen garanties voor gegevenslocatie of een SLA. Ontwikkelaarsimplementaties hebben een vaste levensduur van 24 uur en worden na verloop van tijd automatisch verwijderd. Zie de handleiding voor het afstemmen voor meer informatie over het gebruik van het implementatietype Ontwikkelaar.
Implementatieproblemen oplossen
Veelvoorkomende problemen bij het maken of gebruiken van implementaties:
| Probleem | Oorzaak | Resolutie |
|---|---|---|
| Implementatietype niet beschikbaar | Het geselecteerde type wordt niet ondersteund door het model | Beschikbaarheid van modellen controleren op implementatietype |
| Quotum overschreden | Abonnementslimiet bereikt voor tokens per minuut | Quotumverhoging aanvragen in Azure portal of een andere regio gebruiken |
| Regio niet beschikbaar | Model niet geïmplementeerd in geselecteerde regio | Selecteer een regio in de beschikbaarheidslijst van het model |
| Ingerichte capaciteit niet beschikbaar | Geen PTU-capaciteit in regio | Probeer een andere regio of gebruik Global Provisioned voor een bredere beschikbaarheid |
Zie Foundry Models-quota en -limieten voor quotumlimieten per implementatietype.
Implementatietypen beperken met Azure Policy
Azure Policy helpt bij het afdwingen van organisatiestandaarden en het beoordelen van naleving op schaal. Via het nalevingsdashboard kunt u de algehele status van de omgeving evalueren en inzoomen op granulariteit per resource, per beleid. Azure Policy ondersteunt ook bulksgewijs herstel voor bestaande resources en automatisch herstel voor nieuwe resources. Meer informatie over Azure Policy en specifieke ingebouwde besturingselementen voor Foundry Tools.
Gebruik het volgende beleid om de toegang tot een specifiek Foundry-implementatietype uit te schakelen. Vervang GlobalStandard door de SKU-naam voor het implementatietype dat u wilt beperken.
{
"mode": "All",
"policyRule": {
"if": {
"allOf": [
{
"field": "type",
"equals": "Microsoft.CognitiveServices/accounts/deployments"
},
{
"field": "Microsoft.CognitiveServices/accounts/deployments/sku.name",
"equals": "GlobalStandard"
}
]
}
}
}
Verwante inhoud
- Implementeer Microsoft Foundry-modellen in de Foundry-portal
- Maak en implementeer een Azure OpenAI in Microsoft Foundry Models-resource
- Foundry-modellen verkocht door Azure
- Beschikbaarheid van modelregio's per implementatietype
- quotas en limieten voor Microsoft Foundry Models
- Concepten voor geconfigureerde doorvoer
- Globale Batch-verwerking
- Azure OpenAI Service prijsstelling
- Gegevensprivacy en -beveiliging voor Foundry-modellen
- Hoge beschikbaarheid en herstel na noodgevallen