Gebruik deze architectuur als referentie voor het bouwen en implementeren van veilige, schaalbare AI-oplossingen voor gesprekken op Azure met foundry, Azure OpenAI en andere gerelateerde services. Het benadrukt privénetwerken, zoneredundantie en strikte beveiligingscontroles om naleving en bedrijfsgereedheid te garanderen.
Notitie
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen u aan te melden of de directory te wijzigen.
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen de mappen te wijzigen.
Dit artikel bevat architectuurpatronen en referentiearchitecturen voor basislijnen om u te helpen bij het ontwerpen, implementeren en beheren van AI-workloads op Azure. Het omvat de belangrijkste onderdelen, interacties en aanbevolen procedures voor het bouwen van veilige, schaalbare en goed beheerde AI-systemen.
Gebruik dit architectuurpatroon als basislijn bij het ontwerpen van AI-workloads. Begin met de belangrijkste onderdelen en interacties die in het patroon worden weergegeven en pas deze vervolgens aan zodat deze overeenkomen met uw bedrijfsdoelen, technische beperkingen en risicopostuur.
Een organisatie wil bijvoorbeeld een ai-assistenttoepassing voor ondernemingen bouwen waarmee werknemers vragen kunnen stellen over interne documenten en operationele gegevens. Wanneer een gebruiker een vraag stelt, weet de toepassing welke gegevens nodig zijn, haalt de relevante context op en roept het juiste model aan om een geaard antwoord te genereren. Hiervoor is een gegevenspijplijn nodig die interne documenten opschoont, verrijkt en indexeert, zodat de assistent vertrouwde, actuele context kan ophalen. Net als bij elke toepassing kunt u Well-Architected procedures gebruiken om de toepassing betrouwbaar, veilig en kosten geoptimaliseerd te houden.
Hoewel deze AI-assistent een specifiek bedrijfsscenario vertegenwoordigt, is het architectuurpatroon dat volgt algemeen genoeg om zich aan te passen aan veel AI-use cases met vergelijkbare kenmerken.
In dit artikel wordt u begeleid bij het algemene patroon waarmee u een basiskennis van de kernonderdelen, hun functies en interacties in een AI-workload tot stand brengt. Met deze basis kunt u weloverwogen ontwerpbeslissingen nemen om robuuste AI-oplossingen te bouwen terwijl u de architectuur aanpast aan uw specifieke use-case.
Architectuur van AI-workload op hoog niveau
In dit diagram ziet u de belangrijkste onderdelen die u in uw AI-workloadontwerp kunt hebben.
| Onderdeel | Description |
|---|---|
| Gegevensverwerking en analyse | Verzamel onbewerkte gegevens uit verschillende bronnen, schoon deze op, transformeer deze en organiseer deze in gegevenssets die gereed zijn voor modeltraining, fine-tuning en grounding. Deze laag communiceert niet rechtstreeks met gebruikers, maar maakt nauwkeurige, efficiënte AI-interacties downstream mogelijk. |
| Modeltraining en fijn-tuning | Train modellen op uw gegevens, volg versies en bewaak de prestaties via een herhaalbaar proces. Gebruik MLOps-procedures om te blijven verbeteren naarmate nieuwe gegevens binnenkomen en om de afstemming op bedrijfsbehoeften te behouden. |
| Intelligente AI-toepassingen | Hier communiceren gebruikers met uw AI. Het combineert vooraf getrainde modellen met toepassingslogica om de juiste informatie te vinden, knutselprompts, interfaces te bouwen en te leren van feedback. |
| AI-praktijken en processen | Houd uw AI-oplossing betrouwbaar door DevOps-principes, versiebeheer en geautomatiseerde pijplijnen in MLOps-werkstromen op te nemen. Implementeer iteratief met beveiligingen en controleer continu op nauwkeurigheid, prestaties en vooroordelen. |
| Platformservices en hulpprogramma's | Kerncloudservices die uw resources beveiligen, kosten beheren en de systeemstatus bewaken van ontwikkeling tot implementatie. Gebruik CI/CD-pijplijnen voor betrouwbare automatisering en gespecialiseerde hulpprogramma's om AI-uitvoer te scannen op naleving. |
Samenstelling van werkbelasting
In deze sectie worden twee hoofdworkloads beschreven: de workload van de intelligente toepassing en de trainings- en afstemmingsworkload. Elke workload heeft zijn eigen ontwerpoverwegingen voor levensduur en status, bereik en afhankelijkheden, schaalbaarheid en beschikbaarheid, en beveiliging en verantwoorde AI.
Niet alle AI-workloads vereisen trainings- en afstemmingsonderdelen. Als u alleen vooraf getrainde modellen gebruikt zonder aangepaste training, richt u zich op de workload van de intelligente toepassing. Als uw use-case echter bestaat uit het bouwen van aangepaste modellen of het continu verbeteren van deze modellen met nieuwe gegevens, wordt de trainings- en afstemmingsworkload essentieel. Beide workloads zijn modulair, zodat u de onderdelen kunt implementeren die relevant zijn voor uw specifieke use case, terwijl u de aanbevolen procedures volgt die worden beschreven in de ontwerpoverwegingen.
| Ontwerpkenmerk | Description |
|---|---|
| Levensduur en status |
De levensduur verwijst naar de verwachte duur van het bestaan en de actieve activiteit van een resource binnen de workload. Status verwijst naar de gegevens of informatie die een resource in de loop van de tijd onderhoudt. |
| Bereik en afhankelijkheden |
Reach verwijst naar de mate waarin een resource toegankelijk of gedistribueerd moet zijn. Afhankelijkheden verwijzen naar de relaties en vertrouwen op andere resources. |
| Schaalbaarheid en beschikbaarheid |
Schaalbaarheid is de mogelijkheid van een resource voor het afhandelen van verhoogde belasting of vraag. Beschikbaarheid is de mogelijkheid van een resource om operationeel en toegankelijk te blijven. |
| Beveiliging en verantwoorde AI |
Beveiliging verwijst naar de maatregelen die gegevens beschermen en naleving van regelgeving garanderen. Verantwoorde AI verwijst naar de procedures die ervoor zorgen dat ethische AI, inclusief billijkheid, transparantie en verantwoordelijkheid. |
In dit diagram ziet u de belangrijkste onderdelen van de workload van de intelligente toepassing die u in uw ontwerp wilt opnemen.
| Onderdeel | Description |
|---|---|
| Clientlaag | Met de clientlaag kunnen gebruikers en externe systemen verbinding maken met AI. Deze laag verwerkt uw verzoeken en retourneert AI-gegenereerde antwoorden, terwijl het ervoor zorgt dat de ervaring eenvoudig en gebruiksvriendelijk is. |
| Intelligence-laag - API | De API van de Intelligence-laag overbrugt clients en de intelligentiefuncties van het systeem via goed gedefinieerde API's. Het is verantwoordelijk voor het doorsturen van aanvragen naar het juiste agent- of indelingsproces, zodat interacties tussen gebruikers en services soepel en consistent zijn. Deze laag verwerkt ook hoe gegevens worden geopend, beveiligingsmaatregelen worden genomen en limieten worden ingesteld om te voorkomen dat het systeem overbelast raakt. Als een app alleen een eenvoudige voorspelling nodig heeft, kan deze laag de complexe indelingsstappen overslaan en de aanvraag rechtstreeks naar de deductie-engine verzenden voor een snel antwoord. |
| Intelligence-laag - orkestratie en agentberekening | Indelings- en agent-rekenlaag is verantwoordelijk voor het coördineren van de manier waarop verschillende AI-onderdelen samenwerken om elke taak uit te voeren. Afhankelijk van wat er nodig is, kan het taken één na de andere uitvoeren of meerdere agents tegelijkertijd laten werken en vervolgens hun resultaten samenvoegen. Het bepaalt de intentie van de gebruiker, controleert antwoorden om ervoor te zorgen dat ze veilig zijn, integreert met de kennislaag voor informatie en gebruikt hulpprogramma's om alles te combineren en u het beste antwoord te geven. |
| Intelligence-laag - gespreksbeheer | De gespreksbeheerlaag is het geheugen en de gespreksmanager van het systeem. Hierdoor kan de AI-chat op een natuurlijke manier functioneren door eerdere berichten te onthouden, lopende onderwerpen bij te houden en belangrijke onderdelen van de discussie op te slaan, zodat gesprekken soepel kunnen verlopen, zelfs tijdens lange sessies. Het zorgt er ook voor hoe de gespreksgegevens worden bewaard of verwijderd, zodat uw informatie op verantwoorde wijze wordt verwerkt. |
| Deductielaag - basis- of voorspellende modellen | De deductielaag is de plek waar een getraind model voorspellingen doet, inhoud genereert of beslissingen neemt op basis van de informatie die het ontvangt. Het proces begint met het laden van uw AI-model, het voorbereiden van de gegevens, het uitvoeren van de voorspellingen en het opmaken van de resultaten, zodat deze direct (realtime) of hoger beschikbaar zijn (batchverwerking). |
| Kennislaag | De kennislaag is waar het systeem de informatie en context ophaalt die nodig is om vragen nauwkeurig te beantwoorden. Het zorgt ervoor dat gegevens veilig worden geopend, met behulp van machtigingen en autorisatie. De kennislaag helpt AI de RAG-benadering te volgen door te zoeken in indexen of vectordatabases om precies de juiste inhoud te vinden. Hiermee kan AI op een consistente manier toegang krijgen tot verschillende interne en externe gegevensbronnen, of dat nu via MCP- of REST-protocollen gaat. |
| Toollaag | De Toollaag is de plek waar zakelijke handelingen en externe mogelijkheden toegankelijk zijn. De intelligence-laag kan deze acties activeren of verbinding maken met andere systemen door hulpprogramma's of agents op een gestandaardiseerde manier aan te roepen, of dat nu via MCP, A2A of OpenAPI/REST is. Deze mogelijkheden worden weergegeven als bruikbare opties, klaar voor gebruik door de intelligence-laag, en ze kunnen rechtstreeks worden verwerkt door de workload of door externe services. |
Ontwerpoverwegingen
Houd bij het ontwerpen van uw intelligente toepassingsworkloadarchitectuur rekening met de volgende ontwerpkenmerken om weloverwogen beslissingen te nemen over het ontwerp en interacties van onderdelen.
Levensduur en status
De Intelligence-API, indeling, deductie en kennislagen zijn alle langlopende services die worden uitgevoerd voor de levensduur van uw workload. Investeer in beschikbaarheid, bewaking en operationele uitmuntendheid voor elke service.
Elke laag ontwikkelt zich in een ander tempo, dus u hebt opzettelijke implementatiecoördinatie nodig. De Intelligence-API ontwikkelt zich langzaam om stabiel te blijven en achterwaartse compatibiliteit te behouden. Indelings- en agentlagen ontwikkelen zich sneller naarmate u nieuwe mogelijkheden toevoegt. De deductielaag wordt bijgewerkt wanneer u nieuwe modellen implementeert. De kennislaag ontwikkelt zich continu naarmate gegevens veranderen.
Stateless componenten kunnen op aanvraag worden toegewezen of vrijgegeven, terwijl stateful componenten gegevens beheren die behouden blijven tijdens interacties.
De Intelligence API-, orchestratie- en inferentielagen zijn staatloos, waardoor ze eenvoudig kunnen worden geschaald door meer instanties toe te voegen. Tijdens de uitvoering kan de orkestratielaag een vluchtige status hebben, maar deze wordt niet behouden na de afhandeling van aanvragen. Kortstondige status vermindert de operationele complexiteit, maar beperkt de herstelopties voor fouten. Ontwerp daarom zorgvuldig voor nieuwe pogingen en idempotentie.
Sessiegegevens voor gespreksbeheer kunnen van minuten tot dagen duren. Langere sessies maken uitgebreidere gesprekken mogelijk, maar kosten meer en verhogen het privacyrisico. In de kennislaag worden gegevens opgeslagen in indexen en databases die zich ontwikkelen naarmate u gegevens toevoegt, bijwerkt of verwijdert.
Afweging. Beslissingen voor levensduur- en statusbeheer zijn rechtstreeks van invloed op kosten, betrouwbaarheid en prestaties. Langlevende stateful componenten vereisen meer investeringen in schaalvergroting en veerkracht, terwijl staatloze, vluchtige componenten kosteneffectiever zijn, maar latentie kan veroorzaken door koude starts of het ophalen van externe status.
Bereik en afhankelijkheden
De Intelligence-API is het enige openbaar beschikbaar gemaakte eindpunt in de architectuur, alles wat anders intern blijft. U kunt deze implementeren in meerdere regio's om gebruikers dicht bij een eindpunt te houden en de tolerantie te verbeteren.
De indelingslaag bevindt zich in het midden, werkt binnen uw netwerk en coördineert alles zoals gespreksstatus, modelaanroepen, kennis ophalen en aanroepen van hulpprogramma's. Fouten hier blokkeren het hele systeem, dus maak het maximaal beschikbaar.
De deductielaag wordt intern uitgevoerd zonder externe afhankelijkheden. Implementeer deze dicht bij de orchestrator om de latentie laag te houden.
De kennis- en hulpprogrammalagen zijn intern, maar kunnen afhankelijk zijn van externe systemen. Deze externe afhankelijkheden kunnen vertragingen of beschikbaarheidsproblemen veroorzaken die van invloed zijn op de responskwaliteit.
Afweging. Implementatie met meerdere regio's verbetert de prestaties en tolerantie, maar verhoogt de kosten. Implementatie met één regio is rendabeler, maar kan leiden tot een hogere latentie voor gebruikers ver van de regio.
Schaalbaarheid en beschikbaarheid
Uw intelligente toepassing heeft twee schaalpatronen. Staatloze lagen zoals de API, indeling en deductieschaal door meer exemplaren toe te voegen. Gegevenslagen zoals gespreksbeheer en schaalvergroting van kennis worden vergroot door gegevens over meerdere datastores te spreiden via mechanismen zoals leesreplica's, partitionering en sharding.
De Intelligence-API wordt uitgeschaald om meer aanvragen af te handelen. Implementeer deze in meerdere zones of regio's voor betere beschikbaarheid en om gebruikers dicht bij een eindpunt te houden.
Indeling en agent berekenen bevinden zich in het midden van uw systeem, dus fouten hier blokkeren alles. Voeg meer exemplaren toe, gebruik taakverdeling en zorg ervoor dat failover gereed is, zodat het systeem actief blijft wanneer afzonderlijke exemplaren mislukken.
De deductielaag wordt geschaald op basis van wat uw modellen nodig hebben. Voeg meer exemplaren toe met GPU's naarmate de vraag toeneemt. Gebruik infrastructuur als code (IaC) om snel omgevingen opnieuw te creëren tijdens het herstelproces.
Gespreksbeheer wordt geschaald met het aantal gelijktijdige gebruikers. Gebruik kopieën en back-ups om sessiegegevens beschikbaar te houden.
De kennislaag wordt geschaald op basis van hoeveel gegevens u hebt en hoe vaak er query's worden uitgevoerd. Gebruik efficiënte indexering en databaseafstemming om reacties snel te houden. Stel kopieën in op meerdere locaties voor beschikbaarheid.
Afweging. Staatloze onderdelen kunnen snel worden geschaald, maar kunnen latentie met koude start veroorzaken. Gegevenscomponenten bieden duurzaamheid, maar vereisen meer planning voor opschalen. Balancer deze factoren op basis van de verwachte belasting en bedrijfsvereisten.
Beveiliging en verantwoorde AI
Elke laag in uw intelligente toepassing heeft verschillende risico's en heeft eigen controles nodig. Hulpprogramma's kunnen acties in de echte wereld activeren, kennis geeft vorm aan wat uw AI weet, en inferentie produceert uitvoer die gebruikers zien. Beperk de toegang op elke laag, bewaak wat er gebeurt en zorg ervoor dat u kunt uitleggen hoe beslissingen worden genomen.
De hulpmiddelenlaag draagt het hoogste risico omdat acties werkelijke gevolgen kunnen hebben die mogelijk onomkeerbaar zijn. Voor bewerkingen met een hoog risico voegt u menselijke goedkeuringsstappen toe. Gebruik strikte verificatie, toegang met minimale bevoegdheden en afdwinging van gegevensprivacy om onbevoegde acties en PII-blootstelling te voorkomen. Evalueer elk hulpprogramma voordat u het integreert, zodat governance verder reikt dan de grenzen van uw werklast.
De kennislaag heeft hoogwaardige, onbevoorbeerde gegevens nodig om betrouwbare uitvoer te produceren. Gegevenstoegang veilig houden met de juiste verificatie, autorisatie en naleving van vereisten voor gegevenslocatie. Alleen-lezentoegang en netwerkisolatie voorkomen beschadiging. Noteer welke bronnen zijn opgehaald voor elk antwoord via audittrails. Met dit proces kunt u beslissingen uitleggen en later problemen onderzoeken.
De inferentielaag mag alleen toegankelijk zijn voor operationele rollen en de identiteit van de orkestratielaag. Controleer de uitvoer via een validatieservice die controleert op toxiciteit en andere veiligheidsproblemen. Valideer modellen vóór de implementatie om vooroordelen te ondervangen en houd terugdraaimechanismen gereed als er problemen optreden in de productieomgeving.
Basislijnarchitecturen voor AI-workloads
Deze basislijnvoorbeelden fungeren als de aanbevolen architectuur voor AI-workloads.
-
Referentiearchitectuur basislijn Microsoft Foundry-chat
-
Referentiearchitectuur basismodel Microsoft Foundry-chat in een Azure landingszone
Deze architectuur bouwt voort op het Microsoft Foundry Chat-ontwerp en plaatst deze in een veilige Azure landingszone. Het combineert belangrijke onderdelen( Foundry Agent Service, Azure OpenAI en App Service) in een privé-, netwerkisolatieomgeving. Alle services maken verbinding via privé-eindpunten en worden beveiligd door Azure Firewall, met zoneredundantie voor hoge beschikbaarheid.
-
Analytics van begin tot eind met Microsoft Fabric
Gebruik deze architectuur als referentie bij het ontwerpen van een geïntegreerd gegevensplatform dat de volledige levenscyclus van analyses stroomlijnt.
Volgende stap
Bekijk de aanbevolen procedures voor het ontwerpen van intelligente toepassingsscenario's.