Modelli di IA generativa
Tip
Per altri dettagli, vedi la scheda Testo e immagini .
Le soluzioni di intelligenza artificiale generative e agenti sono basate su modelli linguistici. I modelli di linguaggio di grandi dimensioni costituiscono la base di soluzioni di intelligenza artificiale generative che possono offrire un'ampia gamma di risposte. Oggi esiste un'ampia gamma di modelli che servono esigenze diverse. Ad esempio, le funzionalità di intelligenza artificiale in un'applicazione per telefoni leggeri possono essere eseguite meglio in un modello linguistico di piccole dimensioni, mentre un'applicazione per enti pubblici potrebbe richiedere un modello specializzato in un dominio.
Microsoft Foundry offre un ambiente integrato per l'individuazione, la valutazione, la distribuzione e il funzionamento di modelli di intelligenza artificiale generativi. Riunisce un catalogo di modelli avanzato, opzioni di distribuzione flessibili e funzionalità di governance predefinite, in modo che i team possano creare copiloti, agenti e applicazioni basate sull'intelligenza artificiale con sicurezza aziendale.
Annotazioni
Per usare Microsoft Foundry, è necessaria una sottoscrizione di Azure. Per usare le funzionalità di Foundry, iniziare creando un progetto in Foundry. Per altre informazioni, vedere Introduzione a Microsoft Foundry.
Individuare i modelli nel catalogo dei modelli di Foundry
Il catalogo dei modelli di Foundry è un hub centrale per l'individuazione e l'uso di una vasta gamma di modelli di intelligenza artificiale generativi da una vasta gamma di provider. In Foundry è possibile filtrare i modelli in base a origine, funzionalità, attività di inferenza e altro ancora. Foundry consente di comprendere e confrontare le funzionalità del modello, nonché di testare e creare soluzioni di intelligenza artificiale scalabili, sicure e responsabili.
Il catalogo dei modelli offre una vasta gamma di modelli, inclusi i modelli venduti direttamente da Azure insieme ai modelli di partner e community open source.
Modelli venduti direttamente da Azure: questi modelli sono ospitati da Microsoft in Condizioni per i prodotti Microsoft. Offrono livelli elevati di integrazione con Azure, contratti di servizio di livello aziendale, sicurezza preconfigurata e allineamento della conformità.
Modelli di partner e community: include modelli open source o ospitati dal fornitore integrati tramite il catalogo. Questi modelli supportano una sperimentazione più ampia e un'innovazione rapida e sono spesso adatti per attività specializzate o specifiche del dominio.
Ogni voce del modello include in genere:
- Descrizioni e funzionalità dei modelli (generazione di testo, ragionamento, codifica, multimodale, incorporamenti e così via)
- Risultati del benchmark e confronti delle prestazioni
- Attività di inferenza supportate e opzioni di ottimizzazione
- Documentazione sull'intelligenza artificiale responsabile (schede modello, vincoli, avvertenze)
Famiglie di modelli di uso comune
Tra i migliaia di modelli disponibili in Foundry, ci sono molti raggruppati per famiglia di modelli. Una famiglia di modelli fa riferimento a un gruppo di modelli correlati che condividono la stessa architettura o derivazione sottostante, ma differiscono in dimensioni, funzionalità, specializzazione o versione.
Le famiglie di modelli comunemente usate includono:
GPT-5.x: ottimizzato per il ragionamento multi‑passo, logica strutturata, pianificazione e flussi di lavoro agentivi. Funziona bene negli scenari che richiedono un ragionamento ad alta precisione e una comprensione del contesto lungo, ad esempio la generazione di report tecnici, l'analisi del codice o l'orchestrazione di agenti multi-strumento. Supporta livelli di pensiero regolabili, consentendo agli sviluppatori di scambiare velocità per l'accuratezza quando necessario.
Claude Opus 4.5 (Anthropic): quando è necessario un modello a livello di frontiera per agenti sofisticati, ragionamenti di codice complessi o attività di utilizzo di computer in più passaggi. Opus 4.5 è descritto come il modello più intelligente di Anthropic con prestazioni elevate per codifica, agenti e uso di computer e finestre di contesto/output di grandi dimensioni, utili per specifiche lunghe, diffs multi-file o note di ricerca estese.
Mistral Large 3 (Mistral AI): è un modello di uso generico all'avanguardia ideale per la qualità elevata con una velocità effettiva efficiente. Il modello funziona bene con attività di creazione multilingue, generazione di report aziendali strutturati o attività agente a media latenza che bilanciano i costi e le prestazioni. Mistral Large 3 è un modello generale "all'avanguardia" e parte del catalogo di Foundry curato, rendendolo un'alternativa pratica ai modelli di punta quando si desidera un'elevata capacità con compromessi flessibili sui costi/latenza.
Annotazioni
La registrazione è attualmente necessaria per la famiglia di modelli GPT-5, limitandone la disponibilità. Tutti gli utenti di Foundry possono usare GPT-4.1, ideale per chat in tempo reale, supporto clienti e applicazioni interattive che devono rispondere rapidamente e su larga scala. È ottimizzato per la velocità, l'efficienza e l'inferenza a bassa latenza, rendendola migliore rispetto ai modelli con elevato utilizzo di ragionamento per carichi di lavoro di produzione con volumi elevati.
In Foundry, i modelli di base sono modelli di grandi dimensioni, già addestrati, ad esempio GPT, Claude, Mistral e altri, che forniscono funzionalità generiche di linguaggio, ragionamento o multimodali. Questi modelli possono essere distribuiti immediatamente o personalizzati tramite l'ottimizzazione e fungono da livello di base per la creazione di applicazioni di intelligenza artificiale.
Valutare i modelli in Foundry
La scelta del modello corretto in Foundry inizia con la comprensione del carico di lavoro, del tipo di attività e dei vincoli.
Selezionare un modello per tipo di attività
| Attività | Tipi di modello consigliati | Dettagli del modello |
|---|---|---|
| Chiacchierare | Chat GPT-5.x, Claude Sonnet/Opus, Mistral-Large-3, DeepSeek V3.1, modelli linguistici di piccole dimensioni come Phi-4 o Llama | Ragionamento forte, ottimizzazione della conversazione, sicurezza |
| Scrittura del codice | GPT-5.1-codex, Claude-Sonnet | Supporto per flussi di agenti complessi |
| Riepilogo | Modelli di ragionamento GPT-5.x, Claude Opus/Sonnet | Compressione di alta qualità con ampio contesto |
| Embeddings | text-embedding-3-small o altri modelli di embedding | Compilato per le rappresentazioni vettoriali semantiche |
| Multimodale | Phi-4-multimodale-instruct, GPT-5.x chat multimodale, Mistral-Large-3 | Supporto per immagini, audio e video nei completamenti della chat |
| Specifico del settore o del dominio | Modelli ottimizzati per il dominio nel catalogo | Applicazioni specifiche di un settore come finanza, sanità, legale |
Annotazioni
Quando il caso d'uso è ben definito, anziché scegliere un modello dal catalogo dei modelli, è possibile scegliere uno strumento Foundry. Gli strumenti di fonderia sono basati su modelli predefiniti che offrono prestazioni prevedibili, conformità integrata e tempi di utilizzo rapidi senza modellazione personalizzata.
Assegnare punteggi e confrontare i modelli in Foundry
Il catalogo dei modelli di Foundry include risultati di benchmarking che mostrano come i modelli eseguono sui set di dati standard. I punteggi di benchmark semplificano la selezione del modello usando criteri di valutazione coerenti.
Tramite il portale di Foundry è anche possibile visualizzare:
- Classifiche dei modelli: i tabelloni punteggi classificano i modelli in base a attributi quali qualità, sicurezza e velocità effettiva. Ciò consente di identificare il modello migliore per un'attività. Esempi di attività includono ragionamento, riepilogo, generazione di codice.
- Confronti e filtri: confronto tra modelli side-by-side in base a qualità e accuratezza, costi, sicurezza e conformità e metriche delle prestazioni. È possibile filtrare in base al settore, al caso d'uso, al tipo di modello, alle licenze e altro ancora.
Un modo comune per valutare consiste nell'iniziare nel catalogo dei modelli di Foundry, scegliere un modello e quindi selezionare Benchmark → Provare con i propri dati. È possibile provare le richieste e verificare se le risposte sono come previsto.
Esistono diversi modi per assegnare punteggi a un modello nel portale foundry, tra cui metriche NLP (Natural Language Processing) e metriche di qualità assistita dall'intelligenza artificiale. Esempi di metriche di qualità NLP classiche sono: accuratezza, precisione, richiamo e F1. Esempi di metriche assistite dall'intelligenza artificiale comprendono fondatezza, rilevanza, coerenza, fluidità e somiglianza GPT. Scegliere metriche assistita dall'intelligenza artificiale per l'assegnazione di punteggi qualitativi oltre le metriche tradizionali.
In Foundry, gli analizzatori sono componenti usati per misurare la qualità, la sicurezza e l'efficacia degli output del modello o dell'agente di intelligenza artificiale. Ad esempio, gli analizzatori di sicurezza possono essere usati per garantire l'output responsabile dell'IA. Analizzano contenuti dannosi o non sicuri, pregiudizi e ingiustità, violenza, autolesionismo o danni a classi protette. La libreria analizzatore di Foundry offre analizzatori riutilizzabili per l'assegnazione dei punteggi di qualità, l'analisi della sicurezza e altro ancora.
Annotazioni
Autonomamente, gli analizzatori di Foundry rilevano, analizzano e valutano i problemi, ma non li risolvono attivamente.
Distribuire modelli in Foundry
Dopo aver selezionato un modello, Foundry fornisce meccanismi di distribuzione flessibili che consentono di personalizzare le prestazioni, i costi e la governance. Distribuire un modello comporta l'uso di un modello di intelligenza artificiale rendendolo disponibile per l'uso nell'ambiente di produzione tramite un endpoint stabile, scalabile e sicuro. La distribuzione di un modello configurato trasforma il modello in un servizio che le applicazioni possono chiamare, in genere tramite un'API. La distribuzione di un modello configurato consente di garantire prestazioni e affidabilità coerenti. Consente inoltre agli sviluppatori di impedire l'uso non autorizzato o non sicuro.
I parametri di distribuzione che è possibile personalizzare in Foundry includono:
- Tipo di distribuzione: ad esempio velocità effettiva standard, batch globale e con provisioning a livello di area, determinare dove e come viene elaborata l'inferenza in Foundry. I tipi di distribuzione sono associati ai requisiti di velocità effettiva e elaborazione dei dati.
- Versione del modello
- Limite di velocità dei token al minuto (TPM)
Annotazioni
Un token è l'unità di testo o dati più piccola che un modello di intelligenza artificiale generativa può elaborare. I modelli suddividono l'input in token, come parole, sottoparole, caratteri o punteggiatura, in modo che possano comprendere e generare la lingua in modo efficiente.
Quando si distribuisce un modello, è possibile assegnargli un'allocazione token al minuto (TPM). TPM determina la velocità e la scalabilità con cui il modello può elaborare gli input e i limiti di velocità, come le richieste al minuto (RPM). Quando si assegna un'allocazione TPM superiore a una distribuzione del modello, si aumenta la capacità di gestire il traffico dei token al minuto. Un TPM inferiore riduce la velocità con cui la distribuzione può usare i token tra richieste.
I limiti variano in base alla famiglia di modelli, ad esempio:
- I modelli di ragionamento di fascia alta (ad esempio: DeepSeek R1, Grok, versioni llama di grandi dimensioni) possono avere soffitti TPM elevati.
- I modelli specializzati o di immagine spesso operano in unità di capacità anziché TPM.
La limitazione, in un contesto di calcolo, implica intenzionalmente un rallentamento o una limitazione della quantità di lavoro di calcolo che può verificarsi contemporaneamente. Si tratta di un meccanismo protettivo usato quando un sistema è vicino al raggiungimento dei limiti di elaborazione. La limitazione temporanea dell'utilizzo delle risorse consente al sistema di rimanere stabile e reattivo.
Le quote a livello di distribuzione definiscono il numero di token o richieste che possono essere elaborate prima che si verifichi la limitazione. Le richieste più grandi e le impostazioni massime del token di output consumano più TPM, causando errori di limite di frequenza se vengono superati (descritti in maniera dettagliata nei risultati della ricerca sulla descrizione della limitazione). Se viene visualizzata la limitazione, ridurre i token max o ridurre le richieste simultanee nel codice.
Quando si distribuisce un modello in Foundry, si verificano diversi aspetti:
- Le risorse di calcolo vengono allocate: Foundry assegna l'hardware necessario per eseguire il modello, ovvero CPU, GPU, memoria, rete e regole di ridimensionamento.
- Viene creato un endpoint API: è possibile richiamare in modo sicuro il modello tramite l'API Risposte OpenAI, convalidata tramite i controlli api di gestione.
- La configurazione (ad esempio la versione del modello, lo stile di risposta, le impostazioni di sicurezza) è bloccata
- Monitoraggio e registrazione diventano attivi: vengono rilevate metriche di utilizzo, prestazioni, latenza, errori e costi
Successivamente, scopri come configurare questi modelli nel playground del portale Foundry e usarli in un'applicazione client.