Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Gli agenti e gli strumenti con foundry local fanno parte dell'approccio cloud adattivo di Microsoft. Estende le funzionalità di ragionamento dell'IA e di grounding agli ambienti on-premise, distribuiti e disconnessi che gestisci tramite Azure Arc. Il grounding collega le risposte di un modello ai tuoi dati, in modo che riflettano i tuoi contenuti privati anziché basarsi solo sull'addestramento del modello.
Il recupero agentico è l'estensione Kubernetes abilitata per Azure Arc alla base della piattaforma Agenti e strumenti con Foundry Locale. Fornisce una piattaforma di generazione aumentata dal recupero agentico nella rete perimetrale. Combina un livello di conoscenza (inserimento di documenti, incorporamento, ricerca vettoriale) con un livello agentico (agenti di intelligenza artificiale, orchestrazione delle conoscenze, server MCP) per offrire assistenti intelligenti e multistep basati sui dati locali privati.
Importante
Agentic Retrieval in Foundry Local è attualmente in ANTEPRIMA. Vedi le Condizioni supplementari d'uso per le anteprime di Microsoft Azure per conoscere le condizioni legali applicabili alle funzionalità di Azure che sono in beta, in anteprima o non ancora rilasciate nella disponibilità generale.
Il recupero agentico in Foundry Locale è supportato e convalidato su Kubernetes abilitato per Azure Arc nell’infrastruttura Azure Localee (precedentemente Azure Stack HCI), nonché nell'ambito di un'anteprima di operazioni disconnesse per Azure Localee. È possibile eseguire la piattaforma in ambienti disconnessi senza connettività Internet usando un modello di distribuzione coerente con gli scenari connessi. Per informazioni sugli aspetti che differiscono in una distribuzione disconnessa, vedere Panoramica delle operazioni disconnesse per Agentic Retrieval in Foundry Locale.
Per altre informazioni, vedere Azure Arc, Kubernetes abilitato per Azure Arc e le estensioni di Azure Arc.
Panoramica della piattaforma
La piattaforma è basata su tre componenti che interagiscono tra loro:
| Componente | Funzionamento |
|---|---|
| Generazione aumentata dal recupero agentico locale | Orchestrazione dell'agente di intelligenza artificiale con knowledge base, origini delle informazioni e un server MCP per il ragionamento su più passaggi sui dati. |
| Origini delle conoscenze locali | Inserimento dati, incorporamento e pipeline di recupero che indicizza i documenti locali in raccolte in cui è possibile eseguire una ricerca. |
| Esperienza di chat locale | Interfaccia utente di chat predefinita per interagire con gli agenti, gestire le conversazioni e visualizzare citazioni. Non è necessario alcun front-end personalizzato. |
Le funzionalità aggiuntive della piattaforma includono:
- Endpoint locale di Foundry per il modello di linguaggio (consigliato) - Usare un endpoint Foundry Local su Azure Locale per eseguire il modello di linguaggio sullo stesso cluster connesso ad Azure Arc in cui è installata l'estensione.
- Bring Your Own Model (BYOM): connettere un endpoint del modello di linguaggio esterno che supporta l'API di completamento della chat compatibile con OpenAI, ad esempio un endpoint distribuito in Microsoft Foundry.
- Due modelli con accelerazione GPU per l'incorporamento di testo (BGE-M3) e l'incorporamento di immagini (CLIP ViT-L/14) in esecuzione in locale su due GPU. Docling (parser di documenti) viene eseguito sulla CPU.
- Modalità di distribuzione indipendenti: distribuire la piattaforma completa o solo il livello agentico o il livello di conoscenza separatamente.
- Recupero immagini : inserire e recuperare le immagini pertinenti come riferimenti contestuali insieme al testo. Il recupero agentico in Foundry Local non è un modello di linguaggio visivo (VLM).
- Operazioni disconnesse: eseguire la distribuzione in ambienti disconnessi in Azure Locale usando un pacchetto di espansione importato in locale, senza connettività Internet necessaria in fase di distribuzione. Per altre informazioni, vedere Panoramica delle operazioni disconnesse per Agentic Retrieval in Foundry Locale.
Componenti chiave
La piattaforma include tre componenti chiave che interagiscono per creare ed eseguire soluzioni RAG agentic sui dati locali.
Generazione aumentata dal recupero agentico locale
Il livello agentico aggiunge pianificazione, uso degli strumenti e orchestrazione della conversazione alla piattaforma. Consente di creare assistenti di intelligenza artificiale che gestiscono interazioni a più passaggi, chiamano gli strumenti di conoscenza connessi a MCP e generano risposte basate sui dati privati.
Funzionalità chiave:
- Esecuzione dell'agente : gli agenti elaborano le query utente ragionando sulle istruzioni, richiamando gli strumenti e generando risposte.
- Orchestrazione della conoscenza - collega gli agenti a una o più fonti di dati tramite basi di conoscenza e fonti di conoscenza.
- Server MCP : un server MCP predefinito con strumenti di ricerca, oltre al supporto per la connessione a server MCP esterni.
- Gestione delle conversazioni : thread, messaggi e esecuzioni per la gestione delle interazioni a più passaggi con stato.
È possibile distribuire il livello agentico insieme al livello di conoscenza o a se stesso. In una distribuzione mista, gli agenti interrogano raccolte indicizzate localmente. In una distribuzione agentic-only, gli agenti si connettono invece a server MCP esterni.
Per altre informazioni, vedere Panoramica del livello agentico.
Origini delle conoscenze locali
Il livello di conoscenza fornisce una pipeline di acquisizione dei dati e RAG pronta all'uso che mantiene tutti i dati all'interno dell'infrastruttura locale. Gestisce il ciclo di vita completo dei dati, dall'analisi dei documenti alla ricerca vettoriale.
Funzionalità chiave:
- Inserimento dati : analizzare, suddividere e incorporare documenti da condivisioni file locali con impostazioni della pipeline personalizzabili.
- Raccolte - organizza i dati vettoriali in raggruppamenti logici con ciclo di vita indipendente e controllo degli accessi in base al ruolo di Azure (Azure RBAC) per raccolta.
- Più tipi di ricerca — scegli tra ibrida, vettoriale, testuale e ibrida multimodale in base alle esigenze delle tue query.
- Portale per sviluppatori : configurare le impostazioni di inserimento, ottimizzare i parametri di ricerca e testare le query tramite un'interfaccia Web locale.
L'accesso è controllato tramite Controllo degli accessi in base al ruolo di Azure per impedire l'accesso non autorizzato ai dati acquisiti.
Per altre informazioni, vedere Panoramica delle raccolte e Tipi di ricerca.
Esperienza di chat locale
Il recupero agentico in Foundry Locale include una soluzione di chat integrata che fornisce un'interfaccia pronta all'uso per interagire con gli agenti. La soluzione di chat è un'app React statica gestita da nginx che comunica con il runtime degli agenti tramite l'API Foundry Agents.
La soluzione di chat offre:
- Gestione delle conversazioni : creare, rinominare, eliminare ed esplorare le conversazioni in una barra laterale.
- Risposte in streaming: risposte dell'assistente in tempo reale tramite eventi Server-Sent (SSE).
- Citazioni e origini : visualizzare le origini usate dall'agente per generare ogni risposta.
- Authentication : integrazione facoltativa Entra ID per l'accesso utente, con autorizzazione basata su token gestita dal back-end.
La soluzione di chat gestisce solo l'esperienza del browser. L'orchestrazione del modello, la chiamata allo strumento, la convalida dei token e la definizione dell'ambito dei dati vengono gestite dal runtime degli agenti e dai servizi back-end.
Per ulteriori informazioni, vedi soluzione di chat in Agentic Retrieval in Foundry Local.
Scenari dei clienti e casi d'uso
I clienti in tutti i settori, come la produzione, i servizi finanziari, il settore sanitario, il governo e la difesa generano e archiviano dati preziosi in locale. Regolamento, latenza, continuità aziendale o volume di dati generati in tempo reale spesso mantengono questi dati all'esterno del cloud pubblico di grandi dimensioni. I clienti vogliono usare applicazioni di intelligenza artificiale generative per ottenere informazioni dettagliate da questi dati locali.
Il recupero agentico in Foundry Local supporta funzionalità di domanda e risposta e conversazioni agentiche in più passaggi che consentono ai clienti di interrogare i dati on-premises tramite agenti di intelligenza artificiale per scenari come:
Un cliente governativo vuole ricavare informazioni dettagliate dai dati locali sensibili per consentire un processo decisionale più rapido, riepilogare set di dati di grandi dimensioni, creare materiali di training e altro ancora.
Una banca regionale vuole usare i dati che devono rimanere in locale a causa di vincoli normativi per casi d'uso come controlli di conformità, assistenza clienti e generazione personalizzata delle vendite.
Un produttore globale vuole creare assistenti di fabbrica per ridurre il tempo necessario per la risoluzione dei problemi e facilitare la risoluzione dei problemi, usando i dati che devono rimanere locali per rispettare i criteri dell'organizzazione.
Un provider di assistenza sanitaria vuole distribuire un agente che può ragionare su più documenti clinici, usando knowledge base e strumenti MCP per correlare i record dei pazienti, i risultati del laboratorio e le linee guida per il trattamento.
Un'azienda energetica vuole connettere gli agenti a più origini dati esterne (sistemi SCADA, log di manutenzione, dati meteo) tramite server MCP, senza inserire tutti i dati in locale.
Perché usare il recupero agentico in Foundry Locale?
Usare il recupero agentico in Foundry Locale per:
- Creare agenti intelligenti che orchestrano più origini di informazioni, strumenti e servizi esterni usando il server MCP predefinito e il framework della Knowledge Base.
- Ridurre il tempo di distribuzione usando un'esperienza pronta all'uso che velocizza lo sviluppo e la distribuzione di applicazioni di intelligenza artificiale sui dati locali.
- Semplificare le operazioni e la gestione usando una soluzione pronta per l'organizzazione che offre lo stesso standard di sicurezza, conformità e gestibilità previsti da Microsoft, inclusa la gestione del ciclo di vita e della versione di tutti i componenti e l'integrazione Microsoft Entra per Azure controllo degli accessi in base al ruolo.
- Rimuovere la necessità di set di competenze per sviluppatori separati usando esperienze di sviluppo coerenti con il cloud.
- Rimanere al centro di questo spazio in rapida evoluzione con l'innovazione continua di Microsoft, leader nelle tecnologie di IA e continuare a concentrarsi sulla fornitura di valore aziendale.
Concetti chiave
Esamina i seguenti concetti chiave di Agentic Retrieval in Foundry Local:
Il chunking suddivide i documenti di grandi dimensioni in blocchi di testo più piccoli e gestibili (blocchi).
- Dimensioni blocchi: la suddivisione in blocchi divide i documenti di grandi dimensioni in unità più piccole, con impostazioni come le dimensioni dei blocchi (ad esempio, 1000-2000 caratteri) e la sovrapposizione dei blocchi (ad esempio, 100-500 caratteri) controllando la granularità e la continuità. I blocchi più piccoli migliorano la precisione del recupero, ma potrebbero perdere contesto, mentre i blocchi più grandi garantiscono un contesto completo al costo della precisione.
- Sovrapposizione blocchi: i blocchi sovrapposti mantengono il contesto tra i limiti, ma aumentano i requisiti di archiviazione e calcolo.
Le impostazioni ottimali dei blocchi dipendono dal caso d'uso, dall'accuratezza del bilanciamento, dall'efficienza e dalle prestazioni.
L'inserimento dati è un processo di importazione e preparazione di contenuto esterno, ad esempio documenti o immagini, da usare per il recupero. Sono inclusi i passaggi di pre-elaborazione, ad esempio la pulizia, la formattazione e l'organizzazione dei dati.
L'incorporamento di modelli trasforma testo, immagini o altri dati in vettori numerici densi (incorporamenti) che acquisiscano il significato semantico. Questi vettori rappresentano relazioni tra gli input, consentendo confronti di somiglianza e clustering.
Inferenza si riferisce al processo di utilizzo di un modello addestrato per generare predizioni o risultati in base ai nuovi dati di input. Nei modelli linguistici, l'inferenza comporta attività come il completamento di testo, la risposta alle domande o la generazione di riepiloghi.
I modelli linguistici sono sistemi di intelligenza artificiale sottoposti a training per comprendere, generare e modificare il linguaggio umano. Stimano il testo in base all'input, abilitando attività come generazione di testo, traduzione, riepilogo e risposte alle domande. Il recupero agentico in Foundry Local supporta due opzioni di endpoint del modello linguistico. L'opzione consigliata è un endpoint Foundry Local su Azure Locale. Questa opzione viene eseguita nello stesso cluster connesso Azure Arc dell'estensione. È anche possibile usare un endpoint BYOM (Bring Your Own Model) esterno che supporta un'API di completamento della chat compatibile con OpenAI, ad esempio una distribuita in Microsoft Foundry.
I parametri del modello controllano il modo in cui il modello linguistico genera testo, ad esempio la creatività, la diversità e l'attenzione delle risposte. I parametri comuni includono Temperature e Top-p. I parametri del modello non influiscono sui documenti recuperati, ma solo sul modo in cui il modello genera la risposta. Per ulteriori informazioni, vedi Parametri del tipo di ricerca in Agentic Retrieval in Foundry Local.
La query è l'input fornito a un modello linguistico per ottenere una risposta o eseguire un'attività specifica. Può trattarsi di una domanda, di un prompt o di un set di istruzioni, a seconda del caso d'uso.
Retrieval-Augmented Generation (RAG) combina un sistema di recupero con un modello linguistico generativo per produrre risposte arricchite da conoscenze esterne. Recupera il contesto pertinente da un database o da un archivio documenti per migliorare le capacità di generazione del modello, garantendo informazioni accurate e aggiornate.
I parametri di ricerca sono impostazioni che controllano la modalità di recupero agentico in Foundry Local recupera, filtra e classifica i documenti dai dati indicizzati prima di passarli al modello linguistico. Questi parametri consentono di ottimizzare la pertinenza, la precisione e l'ambito delle informazioni usate per rispondere alle query utente. Per ulteriori informazioni, vedi Parametri del tipo di ricerca in Agentic Retrieval in Foundry Local.
Tipo di ricerca: un tipo di ricerca è il metodo che Recupero Agentic in Foundry Local utilizza per trovare e classificare le informazioni nei dati indicizzati. Determina il modo in cui il sistema recupera il contenuto pertinente per rispondere alle domande degli utenti, ad esempio tramite parole chiave corrispondenti, usando la somiglianza semantica o combinando più approcci. Il recupero agentico in Foundry Local supporta diversi metodi di ricerca per il recupero di informazioni, tra cui ricerca full-text, ricerca ibrida, ricerca multimodale ibrida e ricerca vettoriale. Per ulteriori informazioni, vedere Tipo di ricerca nel recupero agentico in Foundry Locale.
La richiesta di sistema è costituita da istruzioni o messaggi predefiniti forniti a un modello linguistico all'inizio di una conversazione o di un'attività per influenzarne il comportamento. Queste richieste definiscono il ruolo, il tono o il contesto specifico dell'attività del modello. Ad esempio, "Si è un assistente utile" o "Fornire spiegazioni tecniche concise". Formando il contesto iniziale, i prompt di sistema assicurano che il modello generi risposte allineate all'obiettivo o all'utente desiderato.
Il database vettoriale è un database specializzato per archiviare incorporamenti vettoriali. È progettato per gestire vettori altamente dimensionali e consente ricerche di somiglianza veloci e scalabili.
La vettorializzazione significa trasformare il testo in rappresentazioni numeriche o incorporamenti, usando un modello di incorporamento, ad esempio Sentence Transformers. Questi incorporamenti acquisiscono il significato semantico del testo, consentendo confronti efficienti e accurati.
Agent è un assistente di intelligenza artificiale configurato con istruzioni, un endpoint del modello e, facoltativamente, una knowledge base. Gli agenti elaborano le query utente tramite conversazioni a più turni, richiamando strumenti e origini delle conoscenze in base alle esigenze.
La Knowledge Base è un raggruppamento di origini conoscenze assegnate a un agente. Quando l'agente elabora una query, può accedere a tutte le origini delle informazioni nella knowledge base.
L'origine delle informazioni è una registrazione autonoma di una connessione server MCP. Ogni origine della knowledge base contiene i propri dettagli di connessione (URL, tipo di autenticazione). Due tipi:
remote_mcpper i server MCP esterni eindexed_sources_mcpper il server MCP predefinito con un riferimento di origine indicizzato specifico (ad esempio, un nome di raccolta).La raccolta è un raggruppamento logico di dati vettoriali inseriti. Ogni raccolta corrisponde alle collezioni vettoriali di Milvus e alle tabelle di Postgres e può essere creata, interrogata ed eliminata in modo indipendente.
MCP (Model Context Protocol) è un protocollo aperto per connettere gli agenti di intelligenza artificiale a strumenti esterni e origini dati. Il recupero agentico in Foundry Local include un server MCP predefinito con 6 strumenti di ricerca e può anche connettersi a server MCP esterni.
Il thread è una sessione di conversazione tra un utente e un agente. I thread contengono messaggi ordinati e hanno come ambito un singolo utente.
Run è un'esecuzione di un agente rispetto a un thread. L'agente legge i messaggi del thread, richiama gli strumenti e genera una risposta. Le esecuzioni supportano lo streaming tramite Server-Sent Events (SSE).
La modalità di distribuzione determina quali livelli vengono distribuiti. Opzioni:
combined(impostazione predefinita, piattaforma completa),agentic(solo agenti, nessun inserimento dati locale),knowledge(inserimento dati e solo RAG, nessun agente).
Confronto con i servizi di intelligenza artificiale in Azure
Il recupero agentico in Foundry Local viene eseguito nell'infrastruttura dei clienti all'esterno del cloud pubblico, in modo che i clienti possano cercare i dati locali usando Retrieval-Augmented Generation (RAG). Il piano dati, inclusi tutti i dati dei clienti e il modello linguistico, è ospitato localmente.
Al contrario, i servizi di intelligenza artificiale in Azure, ad esempio Azure AI Search e Microsoft Foundry forniscono anche funzionalità RAG, ma sono ospitati in aree cloud pubbliche di grandi dimensioni. I clienti devono portare i propri dati e le proprie applicazioni nell'infrastruttura di Azure.
Il recupero agentico in Foundry Local offre esperienze dell’interfaccia utente locale per gli sviluppatori, coerenti con l’esperienza di Foundry.
Dati locali e cloud
Il recupero agentico in Foundry Local invia solo i metadati di sistema e le informazioni identificabili dell'organizzazione, ad esempio l'ID sottoscrizione e i nomi dei cluster a Microsoft. Tutti i contenuti dei clienti, inclusi documenti inseriti, incorporamenti, configurazioni degli agenti e thread di conversazione, rimangono sempre nell'infrastruttura locale entro i limiti di rete definiti dai clienti.
Ruoli utente
Il recupero agentico nella soluzione locale Foundry ha quattro ruoli utente distinti:
- Gestione del ciclo di vita dell'estensione: gli utenti gestiscono il ciclo di vita dell'estensione Recupero agentico in Foundry Local Arc. Questo ruolo include attività come la configurazione dell'infrastruttura necessaria, la distribuzione dell'estensione, l'esecuzione di aggiornamenti, il monitoraggio delle prestazioni e la gestione dell'eventuale eliminazione. In genere, queste responsabilità vanno a un amministratore IT con accesso al Azure Locale sottostante e Servizio Azure Kubernetes (AKS) nell'infrastruttura Azure Locale.
-
Sviluppo e valutazione di agenti ed endpoint chat: gli utenti configurano agenti, basi di conoscenza e fonti di conoscenza; forniscono l’origine dati; personalizzano le impostazioni della pipeline RAG; forniscono prompt di sistema personalizzati; valutano, monitorano e aggiornano la soluzione. In genere, queste responsabilità spettano a un prompt engineer o a uno sviluppatore di applicazioni di IA. Richiede il ruolo
EdgeRAGDeveloperEntra ID. - Utilizzo dell'endpoint per eseguire query sui dati locali: gli utenti integrano l'endpoint della chat in applicazioni line-of-business e usano un'interfaccia di chat, personalizzata o predefinita, per eseguire query sui dati locali.
-
Amministrazione del Layer agentico: gli utenti configurano e gestiscono basi di conoscenza e fonti di conoscenza utilizzando l’API Knowledge Base Manager. Questo ruolo include la registrazione di server MCP come origini delle informazioni, l'aggiornamento della Knowledge Base predefinita e il collegamento delle origini delle informazioni. Richiede il ruolo
EdgeRAGDeveloperEntra ID.