Il livello agenti nel recupero agentico in Foundry Locale

La piattaforma di recupero agentico è organizzata in due livelli. Il livello knowledge gestisce l'inserimento, l'indicizzazione e il recupero dei documenti. Il livello agentico si trova sopra di esso e decide come gli agenti usano tale conoscenza in fase di esecuzione.

Diagramma che mostra la piattaforma di recupero agentico con il livello agentico al di sopra del livello della conoscenza.

Il livello agentico aggiunge pianificazione, uso degli strumenti e orchestrazione della conversazione al recupero agentico. Il livello agentico consente di creare assistenti in grado di gestire le interazioni multithread, chiamare gli strumenti di conoscenza connessi al protocollo MCP (Model Context Protocol) e generare risposte basate su dati privati che rimangono nell'infrastruttura.

È possibile distribuire il livello agentico insieme al livello di conoscenza o a se stesso, a seconda che sia necessario l'inserimento e il recupero di documenti locali o solo l'orchestrazione dell'agente.

In una distribuzione combinata, gli agenti possono usare il server MCP predefinito per eseguire query sulle raccolte indicizzate dal livello knowledge. In una distribuzione basata esclusivamente su agenti, gli agenti possono comunque funzionare, ma utilizzano server MCP esterni anziché lo stack integrato di acquisizione e recupero.

Che cosa fornisce il livello agentico

Usare il livello agentico quando è necessario più del recupero diretto. Aggiunge queste funzionalità:

  • Esecuzione dell'agente per eseguire istruzioni, ragionare su una richiesta e decidere quando invocare gli strumenti.
  • Stato della conversazione attraverso thread, messaggi ed esecuzioni per interazioni su più thread.
  • Orchestrazione della conoscenza collegando gli agenti a una o più fonti di conoscenza basate su MCP tramite una base di conoscenza.
  • Distribuzione flessibile in modo da poter usare il recupero agentico solo con il livello di conoscenza predefinito o con server MCP esterni.

Componenti di base

Il livello agentico contiene tre componenti.

Runtime degli agenti

L'ambiente di runtime degli agenti esegue le conversazioni. Crea e gestisce:

  • Thread per mantenere una sessione di conversazione.
  • Messaggi per archiviare gli turni utente, assistente o sistema.
  • Esecuzioni per eseguire un agente sui messaggi di un thread.

Questo runtime è responsabile della chiamata di strumenti, dell'interazione con il modello linguistico e della restituzione delle risposte. Supporta lo streaming delle risposte tramite eventi inviati dal server.It supports streaming responses through server-sent events (SSE).

Base di conoscenze

Knowledge Base Manager è il piano di controllo per la configurazione della Knowledge Base. Usarlo per gestire le knowledge base. Le Knowledge Base definiscono il limite delle informazioni disponibile per gli agenti. Ogni distribuzione include una base di conoscenza predefinita che il sistema crea automaticamente.

Il sistema effettua automaticamente il provisioning degli agenti e li associa 1:1 a una knowledge base. Modifiche alla sincronizzazione della Knowledge Base con l'agente interno associato.

Ogni distribuzione include una knowledge base predefinita. Non è possibile creare knowledge base aggiuntive o eliminare quella predefinita. Usare GET, PATCH o PUT per visualizzare e aggiornare la Knowledge Base predefinita.

Per ulteriori informazioni, vedi Basi di conoscenza in Agentic Retrieval.

Fonti di conoscenza

Le origini delle informazioni registrano le connessioni MCP che un agente può usare come strumenti. Ogni origine della knowledge base contiene i propri dettagli di connessione e identifica l'endpoint MCP che l'agente deve chiamare.

Il recupero agentico supporta due tipi di origine delle informazioni:

  • remote_mcp per server MCP esterni.
  • indexed_sources_mcp per il server MCP integrato con un riferimento ai contenuti indicizzati nel livello di conoscenza.

Per altre informazioni, vedere Origini delle informazioni nel recupero agentico.

Funzionamento della Knowledge Base con le origini delle informazioni

Il livello agentico usa una sequenza stimabile per l'accesso alle informazioni. È possibile registrare le origini delle informazioni, collegarle alla Knowledge Base predefinita e consentire al sistema di mantenere sincronizzato l'agente interno associato. In fase di esecuzione, gli utenti interagiscono tramite thread e ogni esecuzione esegue l'agente associato con accesso solo alle origini conoscenze configurate.

A livello generale, il flusso funziona come segue:

  1. Si registrano una o più fonti di informazioni.
  2. Colleghi quelle fonti alla tua base di conoscenza predefinita.
  3. Un utente avvia un thread e invia un messaggio.
  4. Un'esecuzione avvia l'agente associato, che chiama gli strumenti MCP quando necessario e genera una risposta fondata.

Questo modello mantiene esplicito l'accesso alle informazioni. Gli agenti non visualizzano automaticamente tutti gli strumenti o i dati indicizzati disponibili. Usano solo le origini delle informazioni esposte tramite la Knowledge Base assegnata.

Concetti chiave nel livello agentico

Esaminare i concetti chiave seguenti per il livello agentico:

  • L'agente è un'entità di esecuzione interna di cui vengono effettuati automaticamente il provisioning e l'associazione in rapporto uno a uno a una knowledge base. L'agente gestisce il ragionamento, la pianificazione, gli strumenti di chiamata e la produzione di risposte. Gli agenti non vengono creati o gestiti direttamente. Al contrario, si configura la Knowledge Base e il sistema mantiene sincronizzato l'agente associato.

  • La Knowledge Base raggruppa una o più origini conoscenze in un limite riutilizzabile. Ogni distribuzione include una knowledge base predefinita. Definisce le informazioni a cui l'agente può accedere anziché il comportamento dell'agente.

  • L'origine delle informazioni è una connessione MCP registrata. Contiene l'endpoint e la configurazione necessari per raggiungere un server MCP specifico o un'origine indicizzata.

  • Thread rappresenta una sessione di conversazione tra un utente e un agente. Archivia la cronologia dei messaggi ordinata per l'interazione.

  • Messaggio è un singolo intervento in un thread. I messaggi possono rappresentare l'input dell'utente, l'output dell'assistente o il contenuto di sistema.

  • Run è una singola esecuzione di un agente all'interno di un thread. Durante un'esecuzione, l'agente legge lo stato del thread, decide se chiamare gli strumenti di knowledge base e genera una risposta.

  • Model Context Protocol è il protocollo usato per connettere gli agenti agli strumenti e alle origini dati esterne. Il recupero agentico può esporre gli strumenti MCP tramite il server MCP integrato e usare i server MCP esterni tramite le fonti delle informazioni.

Modalità di distribuzione e livello agente

Il ruolo del livello agentico dipende dalla modalità di distribuzione scelta:

Modalità di distribuzione Livello agentico Livello conoscenze Uso tipico
Combinato Piattaforma completa con agenti basati su contenuti indicizzati localmente.
Agentic No Orchestrazione dell'agente solo tramite strumenti o servizi MCP esterni.
Informazioni No Solo API di recupero e RAG, senza orchestrazione di agenti.

Scegli combinato quando vuoi la piattaforma completa Agentic Retrieval. Scegliere agentic quando si dispone già di sistemi di conoscenza accessibili da MCP e sono necessari solo il runtime e il livello di gestione dell'agente. Scegli Knowledge quando l'applicazione ha bisogno solo di API di acquisizione e recupero.

Quando usare il livello agentico

Usare il livello agentico quando la soluzione necessita di uno o più di questi modelli:

  • Assistenti multi-turno che mantengono lo stato della conversazione.
  • Workflow con chiamata di strumenti che devono combinare più fonti di conoscenza.
  • Separazione chiara tra il comportamento dell'agente e l'accesso alle informazioni.
  • Distribuzioni in cui gli agenti devono lavorare con il recupero predefinito o i server MCP esterni.

Se è necessaria solo l'inserimento diretto e l'esecuzione di query in stile RAG sul contenuto indicizzato, il livello di conoscenza potrebbe essere sufficiente.

Opzioni dell'endpoint del modello linguistico

Il recupero agentico non aggrega i modelli linguistici. Devi fornire l'endpoint del tuo modello linguistico di grandi dimensioni (LLM). L'LLM deve esporre un'API per il completamento delle chat compatibile con OpenAI.

  • Modello consigliato:GPT-OSS-20B. Questo modello richiede una GPU dedicata (almeno 24 GB di VRAM; 48 GB+ consigliato per la produzione). Per i requisiti hardware dettagliati, vedere Informazioni necessarie per il recupero agentico.

  • Opzioni di hosting: è possibile distribuire GPT-OSS-20B (o un altro modello) usando una di queste opzioni:

    Opzione di hosting Description
    Foundry Local on Azure Locale (scelta consigliata) Eseguire modelli in locale nel cluster connesso ad Arc. Entrambe le estensioni sono progettate per lavorare insieme nello stesso cluster. Consigliato per le distribuzioni locali.
    Microsoft Foundry Modelli ospitati nel cloud. Richiede connettività di rete dall'edge.

Configurare l'endpoint del modello linguistico a livello di cluster durante la distribuzione. Per gli endpoint, usa valori Helm come byom.apiEndpoint, byom.apiKey e byom.apiModel. Tutti gli agenti nel cluster condividono attualmente lo stesso endpoint LLM.