Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Il livello conoscenza è la base dati per il recupero agentico. Inserisce e suddivide il contenuto di origine, archivia vettori e metadati nelle raccolte e recupera il contesto pertinente in fase di query in modo che le risposte vengano archiviate nei dati dell'organizzazione. Questo livello è importante perché determina direttamente la qualità della chat, la pertinenza e il controllo degli accessi tramite il controllo degli accessi in base al ruolo di Azure (Azure RBAC) a livello di raccolta.
Questo articolo fornisce una panoramica generale della configurazione del Layer di conoscenza in Agentic Retrieval, inclusi l'acquisizione dei dati, le raccolte e l'interrogazione dei dati.
Importante
Agentic Retrieval in Foundry Local è attualmente in ANTEPRIMA. Vedi le Condizioni supplementari d'uso per le anteprime di Microsoft Azure per conoscere le condizioni legali applicabili alle funzionalità di Azure che sono in beta, in anteprima o non ancora rilasciate nella disponibilità generale.
Configurazione del livello di conoscenza
Nell'ambito di Agentic Retrieval, si distribuisce un portale locale per sviluppatori nel cluster AKS. Gli sviluppatori possono accedere a questo portale per completare le attività seguenti:
- Inserimento dati: specificare l'origine dati locale e personalizzare le impostazioni della pipeline RAG.
- Query sui dati: fornire un prompt di sistema personalizzato, modificare i parametri del modello e valutare l'efficacia della soluzione di chat usando il rispettivo playground.
- Gestione delle raccolte: creare e gestire raccolte per organizzare i dati vettoriali in raggruppamenti logici.
Accedere al portale tramite l'URI di reindirizzamento ,ad esempio , https://arcrag.contoso.comfornito al momento della distribuzione dell'estensione o l'URI di reindirizzamento specificato durante la registrazione dell'app.
Per autenticare e autorizzare l'accesso al portale, assicurarsi di disporre dei ruoli "EdgeRAGDeveloper" e "EdgeRAGEndUser" in Microsoft Entra.
Inserimento dati
L'inserimento dati significa aggiungere i dati locali e configurare le opzioni in modo che i dati siano facili da cercare. In questo modo, quando qualcuno pone una domanda, il sistema può trovare le informazioni corrette e fornirlo al modello linguistico come contesto.
Collections
Prima di inserire dati, è possibile creare facoltativamente una raccolta per organizzare i dati vettoriali. Le raccolte sono raggruppamenti logici. Ogni raccolta corrisponde a raccolte vettoriali Milvus dedicate e tabelle Postgres.
- Se non si specifica una raccolta, i dati vengono inseriti nella raccolta predefinita
edgeragapp. - Per creare una nuova raccolta, usare l'API Collections o specificare un nome di raccolta durante l'inserimento.
- Usare più raccolte per separare i dati per reparto, tenant o caso d'uso, con Azure RBAC per ogni raccolta.
Per altre informazioni, vedere Panoramica delle raccolte.
Pianificazione dell'inserimento dati
Prima di iniziare a configurare la soluzione di chat, completare la procedura seguente:
Preparare i dati. Esaminare le origini dati supportate. Assicurarsi che tutti i dati privati si trovino in una condivisione NFS accessibile da Agentic Retrieval. Per l'inserimento dati, è necessario il percorso di condivisione NFS, l'ID utente NFS e l'ID gruppo NFS.
Assicurarsi che i file non siano protetti da password o crittografati in modo che l'applicazione Recupero agentico possa accedere ai dati.
Scegliere le impostazioni appropriate per l'inserimento dati. Prima di aggiungere un'origine dati in Agentic Retrieval, scegli le impostazioni appropriate per il parsing dell’acquisizione, per la suddivisione in blocchi e per la frequenza di sincronizzazione.
Analisi dell'inserimento
Durante l'acquisizione, Agentic Retrieval analizza i documenti per estrarne il testo e la struttura ai fini della segmentazione e della vettorizzazione. Questa analisi è progettata per file di contenuto misto, incluse tabelle, grafici e immagini, in modo che il contesto recuperato sia più accurato per le risposte di chat.
Si prevede che il tempo di inserimento varia in base alla complessità e alle dimensioni dei documenti. I documenti con una struttura più dettagliata richiedono in genere più tempo per essere elaborati, ma producono contenuti di maggiore fedeltà per il recupero e il grounding.
Per informazioni dettagliate e comportamenti supportati, vedere Analisi avanzata dei dati per il recupero agentico.
Impostazioni dei blocchi
Prima di aggiungere un'origine dati in Recupero agentico, scegliere le dimensioni del blocco appropriate, la sovrapposizione dei blocchi e la frequenza di sincronizzazione. Ecco alcune indicazioni generali per aiutarti a scegliere le impostazioni di suddivisione in blocchi più adatte per i tuoi dati, fornite da Azure:
Dimensione del blocco: Definisci una dimensione fissa sufficiente per paragrafi semanticamente significativi (ad esempio, 200 parole) che consenta una certa sovrapposizione (ad esempio, il 10-15% del contenuto). Questo approccio può produrre blocchi validi come input per i generatori di vettori di incorporamento.
Processore Dimensioni blocco consigliate Dimensioni massime supportate GPU 2000 4000 Solo CPU 2000 2000 Sovrapposizione di blocchi: quando si suddividono i dati in blocchi, la sovrapposizione di una quantità minima di testo sui margini dei blocchi può contribuire a mantenere il contesto. Iniziare con una sovrapposizione di circa 10%. Ad esempio, data una dimensione di blocco fissa di 256 token, iniziare il test con una sovrapposizione di 25 token. La quantità effettiva di sovrapposizione varia a seconda del tipo di dati e del caso d'uso specifico, ma 10-15% funziona per molti scenari.
Processore Sovrapposizione blocchi consigliata Sovrapposizione massima supportata GPU 200 1000 Solo CPU 200 200
Quando suddividi i dati in blocchi, considera questi fattori:
Forma e densità dei documenti: se è necessario testo o passaggi intatti, blocchi più grandi e suddivisioni in blocchi variabili che conservano la struttura delle frasi possono produrre risultati migliori.
Query utente: blocchi più grandi e strategie sovrapposte consentono di preservare il contesto e la ricchezza semantica per le query destinate a informazioni specifiche.
I modelli di linguaggio di grandi dimensioni (LLM) hanno linee guida sulle prestazioni per le dimensioni dei blocchi. Impostare una dimensione di blocco ottimale per tutti i modelli in uso. Ad esempio, se si usano modelli per il riepilogo e gli incorporamenti, scegliere una dimensione di blocco ottimale che funzioni per entrambi.
Inserimento di dati tramite le API REST
È anche possibile eseguire l'inserimento dati a livello di codice usando le API REST:
- API Raccolte : creare e gestire le raccolte prima dell'inserimento.
- L'inserimento dati può richiedere molto tempo a seconda delle dimensioni dei dati, delle risorse di calcolo disponibili per il modello di incorporamento e di altri fattori.
- Crea quanti inserimenti dati desideri. I dati vengono vettorizzati e archiviati nella raccolta specificata (o la raccolta predefinita
edgeragapp, se non è specificato nessuno). È possibile creare più raccolte per organizzare i dati in base a dominio, reparto o caso d'uso.
Query di dati
In Recupero agentico configurare una query di dati significa creare una richiesta di sistema, modificare le impostazioni del modello per le proprie esigenze e verificare che la soluzione funzioni come previsto.
Scelta del prompt corretto e dei parametri del modello
Una parte fondamentale della progettazione dei prompt consiste nel fornire i parametri corretti del sistema e del modello in base ai dati e al caso d'uso.
- Per scegliere il prompt di sistema corretto, vedere Foundry Tools - messaggi di sistema di sicurezza per indicazioni di alto livello.
- Per informazioni e indicazioni sulla scelta dei parametri di ricerca e del modello, vedere Parametri del tipo di ricerca.
Test delle query nel playground della chat
Agentic Retrieval offre due esperienze di chat nel chat playground:
- Knowledge Base: chattare con il modello usando i propri dati inseriti come contesto. Ciò significa che le risposte del modello sono basate sui documenti e sulle origini dati dell'organizzazione, in modo da ottenere risposte rilevanti e basate sulle informazioni più recenti.
- Solo modello: chattare direttamente con il modello linguistico, senza usare i dati inseriti come contesto. Ciò è utile quando si vogliono porre domande generali, testare le funzionalità non elaborate del modello o semplicemente come risponde senza informazioni aggiuntive.
Passare dalla chat basata sulle informazioni alla chat basata sul modello a seconda delle necessità.
Esecuzione di query sui dati usando le API REST
Oltre al portale per sviluppatori, è possibile usare le API REST per configurare la soluzione di chat, ad esempio fornendo il messaggio di sistema e i parametri del modello.
Utilizzo dell'endpoint della chat
Dopo aver convalidato l'inserimento dei dati e la qualità della richiesta, integrare l'endpoint della chat nelle applicazioni line-of-business o usare l'app di chat predefinita per iniziare rapidamente. Per usare la chat, ogni utente finale deve avere due ruoli dell'app Microsoft Entra: EdgeRAGEndUser e un ruolo dell'app specifico della raccolta il cui valore corrisponde al nome della raccolta( ad esempio, il valore predefinito edgeragapp). Se un utente manca il ruolo di raccolta corrispondente, la query ha esito negativo con un errore 403.
Per altre informazioni, vedere gli articoli seguenti:
Se si vuole integrare l'endpoint della chat in una delle applicazioni line-of-business, usare le API REST.
Connessione al livello agentico
Se la distribuzione è stata eseguita in modalità combinata, gli agenti IA possono accedere alle raccolte acquisite tramite il livello agentico:
- Crea fonti di conoscenza che puntano alle tue raccolte (usando
kind: indexed_sources_mcpconindexed_source_ref= nome della raccolta). - Raggrupparli in una Knowledge Base collegandoli alla Knowledge Base predefinita.
Per una panoramica completa, vedere la guida di avvio rapido sulle query sui dati.