Configurare la query sui dati per la soluzione chat nel recupero agentico in Foundry Locale

Configura le query dei dati e le impostazioni del modello per la tua soluzione di chat con recupero agentico, in modo da ottimizzare i risultati della chat. Modifica i tipi di ricerca, ottimizza i parametri del modello e perfeziona l'esperienza d'uso della chat nel portale per sviluppatori di Agentic Retrieval.

Importante

Agentic Retrieval in Foundry Local è attualmente in ANTEPRIMA. Vedi le Condizioni supplementari d'uso per le anteprime di Microsoft Azure per conoscere le condizioni legali applicabili alle funzionalità di Azure che sono in beta, in anteprima o non ancora rilasciate nella disponibilità generale.

Prerequisiti

Prima di iniziare:

  • Assicurati di essere in modalità chat basata su conoscenza.
  • Esaminare i tipi di ricerca per comprendere i tipi di ricerca disponibili e quando usarli.
  • Rivedi la configurazione del livello di conoscenza per pianificare l'acquisizione dei dati e scegliere i parametri appropriati del prompt e del modello.
  • Aggiungi l'origine dati per la soluzione chat
  • Per accedere al portale per sviluppatori, è necessario disporre dei ruoli "EdgeRAGDeveloper" e "EdgeRAGEndUser" in Microsoft Entra.

Configurare le impostazioni del modello di inferenza

Per iniziare, configurare le impostazioni del modello di inferenza per la soluzione di chat.

  1. Passare al portale locale usando il nome di dominio fornito in fase di distribuzione e registrazione dell'app. Ad esempio: https://arcrag.contoso.com.

  2. Accedere con le credenziali dello sviluppatore a cui sono assegnati i ruoli "EdgeRAGDeveloper" e "EdgeRAGEndUser". Se è stato configurato l'accesso corretto, si viene reindirizzati automaticamente al portale per sviluppatori.

  3. Selezionare la scheda Chat per accedere al playground chat.

  4. Nel riquadro Inferenza dei dati, in Parametri del modello, regolare i parametri del modello per Temperature e Top P secondo necessità.

    Screenshot della sezione di inferenza dei dati della finestra di chat che consente di modificare i parametri del modello.

  5. Selezionare la sezione Parametri di ricerca .

  6. Selezionare il tipo di ricerca da usare.

    Tipo di ricerca Description
    Ricerca di testo ibrido Combina la ricerca di parole chiave (testo) e la ricerca vettoriale (contestuale).
    Ricerca testo Cerca parole o frasi esatte nei documenti.
    Ricerca vettoriale Cerca la somiglianza contestuale anziché la corrispondenza esatta delle parole chiave.
    Ricerca bidirezionale ibrida (anteprima, solo BYOM) Combina più modalità di ricerca di testo e immagini contemporaneamente.
  7. In Parametri modificare i parametri del modello per Primi N documenti e Rigore del testo, secondo le necessità.

    Schermata dei tipi di ricerca, dei documenti top-N e dei campi relativi al livello di rigidità del testo nei parametri di ricerca.

  8. Selezionare la sezione Richiesta di sistema . Rivedere e aggiornare il prompt, se necessario, per la propria soluzione.

  9. Tutte le modifiche apportate vengono applicate quando si invia una nuova domanda nella chat.

Test dei risultati della chat

Testare quindi l'endpoint della chat.

  1. Nella finestra della chat immettere una domanda che usa un semplice formato di domanda e risposta. Le query che richiedono il riepilogo in più documenti potrebbero non restituire risposte accurate.

    Tenere presente che con l'estensione Recupero agentico versione 0.1.5 e successive ogni domanda viene fornita in base solo al contenuto recuperato. La risposta non include il contesto della cronologia delle chat. La cronologia delle chat non viene salvata tra le domande. Considera ogni domanda come una nuova chat.

  2. (Facoltativo) Per vedere come il modello linguistico risponde senza usare i dati inseriti, passare alla modalità di chat solo modello e immettere la domanda. Tornare alla chat della Knowledge Base per continuare a perfezionare la soluzione con i dati inseriti.

  3. (Facoltativo) Verificare l'esperienza dell'utente finale usando l'app di chat della soluzione per Agentic Retrieval.

Visualizzare i dettagli per perfezionare le impostazioni

Usare i dettagli della risposta della chat per analizzare e ottimizzare il modello e i parametri di ricerca per ottimizzare le risposte alle chat.

  1. Nella risposta della chat selezionare Visualizza dettagli.

  2. Usare i dettagli della chat per comprendere l'impatto dei parametri di inferenza sulla risposta del modello linguistico alla domanda.

    Campo Description
    Risposta LLM Risposta del modello LLM (Large Language Model) per la domanda corrispondente.
    Domanda dell'utente Domanda posta dall'utente.
    Tipo di ricerca Il metodo usato per trovare le informazioni pertinenti alla tua domanda, ad esempio la ricerca ibrida, testuale, vettoriale o ibrida multimodale.
    Parametri Parametri usati per cercare il contenuto e generare la risposta LLM.
    Prompt di sistema Le istruzioni personalizzate impostate dallo sviluppatore per guidare le risposte del modello linguistico.
    Blocchi riclassificati Mostra gli ID di ricerca per punteggio riclassificato.
    Blocchi di input LLM Blocchi pertinenti passati a LLM come contenuto recuperato; I blocchi vengono selezionati in base alla rigidità del testo e alla rigidità delle immagini.
    Dettagli della ricerca Mostra i dettagli della ricerca.
    Risultati della ricerca di testo Risultati della ricerca testuale per una query; ogni risultato mostra il reranking score, la distanza di ricerca, il testo, il percorso del file, l'ID blocco e la data dell'ultima modifica.
    Risultati della ricerca vettoriale Risultati dalla ricerca semantica per una query; ogni risultato mostra il reranking score, la distanza di ricerca, il testo, il percorso del file, l'ID blocco e la data dell'ultima modifica.
    Risultati della ricerca di immagini I risultati della ricerca di immagini per una query mostrano, per ciascun risultato, il punteggio di riordinamento, il percorso del file e la data dell'ultima modifica.
  3. Per analizzare i dettagli, selezionare Copia per incollare una versione JSON del testo in un editor di testo.

  4. Ottimizzare i parametri di inferenza per ottenere il tipo di risposte desiderate per i dati inseriti.

Ottieni l'endpoint dell'API

Quando si è soddisfatti della soluzione, fare clic su Visualizza l'endpoint per ottenere l'endpoint API da utilizzare nelle applicazioni a valle.

Passo successivo