Distribuisci l'estensione per Agentic Retrieval in Foundry Local

Dopo aver completato i passaggi preliminari, completa i passaggi descritti in questo articolo per distribuire l'estensione Agentic Retrieval. Se l'ambiente Azure Locale usa modalità operative disconnesse, vedi invece Installazione per operazioni disconnesse in Azure Locale.

Per provare Il recupero agentico senza la necessità di hardware locale, vedere Avvio rapido: Installare il recupero agentico.

Importante

Agentic Retrieval in Foundry Local è attualmente in ANTEPRIMA. Vedi le Condizioni supplementari d'uso per le anteprime di Microsoft Azure per conoscere le condizioni legali applicabili alle funzionalità di Azure che sono in beta, in anteprima o non ancora rilasciate nella disponibilità generale.

Prerequisiti

Prima di iniziare, completa i prerequisiti di distribuzione per Agentic Retrieval.

Distribuire l'estensione

Distribuisci Agentic Retrieval tramite il portale di Azure o interfaccia della riga di comando di Azure.

  1. Nel portale di Azure, vai al cluster di Azure Kubernetes su Azure Localee.

  2. Selezionare Impostazioni>Estensioni>+ Aggiungi e Recupero agentico dall'elenco.

  3. Fare clic su Crea.

  4. Nella scheda Nozioni di base specificare le informazioni seguenti:

    Campo Value
    Abbonamento Selezionare la sottoscrizione che contiene il cluster del servizio Azure Kubernetes (AKS) su Azure Locale.
    Gruppo di risorse Selezionare il gruppo di risorse che contiene il cluster Arc del servizio Azure Kubernetes.
    Nome della distribuzione Specificare un nome per la distribuzione.
    Area geografica Selezionare la regione per distribuire Agentic Retrieval.
    Cluster Selezionare il cluster su cui si desidera distribuire Agentic Retrieval.

    Screenshot della scheda di base con i campi per immettere i dettagli del progetto e dell'istanza.

  5. Seleziona Avanti.

  6. Nella scheda Configurazioni specificare le informazioni seguenti:

    Campo Value
    Capabilities Selezionare uno o entrambi i componenti da includere nella distribuzione.
    Motore di recupero agentico Selezionare questa opzione per installare il motore di recupero agentico.
    Livello delle origini delle informazioni Selezionare questa opzione per installare il livello delle fonti di conoscenza.
    Modalità di distribuzione
    Modalità di distribuzione Selezionare GPU o CPU in base all'hardware disponibile. Questa impostazione si applica al livello Origini conoscenze.
    Server SharePoint
    Abilita l'origine dati di SharePoint Optional. Per connettersi a SharePoint usando l'autenticazione Key Vault, selezionare questa opzione.
    Nome di Key Vault Obbligatorio solo quando è selezionata l'acquisizione di SharePoint. Immettere il nome Azure Key Vault.
    Nome del segreto del certificato KV Obbligatorio solo quando è selezionata l'acquisizione di SharePoint. Immettere il nome del segreto Key Vault in cui è archiviato il certificato.
    Nome del segreto della password del certificato KV Obbligatorio solo quando è selezionata l'acquisizione di SharePoint. Immettere il nome del segreto Key Vault che archivia la password del certificato.
    ID client dell'identità del carico di lavoro Obbligatorio solo quando è selezionata l'acquisizione di SharePoint. Immettere l'ID client (GUID) dell'identità del carico di lavoro.
    Autenticazione Kerberos NFS
    Abilitare l'autenticazione Kerberos Optional. Se si vuole connettersi a un server NFS usando l'autenticazione Kerberos, selezionare questa opzione.
    Kerberos SPN Obbligatorio solo quando è selezionata l'opzione Kerberos . Immettere il nome SPN nel formato service/host@REALM , ad esempio nfs/edgerag-svc@CONTOSO.COM.
    Modello di inferenza
    Origine del modello linguistico Seleziona Foundry Local o Bring your own.
    ID dell'applicazione Obbligatorio solo quando è selezionata l'opzione Foundry Local .
    Nome del modello linguistico Required. Immettere il nome del modello linguistico distribuito.
    Endpoint LLM Required. Immettere l'URL dell'endpoint compatibile con OpenAI. Ad esempio: https://<Foundry_Resource_Name>.openai.azure.com/openai/deployments/<model_name>/chat/completions?api-version=<API_VERSION>. Per Foundry Local in Azure Locale, usare l'endpoint interno del cluster.
    Token max (K) Required. Immettere un valore compreso tra 4K e 2048K.

    Screenshot della scheda di configurazione in cui si seleziona il tipo di modello e altre configurazioni.

  7. Seleziona Avanti.

  8. Nella scheda Accesso specificare le informazioni seguenti:

    Campo Value
    Impostazioni SSL
    SSL CNAME Immettere il nome di dominio per il sistema. Il nome di dominio deve corrispondere all'URI di reindirizzamento usato durante la registrazione dell'app e non deve includere il https:// prefisso. Ad esempio: arcrag.contoso.com.
    Nome del segreto SSL di Kubernetes Immettere il nome del segreto Kubernetes per archiviare il certificato SSL. Per impostazione predefinita, il recupero agentico usa un certificato SSL autofirmato memorizzato in questo segreto. Dopo l'installazione, è possibile sostituirlo con un certificato firmato.
    Entra ID
    ID applicazione Entra Inserisci l'ID dell'applicazione dell'applicazione aziendale che hai registrato per l'autenticazione.
    ID tenant Entra Immettere l'ID del tenant dell'applicazione aziendale che hai registrato per l'autenticazione.

    Screenshot della scheda di accesso con le impostazioni SSL e i campi applicazione Entra.

  9. Selezionare Rivedi e crea.

  10. Esaminare e convalidare i parametri specificati.

  11. Selezionare Crea per completare la distribuzione di Agentic Retrieval.

  12. Al termine della distribuzione, in Estensioni verificare che siano elencati i tipi di estensione microsoft.arc.rag e microsoft.extensiondiagnostics .

La distribuzione dell'estensione Recupero agentico richiede in genere circa 30 minuti, ma può richiedere più tempo a seconda della connettività.

Verificare la distribuzione in base alla modalità

Dopo la distribuzione, verificare che i componenti in esecuzione nello spazio dei nomi corrispondano alla arc-rag modalità di distribuzione selezionata:

Modalità Pod previsti
Combinato Tutti i pod del Knowledge Layer (ingestionapi, inferencingflow, vectordb-api-server, modelli di embedding, docling, milvus, postgres) + tutti i pod dell'Agentic Layer (agent-manager, agents-runtime, knowledge-sources, indexed-sources-mcp-server)
Agentic Solo i pod del livello agentico (agent-manager, agents-runtime, knowledge-sources, indexed-sources-mcp-server, postgres)
Informazioni Solo pod del livello conoscenza (ingestionapi, inferencingflow, vectordb-api-server, embedding models, docling, milvus, postgres)

Verificare eseguendo questo comando:

kubectl get pods -n arc-rag

Verificare la connettività end-to-end

Dopo la distribuzione, verificare che l'estensione possa comunicare con Foundry Local:

  1. Controllare la disponibilità del modello Foundry (eseguire il port forwarding da endpoint.enabled=false):

    kubectl port-forward svc/gpt-oss-20b 5000:5000 -n foundry-local-operator
    # In another terminal:
    curl http://localhost:5000/v1/models
    
  2. Testare il completamento di una chat tramite port forward:

    curl -X POST http://localhost:5000/v1/chat/completions \
      -H "Content-Type: application/json" \
      -d '{
        "model": "gpt-oss-20b",
        "messages": [
          {"role": "user", "content": "Hello, what is 2+2?"}
        ],
        "temperature": 0.7,
        "max_tokens": 100
      }'
    
  3. Testare l'endpoint di inferenza dell'estensione:

    curl -X POST http://localhost:3001/edgeai/chat/completions?api-version=2024-10-01-preview \
      -H "Content-Type: application/json" \
      -H "x-user-role: dev" \
      -d '{
        "messages": [{"role": "user", "content": "Test question"}],
        "data_sources": [{"type": "milvus", "parameters": {"endpoint": "", "index_name": "edgeragapp"}}]
      }'
    

Configurare l'autenticazione post-distribuzione

Dopo aver distribuito l'estensione Recupero agentico, completare l'attività di autenticazione corrispondente all'origine del modello linguistico: