Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Per scalare i servizi degli agenti, creare più istanze di agente che condividono le stesse definizioni di abilità e strumenti. Questo modello supporta il ridimensionamento orizzontale, mantiene il comportamento coerente e riduce il sovraccarico di gestione.
Vantaggi principali
- Chiamata allo strumento parallelo: gli agenti generati possono richiamare contemporaneamente gli stessi strumenti, in modo che il sistema possa gestire i picchi di traffico senza sovraccaricare una singola istanza dell'agente.
- Cataloghi di strumenti senza stato: le definizioni di competenze e strumenti condivisi eliminano la duplicazione e riducono il sovraccarico di gestione. Ogni agente generato carica lo stesso catalogo schemi.
- Utilizzo efficiente delle risorse: i back-end degli strumenti (database, API, servizi) possono gestire le richieste parallele da più istanze dell'agente, ridimensionando orizzontalmente con la domanda.
Architettura per la scalabilità
Quando si distribuiscono più istanze dell'agente:
- Definire le competenze condivise una sola volta: tutte le istanze dell'agente fanno riferimento alle stesse definizioni di competenza, in modo da garantire un comportamento coerente e ridurre la deviazione della configurazione.
- Registrare gli strumenti centralmente: gestire i cataloghi degli strumenti (schemi, endpoint, autenticazione) in un registro centrale a cui tutti gli agenti accedono in fase di esecuzione.
- Creare agenti dinamicamente: con l'aumentare del carico, creare nuove istanze di agenti che ereditano immediatamente il catalogo condiviso degli strumenti senza bisogno di riconfigurazione.
- Distribuisci richieste: instrada le richieste in ingresso alle istanze dell'agente disponibili. Ogni agente può richiamare strumenti in modo indipendente e in parallelo.
Esempio: Supporto clienti con volumi elevati
In uno scenario di supporto clienti con carico variabile:
- Baseline: cinque istanze dell'agente gestiscono le richieste standard, ognuna richiamando la competenza "search_knowledge_base" e lo strumento "create_ticket".
- Picco del traffico: il volume delle richieste in ingresso raddoppia durante le ore di punta. Genera automaticamente cinque istanze aggiuntive dell'agente.
- Esecuzione parallela: tutti e 10 gli agenti richiamano contemporaneamente gli stessi strumenti. Il backend dello strumento "create_ticket" riceve le richieste da 10 istanze di agente contemporaneamente e le accoda per l'elaborazione.
- Ridimensionamento verso il basso: quando il traffico si normalizza, dismettere le istanze aggiuntive dell'agente. I cinque agenti rimanenti continuano a gestire le richieste con le stesse definizioni di competenze e strumenti.
Considerazioni
- Capacità back-end degli strumenti: assicurarsi che i back-end degli strumenti (database, API, servizi esterni) possano gestire le richieste parallele da più istanze dell'agente. Prendere in considerazione la limitazione della frequenza, il pool di connessioni e il ridimensionamento orizzontale del back-end dello strumento.
- Progettazione dell'agente senza stato: mantenere senza stato le istanze dell'agente in modo da poter generare o ritirare qualsiasi istanza senza perdere contesto o dati. Rendere persistente lo stato dell'agente (cronologia delle conversazioni, preferenze utente) nell'archiviazione esterna, se necessario.
- Ordinamento delle chiamate degli strumenti: quando un agente richiama più strumenti in sequenza, assicurarsi che i back-end dello strumento mantengano la coerenza e gestiscono le richieste simultanee da agenti diversi in modo appropriato.