Creazione di un agente con supporto vocale
Suggerimento
Per altri dettagli, vedi la scheda Testo e immagini .
Gli agenti di intelligenza artificiale sono programmi software che possono comprendere le informazioni, prendere decisioni e intraprendere azioni da soli per aiutare gli utenti a raggiungere obiettivi specifici. Un obiettivo comune per gli agenti di intelligenza artificiale è quello di poter condurre conversazioni vocali in tempo reale proprio come si farebbe con un essere umano.
Riconoscimento vocale è una funzionalità che consente a un'applicazione di accettare l'audio parlato come input e produrre audio parlato come output, senza richiedere all'utente di leggere o digitare testo. L'esperienza utente si sente come una conversazione vocale naturale.
Il riconoscimento vocale consente ai sistemi di:
- Ascoltare una persona che parla
- Comprendere o trasformare ciò che è stato detto
- Rispondere con voce sintetica
La tecnologia da voce a voce combina la tecnologia da voce a testo e da testo a voce in un'unica esperienza di conversazione. Il sistema di conversione da voce a voce è costruito come una pipeline di capacità vocali e linguistiche. La pipeline è completata.
- Riconoscimento vocale: conversione dell'audio parlato dell'utente in testo.
- Elaborazione o ragionamento: analisi, traduzione e riepilogo del testo o usata da un agente di intelligenza artificiale per decidere cosa dire dopo.
- Sintesi vocale: Conversione del testo della risposta in audio parlato.
Gli scenari comuni di riconoscimento vocale includono:
- Assistenti vocali e agenti di intelligenza artificiale: gli utenti parlano con un agente e ascoltano le risposte pronunciate.
- Traduzione vocale: un utente parla in una lingua e sente la risposta in un'altra lingua.
- Applicazioni senza mani: sistemi di navigazione, chioschi multimediali o strumenti industriali in cui la digitazione non è pratica.
- Accessibilità: interazione basata su voce per gli utenti che preferiscono o richiedono input e output audio.
- Bot di supporto clienti: i chiamanti parlano naturalmente e ricevono risposte vocali.
Voce di Azure - Voice Live
Azure Voce include un servizio VoiceLive che semplifica la creazione di agenti di conversazione. L'API Voice Live consente alle applicazioni di avere conversazioni vocali in tempo reale. Consente a un agente vocale di ascoltare qualcuno che parla e di rispondere con audio parlato in modo rapido e naturale.
Invece di creare e connettere molte parti separate, come il riconoscimento vocale, il ragionamento dell'intelligenza artificiale e la sintesi vocale, l'API Voice Live combina tutto in un unico servizio. L'API Voice Live semplifica e velocizza la creazione di esperienze basate su voce da parte degli sviluppatori.
Azure gestisce completamente VoiceLive, il che significa che non è necessario configurare o gestire manualmente i sistemi back-end. Quando si invia l'audio a VoiceLive, restituisce risposte pronunciate. VoiceLive può anche restituire oggetti visivi, ad esempio avatar, e attivare azioni quando necessario. Azure gestisce i modelli e l'infrastruttura in background, in modo da potersi concentrare sulla creazione dell'esperienza vocale.
Azure soluzioni di riconoscimento vocale usano:
- Azure Voce che offre funzionalità di riconoscimento vocale e sintesi vocale.
- Agenti o logica dell'applicazione che prende decisioni sulle risposte.
- Strumenti Foundry o server MCP che possono esporre la voce come strumenti richiamabili affinché gli agenti non gestiscano direttamente gli SDK o le API.
È possibile esplorare Voice Live in un playground nel portale di Foundry. Il playground Foundry include alcuni esempi di voce preconfigurati che è possibile provare oppure è possibile creare una nuova soluzione personalizzata. Quando si crea una soluzione, importante, è necessario scegliere un modello di intelligenza artificiale generativo da usare per l'agente. Azure Speech Voice Live usa il modello di intelligenza artificiale generativo alongside i propri modelli acustici per avere una conversazione in tempo reale con l'utente. È possibile configurare molte impostazioni nel playground. Ad esempio, è possibile abilitare il coinvolgimento proattivo, in modo che l'agente possa avviare conversazioni.
È anche possibile abilitare la modalità Voce per un agente di Microsoft Foundry nel playground, che integra Azure Speech Voice Live nella definizione dell'agente. Questo approccio significa che la configurazione vocale viene incapsulata nell'agente stesso, riducendo il codice client necessario per usarlo.
Uso di Voice Live in un'applicazione
Per sviluppare un'app personalizzata che usa l'agente, è necessario scrivere codice. Per creare un'applicazione in Python, è necessario il pacchetto azure-ai-voicelive.
Il pacchetto può essere installato nel Visual Studio Code terminal usando:
pip install azure-ai-voicelive
Annotazioni
È anche necessario installare pyaudio, python-dotenve azure-identity per eseguire l'applicazione Voice Live.
È possibile trovare il codice di esempio per un'applicazione di riconoscimento vocale nel portale foundry. Il codice di esempio gestisce tutta la logica necessaria per avviare la sessione, connettersi a dispositivi audio come microfoni e altoparlanti, elaborare i flussi audio in ingresso e in uscita, gestire le interruzioni e così via. Il codice di esempio è un buon punto di partenza per la creazione di un'applicazione personalizzata.
È possibile inserire il codice di esempio nel proprio editor di codice e installare i pacchetti appropriati. Quando si esegue l'applicazione, un assistente vocale in tempo reale trasmette l'audio del microfono a Azure Voice Live, riceve la risposta audio vocale dell'assistente e lo riproduce attraverso gli altoparlanti.
Voice Live in Azure Voce offre un modo efficace per creare agenti di conversazione con supporto vocale che interagiscono naturalmente con gli utenti. Quindi, prova tu stesso Azure Speech - Voce dal vivo in Foundry.