Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
MLflow acquisisce il feedback umano come valutazioni associate alle tracce della tua app GenAI, consentendoti di raccogliere punteggi, commenti e valori attesi di riferimento da sviluppatori, utenti finali ed esperti di dominio. Il feedback umano integra la valutazione automatizzata. Usalo per creare dataset per giudici e valutatori LLM e per mantenerli allineati alle valutazioni degli esperti umani.
Panoramica del modello di dati
MLflow archivia il feedback umano come valutazioni, collegato a singole tracce MLflow. Questo collega il feedback direttamente a una query utente specifica e agli output e alla logica dell'app GenAI.
Esistono 2 tipi di valutazione:
- Feedback: esamina i risultati effettivi o i passaggi intermedi della tua app. Ad esempio, risponde a domande come "La risposta dell'agente è stata buona?". Il feedback valuta ciò che l'app ha prodotto, ad esempio valutazioni o commenti. Il feedback valuta ciò che è stato generato dall'app e fornisce informazioni dettagliate qualitative.
- Aspettativa: definisce il risultato desiderato o corretto (verità di base) che l'app deve avere prodotto. Ad esempio, potrebbe trattarsi di "La risposta ideale" alla query di un utente. Per un determinato input, l'attesa è sempre la stessa. Le aspettative definiscono ciò che l'app deve generare e sono utili per la creazione di set di dati di valutazione,
Le valutazioni possono essere associate all'intera traccia o a un intervallo specifico all'interno della traccia.
Per altri dettagli sulla traccia, vedere Concetti relativi alla traccia.
Come raccogliere commenti e suggerimenti
MLflow consente di raccogliere feedback da tre origini principali. Ogni origine è personalizzata per un caso d'uso diverso nel ciclo di vita dell'app GenAI. Anche se il feedback proviene da utenti diversi, il modello di dati sottostante è lo stesso per tutti gli utenti.
Commenti e suggerimenti per gli sviluppatori
Durante lo sviluppo, è possibile annotare direttamente le tracce. Ciò è utile per tenere traccia delle note di qualità durante la compilazione e contrassegnare esempi specifici per i futuri test di riferimento o regressione.
Per informazioni su come annotare il feedback durante lo sviluppo, vedere Etichetta durante lo sviluppo.
Feedback degli esperti di dominio
Coinvolgere esperti in materia per fornire commenti e suggerimenti strutturati sugli output dell'app e definire le aspettative per le risposte corrette. Le valutazioni dettagliate aiutano a definire ciò che sono le risposte di alta qualità per il caso d'uso specifico e sono preziose per allineare i giudici LLM ai requisiti aziendali complessi.
Note
Per nuovi flussi di lavoro di revisione umana, Azure Databricks raccomanda code di revisione (Beta). Le code di revisione instradano tracce e record di dataset ai revisori in uno spazio di lavoro focalizzato, con un elemento alla volta, unendo le domande strutturate e l'assegnazione del revisore che altrimenti configureresti con schemi di etichettatura e sessioni di etichettatura.
MLflow offre anche due approcci per raccogliere feedback esperti del settore utilizzando l'App di Revisione:
Test interattivi con l'interfaccia utente di Chat: gli esperti interagiscono con l'app distribuita in tempo reale tramite un'interfaccia di chat, fornendo feedback immediato sulle risposte durante il test dei flussi di conversazione. Questo approccio è ideale per i "controlli di atmosfera" e la convalida qualitativa prima dell'implementazione in produzione. Per altre informazioni, vedere Testare una versione dell'app con l'interfaccia utente di Chat.
Etichettatura delle tracce esistenti: gli esperti esaminano sistematicamente e etichettano le tracce già acquisite dall'app. Questo approccio è ideale per sessioni di valutazione strutturate in cui gli esperti valutano esempi specifici e definiscono le aspettative di verità sul terreno. Per altre informazioni, vedere Etichettare le tracce esistenti.
Commenti e suggerimenti degli utenti finali
Nell'ambiente di produzione acquisire feedback dagli utenti che interagiscono con l'applicazione live. In questo modo vengono fornite informazioni cruciali sulle prestazioni reali, consentendo di identificare le query problematiche che richiedono la correzione e l'evidenziazione delle interazioni riuscite per conservare durante gli aggiornamenti futuri. MLflow offre strumenti per acquisire, archiviare e analizzare il feedback direttamente dagli utenti delle applicazioni distribuite.
Per informazioni su come raccogliere commenti e suggerimenti degli utenti finali, vedere la guida alla raccolta di commenti e suggerimenti degli utenti finali nella sezione di traccia.
Risorse aggiuntive
- Introduzione alla raccolta di feedback umani : eseguire questa esercitazione olistica che illustra i modi comuni per raccogliere feedback umano.
- Etichetta durante lo sviluppo : iniziare a annotare le tracce per tenere traccia della qualità durante lo sviluppo.
- Rivedi gli elementi con le code di revisione - Instrada tracce e record del dataset ai revisori in un’area di lavoro dedicata (Beta, consigliato per i nuovi flussi di lavoro).
- Testare una versione dell'app con l'interfaccia utente chat : testare l'app in modo interattivo usando un'interfaccia di chat live.
- Etichettare le tracce esistenti : configurare processi di revisione sistematica degli esperti.