Feedback umano in MLflow

MLflow acquisisce il feedback umano come valutazioni associate alle tracce della tua app GenAI, consentendoti di raccogliere punteggi, commenti e valori attesi di riferimento da sviluppatori, utenti finali ed esperti di dominio. Il feedback umano integra la valutazione automatizzata. Usalo per creare dataset per giudici e valutatori LLM e per mantenerli allineati alle valutazioni degli esperti umani.

Panoramica del modello di dati

MLflow archivia il feedback umano come valutazioni, collegato a singole tracce MLflow. Questo collega il feedback direttamente a una query utente specifica e agli output e alla logica dell'app GenAI.

Esistono 2 tipi di valutazione:

  1. Feedback: esamina i risultati effettivi o i passaggi intermedi della tua app. Ad esempio, risponde a domande come "La risposta dell'agente è stata buona?". Il feedback valuta ciò che l'app ha prodotto, ad esempio valutazioni o commenti. Il feedback valuta ciò che è stato generato dall'app e fornisce informazioni dettagliate qualitative.
  2. Aspettativa: definisce il risultato desiderato o corretto (verità di base) che l'app deve avere prodotto. Ad esempio, potrebbe trattarsi di "La risposta ideale" alla query di un utente. Per un determinato input, l'attesa è sempre la stessa. Le aspettative definiscono ciò che l'app deve generare e sono utili per la creazione di set di dati di valutazione,

Le valutazioni possono essere associate all'intera traccia o a un intervallo specifico all'interno della traccia.

Per altri dettagli sulla traccia, vedere Concetti relativi alla traccia.

Come raccogliere commenti e suggerimenti

MLflow consente di raccogliere feedback da tre origini principali. Ogni origine è personalizzata per un caso d'uso diverso nel ciclo di vita dell'app GenAI. Anche se il feedback proviene da utenti diversi, il modello di dati sottostante è lo stesso per tutti gli utenti.

Commenti e suggerimenti per gli sviluppatori

Durante lo sviluppo, è possibile annotare direttamente le tracce. Ciò è utile per tenere traccia delle note di qualità durante la compilazione e contrassegnare esempi specifici per i futuri test di riferimento o regressione.

Per informazioni su come annotare il feedback durante lo sviluppo, vedere Etichetta durante lo sviluppo.

Feedback degli esperti di dominio

Coinvolgere esperti in materia per fornire commenti e suggerimenti strutturati sugli output dell'app e definire le aspettative per le risposte corrette. Le valutazioni dettagliate aiutano a definire ciò che sono le risposte di alta qualità per il caso d'uso specifico e sono preziose per allineare i giudici LLM ai requisiti aziendali complessi.

Note

Per nuovi flussi di lavoro di revisione umana, Azure Databricks raccomanda code di revisione (Beta). Le code di revisione instradano tracce e record di dataset ai revisori in uno spazio di lavoro focalizzato, con un elemento alla volta, unendo le domande strutturate e l'assegnazione del revisore che altrimenti configureresti con schemi di etichettatura e sessioni di etichettatura.

Rivedere l'immagine principale dell'anteprima dell'app.

MLflow offre anche due approcci per raccogliere feedback esperti del settore utilizzando l'App di Revisione:

Test interattivi con l'interfaccia utente di Chat: gli esperti interagiscono con l'app distribuita in tempo reale tramite un'interfaccia di chat, fornendo feedback immediato sulle risposte durante il test dei flussi di conversazione. Questo approccio è ideale per i "controlli di atmosfera" e la convalida qualitativa prima dell'implementazione in produzione. Per altre informazioni, vedere Testare una versione dell'app con l'interfaccia utente di Chat.

Etichettatura delle tracce esistenti: gli esperti esaminano sistematicamente e etichettano le tracce già acquisite dall'app. Questo approccio è ideale per sessioni di valutazione strutturate in cui gli esperti valutano esempi specifici e definiscono le aspettative di verità sul terreno. Per altre informazioni, vedere Etichettare le tracce esistenti.

Commenti e suggerimenti degli utenti finali

Nell'ambiente di produzione acquisire feedback dagli utenti che interagiscono con l'applicazione live. In questo modo vengono fornite informazioni cruciali sulle prestazioni reali, consentendo di identificare le query problematiche che richiedono la correzione e l'evidenziazione delle interazioni riuscite per conservare durante gli aggiornamenti futuri. MLflow offre strumenti per acquisire, archiviare e analizzare il feedback direttamente dagli utenti delle applicazioni distribuite.

Per informazioni su come raccogliere commenti e suggerimenti degli utenti finali, vedere la guida alla raccolta di commenti e suggerimenti degli utenti finali nella sezione di traccia.

Risorse aggiuntive