Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
L'ottimizzazione dell'applicazione è come l'arrampicata in collina. Inizia con una linea di base, misura i risultati importanti, modifica una leva e mantiene la modifica solo quando sposta il carico di lavoro più vicino ai requisiti di qualità, costo, latenza e criteri.
La selezione del modello può rallentare questo processo. Il router modello abbrevia tale percorso. La valutazione mostra se ciò apporta benefici al carico di lavoro. Consente inoltre di decidere se modificare la modalità di routing, vincolare il subset del modello o mantenere una distribuzione diretta del modello per richieste specifiche.
Tip
Usare model router auto evaluation toolkit per automatizzare il confronto. Esaminare la metodologia di valutazione del toolkit per comprendere come calcola e aggrega i risultati.
Prerequisiti
- Distribuzione di un modello di router. Per crearne uno, vedere Usare il router modello.
- Una distribuzione di un modello di base che rappresenta la soluzione attuale o un altro modello che si desidera confrontare.
- Un insieme di prompt rappresentativi del tuo carico di lavoro. Rimuovere segreti, dati personali e altre informazioni riservate prima di usare le richieste di produzione.
- Per l'assegnazione automatica del punteggio di qualità è necessaria una distribuzione modello di valutazione che soddisfi i requisiti della guida di Avvio rapido del toolkit.
Definire la decisione di distribuzione
Prima di confrontare le distribuzioni, identificare la decisione che i risultati devono supportare. Ad esempio, potresti decidere se sostituire una distribuzione diretta di un modello, quale modalità di routing usare o quali modelli includere nel pool di routing.
I criteri di accettazione specifici del carico di lavoro forniscono una base più utile per tale decisione rispetto a una soglia di superamento generale. Considerare le dimensioni seguenti:
| Dimension | Prendere in considerazione il carico di lavoro |
|---|---|
| Qualità | Punteggio di risposta o frequenza di vittoria minima accettabile, inclusi i requisiti per accuratezza, completezza, chiarezza e utilità. |
| Cost | Costo massimo stimato per richiesta o risparmio minimo rispetto alla baseline. |
| Latency | La latenza mediana e di coda accettabile, ad esempio p90 o p95, per l'esperienza dell'utente. |
| Policy | Modelli, aree e configurazioni di distribuzione consentiti dall'organizzazione. |
Il compromesso accettabile dipende dall'applicazione. Un carico di lavoro di classificazione di volumi elevati può tollerare una piccola differenza di qualità in cambio di costi inferiori. Un carico di lavoro che produce raccomandazioni ad alto impatto potrebbe richiedere una qualità equivalente o migliore prima del risparmio sui costi.
Progettare un confronto equo tra carichi di lavoro
Valutare la configurazione che si prevede di usare nell'ambiente di produzione. La modalità bilanciata e il set di modelli completamente supportati sono punti di partenza utili a meno che i criteri, la disponibilità a livello di area o i requisiti del carico di lavoro non chiamino una configurazione diversa.
Le procedure seguenti consentono di rendere utile il confronto:
- Usare un riferimento significativo. Confrontare il router modello con il modello che attualmente gestisce il carico di lavoro o con la distribuzione diretta che verrebbe altrimenti adottata.
- Rappresenta il mix di traffico. Includere richieste comuni, casi limite difficili, input lunghi e attività ad alto impatto. Raggruppa i prompt per categoria di carico di lavoro in modo che un risultato aggregato non nasconda una regressione specifica di una categoria.
- Mantenere coerente la configurazione dell'applicazione. Utilizza gli stessi prompt, le stesse istruzioni di sistema, gli stessi limiti di output e la stessa elaborazione dell'applicazione, laddove le capacità del modello lo consentano. In caso contrario, una differenza di configurazione potrebbe essere simile a un effetto di routing.
- Pianificare una revisione umana. I punteggi automatizzati sono stime. I revisori qualificati devono esaminare risultati ad alto impatto, regolamentati o specifici del dominio e casi in cui il confronto è inconcludente.
- Tratta con cautela campioni piccoli o sbilanciati. Aggiungere richieste rappresentative quando le categorie importanti contengono troppi esempi o risultati rimangono incerti.
Per gli schemi di input correnti e le linee guida per la preparazione del set di dati, vedere Creare un set di dati di valutazione personalizzato.
Eseguire un confronto
Per configurare le distribuzioni ed eseguire il confronto, seguire la guida introduttiva al toolkit. Puoi esplorare il report con dati fittizi prima di collegare le implementazioni.
Utilizzare le linee guida del repository come fonte di riferimento per i comandi attuali, i formati di input, il comportamento di valutazione, i metodi statistici, i calcoli dei costi e i campi del report. Per informazioni dettagliate sul motivo per cui il toolkit calcola i risultati così come avviene, vedere la metodologia di valutazione.
Registrare il contesto per ogni esecuzione, tra cui:
- Distribuzione di base.
- Versione del router modello, modalità di pianificazione percorso e sottoinsieme di modelli.
- Set di dati del prompt e impostazioni dell'applicazione pertinenti.
- Criteri di accettazione utilizzati per interpretare l'esecuzione.
Questo contesto esegue confronti successivi riproducibili e consente di attribuire una modifica nei risultati alla configurazione testata.
Leggi i pro e i contro nel loro insieme
Un costo stimato inferiore non giustifica una regressione qualitativa in una categoria importante. Analogamente, una latenza media favorevole può nascondere richieste lente che interessano gli utenti. Confrontare qualità, costo e latenza con i criteri di accettazione per il carico di lavoro anziché ridurre la decisione a un punteggio di aggregazione.
Considerare sia i risultati a livello di carico di lavoro che a livello di categoria. La distribuzione dei modelli può anche aiutare a spiegare perché la qualità, il costo o la latenza è cambiata mostrando quali modelli sottostanti hanno gestito parti diverse del carico di lavoro.
Per le definizioni delle metriche e dei report, vedere Interpretare i risultati della valutazione.
Scegliere cosa provare successivamente
La valutazione è più utile quando informa la decisione successiva del prodotto. Gli esempi seguenti sono considerazioni, non raccomandazioni universali:
| Osservazione | Cosa prendere in considerazione in seguito |
|---|---|
| La qualità scende al di sotto dei requisiti del carico di lavoro | Prova modalità Qualità o limita il sottoinsieme del modello. |
| La qualità rimane accettabile, ma i risparmi sono limitati | Provare la modalità costo e controllare di nuovo le categorie ad alto impatto per le regressioni. |
| Una categoria esegue in modo diverso dal resto | Valutare la categoria separatamente prima di modificare le impostazioni per l'intero carico di lavoro. |
| I risultati rimangono incerti | Aggiungere richieste rappresentative, esaminare i casi inconcludenti e ripetere il confronto. |
| I risultati si basano su un modello non disponibile o non consentito | Selezionare un subset disponibile nell'area di distribuzione e consentito dai criteri dell'organizzazione. |
| La latenza della parte finale supera il requisito | Validare la distribuzione in condizioni di traffico e concorrenza simili a quelle di produzione prima dell'adozione. |
Modificare una leva di pianificazione percorso alla volta ed eseguire di nuovo lo stesso set di richieste rappresentative. Mantenere fissa la configurazione della linea di base e dell'applicazione consente di determinare se una modalità di routing o un subset del modello ha causato la modifica.
Convalidare in condizioni di traffico simili a quelle di produzione
Un confronto controllato è un segnale importante, ma non riproduce tutte le condizioni di produzione. Prima dell'adozione generale, considerare un test di produzione limitato che monitora:
- Segnali di qualità per categorie di carico di lavoro importanti.
- Costi di utilizzo stimati e effettivi.
- Latenza mediana e di coda con il livello di concorrenza previsto.
- Errori, comportamento di failover e distribuzione del modello selezionato.
- Feedback da revisori qualificati e utenti dell'applicazione.
Mantenere una distribuzione diretta del modello per le richieste che richiedono la selezione del modello deterministico o quando la valutazione non supporta il routing di tali richieste.
Monitorare e ripetere la valutazione
Considerare la configurazione selezionata come una nuova linea di base anziché la fine del processo di ottimizzazione. Ripetere la valutazione quando il mix di traffico, la modalità di routing, il sottoinsieme di modelli, i modelli supportati, il comportamento dell'applicazione o i prezzi subiscono modifiche.
Questo ciclo di misurazione-modifica-rivalutazione rappresenta il valore pratico del modello mentale dell'hill-climbing: il router di modelli riduce il lavoro di selezione del modello all'interno del ciclo, mentre la valutazione mostra se ogni modifica sposta il carico di lavoro nella direzione desiderata.