Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Testa en Genie-agent med verkliga frågor, granska genererade SQL- och visualiseringar, redigera svar när Genie får något fel och övervaka agentanvändning och användarfeedback så att du kan hålla agenten korrekt när data och frågor utvecklas. Använd benchmarks för att bedöma svarsnoggrannhet i stor skala.
Note
Genie Agents kallades tidigare Genie Spaces.
Testa Genie Agent
De flesta användarinteraktioner sker i chattfönstret. Det bästa sättet att lära sig om din agent fungerar som du vill är att testa den med realistiska frågor som du förväntar dig att dina företagsanvändare ska ställa.
Exempelfrågor som konfigurerats i agentinställningarna visas i chattfönstret. Genie kan också generera exempelfrågor baserat på agentens kontext för att hjälpa användare att börja utforska data. Användare kan klicka på en exempelfråga eller ange sina egna frågor i textfältet längst ned på skärmen.
Svar visas ovanför textfältet. När en användare har angett en fråga sparas den i chatthistoriken.
Så här startar du en ny konversation:
- Klicka på Ny chatt för att starta en ny chatt. Klicka på
Om du vill öppna en tidigare konversation.
- Skriv in din fråga i Ställ din fråga... textinmatningsfält.
Granska svar
Svar levereras vanligtvis som naturliga språksvar på frågorna och en tabell som visar relevant resultatuppsättning. När Genie upptäcker att en visualisering kan förbättra svarskärpa returneras även en visualisering. Den exakta svarsstrukturen varierar beroende på frågan. Om en SQL-fråga genererades för att besvara frågan inkluderas den i svaret.
Note
Liksom andra stora språkmodeller (LLM) kan Genie uppvisa icke-deterministiska beteenden. Det innebär att du ibland kan få olika utdata när du skickar samma fråga flera gånger. Om du tillhandahåller exempel på SQL-frågor som Genie kan lära sig av kan du göra Genie mer konsekvent. Se Lägg till sql-exempelfrågor och funktioner.
Feedback om svar
Varje svar uppmanar användaren att svara Är detta korrekt?. Användarna kan svara på något av följande sätt:
- Ja: Bekräftar att svaret verkar korrekt.
-
Åtgärda det: Flaggar svaret som felaktigt. Användare kan välja bland vanliga problem eller ange en egen förklaring. De kan sedan:
- Klicka på Skicka och försök igen för att återskapa svaret med hjälp av den angivna feedbacken.
- Klicka på Skicka för att skicka feedbacken utan att återskapa svaret.
- Begärandegranskning: Flaggar svaret för manuell granskning. Användare kan lägga till en valfri kommentar för att ge dig ytterligare kontext.
Som redigerare kan du visa feedback och flaggade svar i Genie-gränssnittet. Genie-agentens beteende ändras inte enbart baserat på användarfeedback. Du bör använda feedback för att identifiera förbättringsmöjligheter eller svara direkt på användarfrågor. Databricks rekommenderar att användarna uppmanas att ge feedback om agenten med hjälp av den här mekanismen.
Företagsanvändare kan visa uppdateringar av de frågor som de har markerat för granskning på sidan Övervaka . Användare med minst CAN MANAGE-behörighet på Genie-agenten kan granska det specifika utbytet, kommentera begäran och bekräfta eller korrigera svaret. De kan komma åt feedback och granska begäranden på övervakningssidan. Sedan kan du använda den feedbacken för att finjustera svar och iterera på din agent. Se Övervaka agenten.
Andra svarsåtgärder
För svar som innehåller genererad SQL kan du med ytterligare alternativ interagera med returnerade data.
Kopiera CSV: Agentanvändare kan ladda ned upp till cirka 1 GB resultatdata som en CSV. Den slutliga filnedladdningsstorleken kan vara något mer eller mindre än 1 GB, eftersom gränsen på 1 GB tillämpas på ett tidigare steg än den slutliga filnedladdningen. Om du vill ladda ned resultat klickar du på nedladdningsikonen i svaret.
Visa kod: Klicka på Visa kod för att visa den genererade frågan. Detta kan vara användbart för att felsöka otillförlitliga svar. Se Redigera och spara frågor.
kebabmeny: Få åtkomst till följande åtgärder:
- Kopiera CSV: Kopiera svar-CSV till ditt urklipp.
- Lägg till som instruktion: För interaktioner som kan vara användbara för att lära Genie hur du svarar på liknande frågor, klickar du på Lägg till som instruktion. Då öppnas användargränssnittet för att spara exempel på SQL-frågor, fyllda med frågan och genererad SQL. Du kan lämna exemplet som skrivet eller redigera och spara för att göra ändringar. Se Lägg till sql-exempelfrågor och funktioner.
- Lägg till som riktmärke: Lägg till frågan som en referensfråga. Se Benchmarks.
- Uppdatera data: Uppdatera data genom att köra den tidigare genererade frågan.
- Återskapa svar: Skicka frågan igen och låt Genie återskapa svaret.
Redigera och spara frågor
Genie SQL-frågor kan granskas för noggrannhet och redigeras efter behov. Genie Agent-författare känner vanligtvis till domänen och data som gör att de kan identifiera när Genie genererar ett felaktigt svar. Ofta kan fel åtgärdas med en liten mängd manuell justering av den genererade SQL-frågan. Klicka på Visa genererad kod för att granska frågan och visa den genererade SQL-filen för alla svar.
Du kan redigera den genererade SQL-instruktionen för att korrigera den om du har KAN REDIGERA eller större behörigheter för Genie-agenten. Kör frågan när du har gjort dina korrigeringar. Sedan kan du spara det som en instruktion för att lära Genie hur man svarar i framtiden. Om du vill spara den redigerade frågan klickar du på Lägg till som instruktion.
Felsöka svar med Genie Code
När Genie returnerar ett felaktigt svar använder du Genie Code för att diagnostisera problemet och förbättra agentens kontext:
- Öppna Genie Code i svaret.
- Beskriv problemet och det beteende du vill ha.
- Granska de kontextändringar som Genie Code föreslår och acceptera de som du vill behålla.
Tip
Be Genie Code att göra detta åt dig:
The Genie Agent is using calendar quarters instead of our fiscal calendar. Update its context to use our fiscal quarters: Q1 is February through April, Q2 is May through July, Q3 is August through October, and Q4 is November through January.
Du kan också använda Genie Code för att spara semantisk kontext från en konversation. När användarna har introducerat nya termer eller korrigerat Genie-beteende ber du Genie Code att samla in vad de har lärt sig. Granska varje förslag och acceptera den kontext som du vill lägga till i agenten.
Övervaka agenten
En Genie-agent kan betraktas som ett långsiktigt samarbetsverktyg mellan datateam och företagsanvändare. Den ackumulerar kunskap över tid i stället för att fungera som en engångsdistribution. När användarna ställer nya frågor kan du förfina agenten för att förbättra täckningen och noggrannheten.
Använd fliken Övervaka för att granska enskilda frågor och svar, visa användarfeedback och identifiera svar som har flaggats för granskning.
Fliken Övervaka visar alla frågor och svar som har ställts i agenten. Du kan filtrera frågor efter tid, klassificering, användare eller status. Genom att övervaka agenten kan användare med CAN MANAGE-behörigheter proaktivt förstå de frågor som tas upp av företagsanvändare och hur Genie-agenten svarade.
Genom att identifiera de frågor som Genie kämpar med kan du uppdatera Genie-agenten med specifika instruktioner för att förbättra dess svar. Klicka på en fråga för att öppna frågan och svarstexten och visa hela chatttråden.
Granska användning och trender
Använd avsnittet Veckosammandrag på fliken Övervaka för att granska veckovisa meddelandevolymer, aktiva användare och tummen upp/ned feedback. Om du vill identifiera de vanligaste användningstrenderna och vanliga problem klickar du på Analysera utrymmesanvändning. Detta startar Genie Code, som granskar användarmeddelanden, feedback och problem från de senaste sju dagarna och rapporter om vanliga ämnen, återkommande problem och föreslagna kontextförbättringar. Bland svaren finns citat som länkar tillbaka till relevanta konversationer i din agent. Klicka på en citat för att öppna konversationen direkt i Genie Code-tråden.
Granska konversationer för kvalitet
Med Genie Chat Sharing kan agenthanterare granska alla konversationer som företagsanvändare har med en Genie-agent. När en konversation är inställd på Granskabar av agenthanterare kan användare med behörigheten KAN HANTERA, öppna konversationen från övervakningsfliken för att granska hela utbytet. På så sätt kan du utvärdera Genie:s svarskvalitet, svara på användarfeedback och identifiera områden där ytterligare instruktioner eller exempelfrågor skulle förbättra noggrannheten. För konversationer som är inställda på Privat kan agenthanterare se användarfrågor på övervakningsfliken men kan inte visa hela konversationen eller resultaten. Mer information finns i Dela en konversation.
Note
Konversationer som skapades innan konversationsdelningsfunktionen aktiverades förblir privata. Samtal som skapas efter att det aktiverats är som standard Granskabart av agentchefer.
Ta bort en konversation
Användare med CAN MANAGE-behörighet på en Genie-agent kan permanent ta bort alla konversationer i agenten från övervakningssidan. Detta tar bort konversationen och dess meddelanden för alla användare.
- Öppna Genie-agenten och klicka på fliken Övervaka .
- Klicka på en konversation för att öppna konversationslådan.
- Klicka på Ta bort konversation.
- I bekräftelsedialogrutan klickar du på Ta bort för att ta bort konversationen permanent eller Avbryt för att stänga dialogrutan utan att ta bort den.
Prestandajämförelser
Med benchmarks kan du skapa en uppsättning testfrågor som du kan köra för att utvärdera Genie:s övergripande svarsnoggrannhet. En väl utformad uppsättning benchmarks som täcker de vanligaste användarfrågorna hjälper dig att utvärdera noggrannheten hos din Genie-agent när du förfinar den. Varje Genie-agent kan innehålla upp till 500 benchmark-frågor.
Benchmark-frågor genomförs som nya konversationer. De har inte samma kontext som en trådad Genie-konversation. Varje fråga bearbetas som en ny fråga med hjälp av instruktionerna som definierats i agenten, inklusive eventuella exempel på SQL- och SQL-funktioner.
Benchmark-frågor stöder två lägen:
- Chattläge: Standardläget. Genie utvärderar noggrannheten genom att jämföra dess SQL-genererade resultat med ett angivet SQL-svar.
- Agentläge: Kör benchmark-frågor med samma resonemang i flera steg som Genie-agentläget. En LLM-domare bedömer svaren. Du kan ange en valfri utvärderingsanteckning för att vägleda bedömning.
Du väljer läget när du kör benchmarks, inte när du lägger till en fråga. Använd lägesknappen uppe till höger på fliken Benchmarks för att välja Chatt- eller Agentläge för en runda. Det valda läget gäller för alla frågor i den omgången.
Lägga till benchmark-frågor
Benchmark-frågor bör återspegla olika sätt att formulera vanliga frågor som användarna ställer. Du kan använda dem för att kontrollera Genie svar på variationer i frågefraser eller olika frågeformat.
När du skapar en referensfråga kan du välja att inkludera en SQL-fråga vars resultatuppsättning är rätt svar. Under benchmark-körningar utvärderas noggrannheten genom att jämföra resultatuppsättningen från DIN SQL-fråga med den som genereras av Genie. Du kan också använda Sql-funktioner i Unity Catalog som guldstandardsvar för benchmarks.
Så här lägger du till en referensfråga:
Klicka på Benchmarks längst upp i Genie-agenten.
Klicka på Lägg till benchmark-.
I fältet Fråga anger du en referensfråga som ska testas.
(Valfritt) Ange en SQL-fråga som besvarar frågan. Du kan skriva en egen fråga genom att ange den i rutan SQL Answer, inklusive SQL-funktioner från Unity Catalog. Du kan också klicka på Generera SQL om du vill att Genie ska skriva SQL-frågan åt dig. Använd en SQL-instruktion som korrekt besvarar den fråga du angav.
Note
Detta steg rekommenderas för Chat-lägeskörningar. Endast frågor som innehåller det här exemplet sql-instruktion kan utvärderas automatiskt för noggrannhet. Alla frågor som inte innehåller ett SQL-svar kräver att manuell granskning poängsätts. Om du använder knappen Generera SQL läser du instruktionen för att se till att den svarar korrekt på frågan.
(Valfritt) I fältet Utvärderingsanteckning , ange vägledning om rätt svar eller förväntat innehåll. Under Agent-lägesrundor lämnar Genie utvärderingsnoten till LLM-domaren. Anteckningen kan referera till förväntat innehåll i textrapporter som agentläget genererar.
(Valfritt) Klicka på Kör för att köra frågan och visa resultatet.
När du är klar med redigeringen klickar du på Lägg till benchmark.
Om du vill uppdatera en fråga när du har sparat klickar
du på pennikonen för att öppna dialogrutan Uppdatera fråga .
Använda benchmarks för att testa alternativa frågefraser
När du utvärderar noggrannheten för din Genie-agent är det viktigt att strukturera tester för att återspegla realistiska scenarier. Användare kan ställa samma fråga på olika sätt. Databricks rekommenderar att du lägger till flera fraser av samma fråga och använder samma exempel-SQL i dina benchmark-tester för att fullständigt utvärdera noggrannheten. De flesta Genie-agenter bör innehålla mellan två och fyra fraser av samma fråga.
Kör benchmarkfrågor
Användare med minst CAN EDIT-behörigheter i en Genie-agent kan när som helst köra en benchmark-utvärdering. Du kan köra alla benchmark-frågor eller välja en delmängd frågor att testa.
För varje fråga tolkar Genie indata, genererar SQL och returnerar resultat. Genererad SQL och resultat jämförs sedan med DET SQL-svar som definierats i benchmark-frågan.
Så här kör du alla benchmark-frågor:
- Klicka på Benchmarks längst upp i Genie-agenten.
- Klicka på Kör prestandamått för att starta testkörningen.
Så här kör du en delmängd av benchmark-frågor:
- Klicka på Benchmarks längst upp i Genie-agenten.
- Markera kryssrutorna bredvid de frågor som du vill testa.
- Klicka på Kör markerat för att starta testkörningen på de valda frågorna.
Du kan också välja en delmängd frågor från ett tidigare prestandaresultat och köra de specifika frågorna igen för att testa förbättringar.
Benchmarks fortsätter att köras när du navigerar bort från sidan. Du kan kontrollera resultaten på fliken Utvärdering när körningen är klar.
När en körning har slutförts kan du använda Genie Code för att granska resultaten i hela körningen och föreslå kontextförbättringar. Se Analysera en benchmark-körning med Genie Code.
Betyg för chattläge
Följande kriterier avgör hur Genie betygsätter svar i chattläge:
| Tillstånd | Klassificering |
|---|---|
| Genie genererar SQL som exakt matchar det angivna SQL-svaret | Bra |
| Genie genererar en resultatuppsättning som exakt matchar resultatuppsättningen som produceras av SQL Answer | Bra |
| Genie genererar en resultatuppsättning med samma data som SQL-svaret men sorteras på olika sätt | Bra |
| Genie genererar en resultatuppsättning med numeriska värden som avrundar till samma 4 signifikanta siffror som SQL-svaret | Bra |
| Genie genererar SQL som genererar en tom resultatuppsättning eller returnerar ett fel | Dålig |
| Genie genererar en resultatuppsättning som innehåller extra kolumner jämfört med resultatuppsättningen som produceras av SQL Answer | Dålig |
| Genie genererar ett resultat av en enskild cell som skiljer sig från resultatet av en enskild cell som genereras av SQL Answer | Dålig |
Note
Chattläget jämför upp till 5 000 rader av varje resultatuppsättning. När en resultatmängd överstiger 5 000 rader och radordningen skiljer sig mellan de Genie-genererade resultaten och SQL-svaret, kan denna trunkering göra att en matchande resultatmängd bedöms som Dålig. För att undvika detta, skriv SQL Answer-frågor som ger färre än 5 000 rader, eller lägg till en ORDER BY klausul både i SQL Answer och den förväntade Genie-utdatan så att radordningen förblir konsekvent.
När ett resultat bedöms som Dåligt identifierar förklaringen typen av mismatch.
Manuell granskning krävs: Svar markeras med den här etiketten när Genie inte kan bedöma korrekthet eller när Genie-genererade frågeresultat inte innehåller någon exakt matchning med resultaten från det angivna SQL-svaret. Eventuella benchmark-frågor som inte innehåller ett SQL-svar måste granskas manuellt.
Betyg i agentläge
En LLM-domare bedömer svar i agentläge i stället för att använda SQL-jämförelse. Om du angav en utvärderingsanteckning använder LLM-domaren den som vägledning när du utvärderar svaret, inklusive förväntat innehåll i textrapporten som agentläget genererar. Domaren bedömer svar som uppfyller utvärderingsnoteringskriterierna som bra.
Utvärderingar av prestandamått för åtkomst
Du kan komma åt alla dina benchmark-utvärderingar för att spåra noggrannheten i din Genie Agent över tid. När du öppnar en agent benchmarks visas en tidsstämplad lista över utvärderingskörningar på fliken Utvärderingar . Om inga utvärderingskörningar hittas kan du läsa Lägga till benchmark-frågor eller köra benchmark-frågor.
Fliken Utvärderingar visar en översikt över utvärderingar och deras prestanda som rapporteras i följande kategorier:
Utvärderingsnamn: En tidsstämpel som anger när en utvärderingskörning inträffade. Klicka på tidsstämpeln för att se information om utvärderingen. Körningsstatus: Anger om utvärderingen har slutförts, pausats eller misslyckats. Om en utvärderingskörning innehåller benchmark-frågor som inte har fördefinierade SQL-svar markeras den för granskning i den här kolumnen. Noggrannhet: En numerisk bedömning av noggrannhet i alla benchmark-frågor. För utvärderingskörningar som kräver manuell granskning visas ett noggrannhetsmått först efter att dessa frågor har granskats. Skapad av: Anger namnet på den användare som körde utvärderingen.
Granska enskilda utvärderingar
Du kan granska enskilda utvärderingar för att få en detaljerad titt på varje svar. Du kan redigera utvärderingen för alla frågor och uppdatera alla objekt som behöver granskas manuellt.
Så här granskar du enskilda utvärderingar:
Klicka på Benchmark längst upp i Genie-agenten.
Klicka på tidsstämpeln för en utvärdering i kolumnen Utvärderingsnamn för att öppna en detaljerad vy över testkörningen.
Använd frågelistan till vänster på skärmen för att se en detaljerad vy över varje fråga.
Granska och jämför modellutdatasvaret med grund sanningssvaret.
För resultat som klassificeras som felaktiga visas en förklaring som beskriver varför resultatet klassificerades som Dåligt. Detta hjälper dig att förstå specifika skillnader mellan de genererade utdata och den förväntade grundsanningen.
Note
Resultatet av dessa svar visas i utvärderingsinformationen för en vecka. Efter en vecka visas inte längre resultaten. Den genererade SQL-instruktionen och SQL-exempel-instruktionen finns kvar.
Klicka på Uppdatera Grundsanning för att spara svaret som den nya Grundsanning för den här frågan. Detta är användbart om det inte finns någon grundsanning, eller om svaret är bättre eller mer korrekt än den befintliga grundsanningen.
Klicka på etiketten för att redigera utvärderingen.Markera varje resultat som Bra eller Dåligt för att få en korrekt poäng för den här utvärderingen.
Analysera en benchmark-körning med Genie Code
När en benchmark-körning har slutförts använder du Genie Code för att granska resultaten över hela körningen i stället för att inspektera varje fråga på egen hand. Starta Genie Code från utvärderingen och be den analysera körningen. Genie Code granskar de förväntade resultaten, vad din agent genererade och agentens aktuella kontext för att hitta luckor och föreslår sedan instruktioner och kontextförbättringar som du kan granska och spara.