Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Vad är multivariatavvikelseidentifiering?
Univariate-avvikelseidentifiering, som implementeras av KQL-funktionen series_decompose_anomalies(), övervakar och identifierar avvikelser i en enskild variabel över tid. Multivariatavvikelseidentifiering utökar den här metoden genom att identifiera avvikelser i den gemensamma fördelningen av flera variabler över tid, vilket innebär att den analyserar hur variablerna relaterar till och påverkar varandra som en grupp, i stället för att undersöka varje variabel isolerat. Multivariatavvikelseidentifiering är användbart för att övervaka hälsotillståndet för komplexa IoT-system, upptäcka bedrägerier i finansiella transaktioner och identifiera ovanliga mönster i nätverkstrafiken.
Tänk dig till exempel ett system som övervakar prestanda för en fordonsflotta. Systemet samlar in data om olika mått, till exempel hastighet, bränsleförbrukning och motortemperatur. Genom att analysera dessa mått tillsammans kan systemet identifiera avvikelser som inte skulle vara uppenbara genom att analysera varje mått individuellt. På egen hand kan en ökning av bränsleförbrukningen bero på olika godtagbara skäl. En plötslig ökning av bränsleförbrukningen i kombination med en minskning av motortemperaturen kan dock tyda på ett problem med motorn, även om varje mått på egen hand ligger inom det normala intervallet.
Hur kan du identifiera multivarierade avvikelser i Microsoft Fabric?
Multivariatavvikelseidentifiering i Fabric drar nytta av de kraftfulla Spark- och Eventhouse-motorerna ovanpå ett delat beständigt lagringslager. De första data kan matas in i ett Eventhouse och exponeras i OneLake. Modellen för avvikelseidentifiering kan sedan tränas med Spark-motorn, och förutsägelserna om avvikelser för nya strömmande data kan göras i realtid med hjälp av Eventhouse-motorn. Sammankopplingen av dessa motorer som kan bearbeta samma data i den delade lagringen möjliggör ett sömlöst flöde av data från inmatning, via modellträning, till förutsägelse av avvikelser. Det här arbetsflödet är enkelt och kraftfullt för realtidsövervakning och identifiering av avvikelser i komplexa system.
Två sökvägar från slutpunkt till slutpunkt är tillgängliga och du kan välja baserat på komplexiteten i ditt scenario:
- Intern Eventhouse-avvikelseidentifiering på livedata: Kör avvikelseidentifiering direkt mot direktuppspelning och historiska data i Eventhouse-tabeller, utan anpassad träning eller modellkonfiguration. Börja med den här sökvägen när inbyggda modeller uppfyller dina behov och du vill ha den enklaste vägen till insikter.
- Anpassad multivariat identifiering med en modell som tränats i en notebook: Använd det GAT-baserade Python-paketet som beskrivs i den här artikeln för att träna en anpassad modell i en notebook med historiska data och sedan poängbedöma ny streamingdata i realtid via Eventhouse och KQL. Välj den här sökvägen när du behöver en skräddarsydd algoritm eller ett specialiserat scenario som de inbyggda modellerna inte täcker.
Intern avvikelseidentifiering för Eventhouse
Eventhouse stöder intern avvikelseidentifiering i livetabeller, så att du kan analysera strömmande och historiska data direkt utan att flytta data eller träna en anpassad modell. Använd det här alternativet när du behöver en snabbstart med inbyggda algoritmer. välj den anpassade sökvägen för flera variater som följer när du behöver en skräddarsydd algoritm eller specialiserad konfiguration.
Lösningskomponenter
Den här lösningen förlitar sig på följande komponenter:
- Eventhouse: Data matas ursprungligen in i en Eventhouse, som är en databearbetningsmotor i realtid som kan hantera dataströmmar med högt dataflöde.
- OneLake: Data från Eventhouse exponeras i OneLake, som är ett delat beständigt lagringslager som ger en enhetlig vy över data.
- Paket för multivariatavvikelseidentifiering: lösningen använder python-paketet time-series-anomaly-detector och implementerar en avancerad algoritm baserad på ett diagramuppmärksamhetsnätverk (GAT) som fångar korrelationerna mellan olika tidsserier och identifierar avvikelser i realtid. GAT-modellen tränas på historiska data för att lära sig relationerna mellan olika tidsserier. Den tränade modellen kan användas för att förutsäga avvikelser för nya strömmande data. Observera att den här algoritmen är den som används i TJÄNSTEN AI-avvikelseidentifiering som dras tillbaka. Mer information om algoritmen finns i bloggen och tidningen.
- Fabric notebook-filer: används för offlineträning av modellen för avvikelseidentifiering på historiska data och för att lagra den tränade modellen i Fabric MLflow-modellregistret. Notebook-filer stöder KQL, T-SQL, Python och Spark på samma arbetsyta, vilket möjliggör enhetlig utforskning, omvandlingar, utbildning (för anpassade modeller) och validering av avvikelser på samma Eventhouse-baserade data.
- KQL-frågeuppsättning: används för realtidsförutsägelse av avvikelser på inkommande data.
- SQL-analysslutpunkt: exponerar en hanterad T-SQL-yta i linje med Eventhouse-datamodellen. Du kan ställa frågor mot identifierade avvikelser och relaterade mätvärden med hjälp av T-SQL för vidare analys och integrering med BI- eller rapporteringsverktyg inom Fabric-styrning.
- Integrering med dataagenter: avvikelser som upptäcks i Eventhouse kan användas av Fabric data agents för att resonera kring realtidssignaler och historiska signaler. Genom att kombinera avvikelseidentifiering med dataagenter kan du använda konversationsanalys och automatiserade arbetsflöden för samma Eventhouse-data.