Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
O que é a deteção multivariada de anomalias?
A deteção de anomalias univariadas, implementada pela função KQL series_decompose_anomalies(), monitoriza e deteta anomalias numa única variável ao longo do tempo. A deteção de anomalias multivariadas estende esta abordagem ao detetar anomalias na distribuição conjunta de múltiplas variáveis ao longo do tempo — ou seja, analisa como as variáveis se relacionam e influenciam mutuamente como grupo, em vez de examinar cada variável isoladamente. A deteção multivariada de anomalias é útil para monitorizar a saúde de sistemas IoT complexos, detetar fraudes em transações financeiras e identificar padrões invulgares no tráfego de rede.
Por exemplo, considere um sistema que monitoriza o desempenho de uma frota de veículos. O sistema recolhe dados sobre várias métricas, como velocidade, consumo de combustível e temperatura do motor. Ao analisar estas métricas em conjunto, o sistema pode detetar anomalias que não seriam aparentes ao analisar cada métrica individualmente. Por si só, um aumento no consumo de combustível pode dever-se a várias razões aceitáveis. No entanto, um aumento súbito no consumo de combustível combinado com uma diminuição da temperatura do motor pode indicar um problema no motor, mesmo que cada métrica esteja dentro do intervalo normal.
Como pode detetar anomalias multivariadas no Microsoft Fabric?
A deteção multivariada de anomalias no Fabric aproveita os potentes motores Spark e Eventhouse sobre uma camada de armazenamento persistente partilhada. Os dados iniciais podem ser ingeridos numa Casa de Eventos e expostos no OneLake. O modelo de deteção de anomalias pode então ser treinado usando o motor Spark, e as previsões de anomalias em novos dados de streaming podem ser feitas em tempo real usando o motor Eventhouse. A interligação destes motores, que podem processar os mesmos dados no armazenamento partilhado, permite um fluxo contínuo de dados desde a ingestão, através do treino do modelo, até à previsão de anomalias. Este fluxo de trabalho é simples e poderoso para monitorização e deteção em tempo real de anomalias em sistemas complexos.
Estão disponíveis dois caminhos de ponta a ponta, podendo escolher com base na complexidade do seu cenário:
- Deteção nativa de anomalias no Eventhouse em dados em tempo real: Execute a deteção de anomalias diretamente em dados em fluxo e dados históricos nas tabelas do Eventhouse, sem necessidade de treino personalizado nem de configuração do modelo. Comece por este caminho quando os modelos incorporados correspondem às suas necessidades e quiser o caminho mais simples para obter insights.
- Deteção multivariada personalizada com um modelo treinado num notebook: Use o pacote Python baseado em GAT descrito neste artigo para treinar um modelo personalizado num notebook com dados históricos e, em seguida, avaliar novos dados em fluxo em tempo real através do Eventhouse e do KQL. Escolha este caminho quando precisar de um algoritmo personalizado ou de um cenário especializado que os modelos nativos não abrangem.
Deteção de anomalias no Native Eventhouse
O Eventhouse suporta deteção nativa de anomalias em tabelas ao vivo, por isso pode analisar dados em streaming e históricos diretamente sem mover dados ou treinar um modelo personalizado. Use esta opção quando precisar de um início rápido com algoritmos incorporados; Escolha o caminho multivariado personalizado que se segue quando necessitar de um algoritmo personalizado ou configuração especializada.
Componentes da solução
Esta solução baseia-se nos seguintes componentes:
- Eventhouse: Os dados são inicialmente ingeridos num Eventhouse, que é um motor de processamento de dados em tempo real capaz de gerir fluxos de dados de alto rendimento.
- OneLake: Os dados do Eventhouse são expostos no OneLake, que é uma camada de armazenamento persistente partilhada que fornece uma visão unificada dos dados.
- Pacote de deteção de anomalias multivariadas: a solução utiliza o pacote python time-series-anomaly-detector, implementando um algoritmo avançado baseado numa rede de atenção a grafos (GAT) que capta as correlações entre diferentes séries temporais e deteta anomalias em tempo real. O modelo GAT é treinado com dados históricos para aprender as relações entre diferentes séries temporais. O modelo treinado pode ser aplicado para prever anomalias em novos dados em fluxo. Note que este algoritmo é o utilizado no serviço AI Anomaly Detector que será descontinuado. Para mais informações sobre o algoritmo, consulte o blogue e o artigo.
- Fabric notebooks: usado para treino offline do modelo de deteção de anomalias em dados históricos e para armazenar o modelo treinado no registo de modelos MLflow da Fabric. Os notebooks suportam KQL, T-SQL, Python e Spark no mesmo espaço de trabalho, permitindo exploração unificada, transformações, treino (para modelos personalizados) e validação de anomalias nos mesmos dados apoiados pelo Eventhouse.
- Conjunto de consultas KQL: usado para previsão em tempo real de anomalias em dados recebidos.
- Endpoint de análise SQL: expõe uma interface T-SQL gerida alinhada com o modelo de dados do Eventhouse. Pode consultar anomalias detetadas e métricas relacionadas utilizando T-SQL para análises posteriores e integração com BI ou ferramentas de criação de relatórios ao abrigo da governação do Fabric.
- Integração com agentes de dados: anomalias detetadas no Eventhouse podem ser consumidas por agentes de dados Fabric para raciocinar sobre sinais em tempo real e históricos. Combinar a deteção de anomalias com agentes de dados permite análises conversacionais e fluxos de trabalho automatizados sobre os mesmos dados do Eventhouse.