Project Flash: avanço do monitoramento de disponibilidade da Máquina Virtual do Azure

O Flash, como o projeto é conhecido internamente, deriva seu nome do nosso firme compromisso com a criação de um mecanismo robusto, confiável e rápido para que os clientes monitorem a integridade da VM (máquina virtual). Nosso objetivo principal é garantir que os clientes possam acessar de forma confiável a telemetria acionável e precisa, receber alertas de alterações e monitorar periodicamente os dados em escala. Também colocamos ênfase no desenvolvimento de uma experiência centralizada e coerente que os clientes podem usar de forma prática para atender aos requisitos exclusivos de observabilidade. É nossa missão garantir que você possa:

  • Tenha acesso a dados precisos e acionáveis sobre interrupções na disponibilidade de VMs (por exemplo, reinicializações e reinícios de VMs, congelamentos de aplicativos devido a atualizações do driver de rede e atualizações de 30 segundos do sistema operacional do host), juntamente com detalhes precisos das falhas (por exemplo, iniciada pela plataforma versus iniciada pelo usuário, reinicialização versus congelamento, planejada versus não planejada).
  • Analise tendências na disponibilidade das VMs e emita alertas para depuração rápida e relatórios mensais comparativos.
  • Monitorar periodicamente os dados em escala e criar painéis personalizados para se manter atualizado sobre os estados de disponibilidade mais recentes de todos os recursos.
  • Receber RCAs (análises de causa raiz automatizadas) detalhando as VMs afetadas, a causa e a duração do tempo de inatividade, as correções resultantes e semelhantes — tudo para possibilitar investigações direcionadas e análises post mortem.
  • Receber notificações instantâneas sobre alterações críticas na disponibilidade da VM para disparar rapidamente ações de correção e evitar o impacto no usuário final.
  • Adaptar e automatizar dinamicamente as políticas de recuperação da plataforma, com base nas necessidades de failover e na sensibilidade das cargas de trabalho em constante mudança.

Soluções Flash

A iniciativa Flash é dedicada ao desenvolvimento de soluções ao longo dos anos que atendem às diversas necessidades de monitoramento de nossos clientes. Para ajudá-lo a determinar as soluções de monitoramento Flash mais adequadas para seus requisitos específicos, consulte a seguinte tabela:

Solução Descrição
Azure Resource Graph (Disponibilidade Geral) Para investigações em escala, repositório de recursos centralizado e pesquisa de histórico, os clientes grandes desejam consumir periodicamente a telemetria de disponibilidade de recursos em todas as suas cargas de trabalho, de uma só vez, usando o ARG (Azure Resource Graph).
Tópico do sistema do Event Grid (Versão prévia pública) Para disparar mitigações críticas e sensíveis ao tempo (reimplantação, reiniciar ações de VM) para prevenção do impacto no usuário final, os clientes (por exemplo, Pearl Abyss, Krafton) desejam receber alertas em segundos de alterações críticas na disponibilidade de recursos por meio dos Manipuladores de Eventos na Grade de Eventos.
Azure Monitor (Disponibilidade Geral) Para acompanhar tendências, agregar métricas de plataforma (CPU, disco etc.) e configurar alertas precisos baseados em limite, os clientes desejam consumir uma métrica de disponibilidade de VM pronta para uso por meio do Azure Monitor.
Resource Health (Disponibilidade Geral) Para executar verificações instantâneas e práticas de integridade da interface do usuário do Portal por recurso, os clientes podem exibir rapidamente a folha RHC no portal. Eles também podem acessar uma visão histórica de 30 dias das verificações de integridade do recurso para solucionar problemas com rapidez e facilidade.

Monitoramento de disponibilidade de VM holístico

Para uma abordagem abrangente do monitoramento da disponibilidade da VM, incluindo cenários de manutenção de rotina, migração dinâmica, autorrecuperação do serviço e degradação da VM, recomendamos utilizar ambos os eventos agendados (SE) e os eventos de integridade do Flash.

Os eventos agendados são projetados para oferecer um aviso antecipado, dando um aviso prévio de até 15 minutos antes das atividades de manutenção. Esse tempo de espera permite que você tome decisões informadas sobre o tempo de inatividade futura, permitindo que você evite ou se prepare para isso. Você tem a flexibilidade de reconhecer esses eventos ou atrasar ações durante esse período de 15 minutos, dependendo da sua preparação para a manutenção futura.

Por outro lado, os eventos Flash Health se concentram no monitoramento em tempo real de interrupções de disponibilidade em andamento e concluídas, incluindo degradação de VM. Este recurso permite que você monitore e gerencie efetivamente o tempo de inatividade, dando suporte à mitigação automatizada, às investigações e à análise post mortem.

Para começar sua jornada de observabilidade, você pode explorar o conjunto de produtos do Azure para os quais emitimos dados de disponibilidade de VM de alta qualidade. Esses produtos incluem integridade de recursos, log de atividades, Azure Resource Graph, métricas do Azure Monitor e tópico do sistema do Grade de Eventos do Azure.

Próximas etapas

Para saber mais sobre as soluções oferecidas, consulte o artigo de solução correspondente:

Para obter uma visão geral de como monitorar Máquinas Virtuais do Azure, veja Monitorar máquinas virtuais do Azure e Referência de monitoramento de máquinas virtuais do Azure.