Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Cet article explique comment surveiller les machines répliquées par Azure Site Recovery à l’aide des journaux Azure Monitor et de Log Analytics.
Les journaux Azure Monitor constituent une plateforme permettant de collecter les données des journaux d’activité et des journaux de ressources, ainsi que d’autres données de supervision. Dans les journaux Azure Monitor, vous utilisez Log Analytics pour écrire et tester des requêtes de journal, analyser également de manière interactive les données de journal. Vous pouvez visualiser et interroger les résultats du journal, et configurer des alertes en fonction des données analysées.
Pour Site Recovery, utilisez les journaux Azure Monitor pour vous aider à effectuer les opérations suivantes :
- Surveiller l'intégrité et l'état de Site Recovery. Par exemple, vous pouvez superviser l’intégrité de la réplication, l’état du test de basculement, les événements Site Recovery, les objectifs de point de récupération (RPO) pour les machines protégées et les taux de changement des disques ou des données.
- Configurer des alertes pour Site Recovery. Par exemple, vous pouvez configurer des alertes concernant l’intégrité de la machine, l’état du test de basculement ou l’état d’un travail Site Recovery.
Azure Monitor Logs prend en charge son utilisation avec Site Recovery pour la réplication Azure vers Azure et la réplication de machines virtuelles VMware ou de serveurs physiques vers Azure.
Remarque
Pour obtenir les journaux de données d’évolution et les journaux de vitesse de chargement pour les machines physiques et VMware, vous devez installer un agent d’analyse Microsoft sur le serveur de processus. Cet agent envoie les journaux des machines de réplication à l’espace de travail. Cette fonctionnalité est disponible uniquement à partir de la version 9.30 de l’agent de mobilité.
Prérequis
Voici ce dont vous avez besoin :
- Au moins une machine protégée dans un coffre Recovery Services
- Un espace de travail Log Analytics pour stocker les journaux de Site Recovery. Découvrez comment configurer un espace de travail
- Des connaissances de base concernant l’écriture, l’exécution et l’analyse des requêtes de journal dans Log Analytics. Plus d’informations
Passez en revue les questions de surveillance courantes avant de commencer.
Journaux des événements disponibles pour Azure Site Recovery
Azure Site Recovery fournit les tables suivantes, spécifiques à la ressource et anciennes. Chaque événement fournit des données détaillées sur un ensemble spécifique d’artefacts liés à la récupération de site.
Tables spécifiques à la ressource :
Tables héritées :
- Événements Azure Site Recovery
- Éléments répliqués d’Azure Site Recovery
- Statistiques de réplication d'Azure Site Recovery
- Points de récupération Azure Site Recovery
- Taux de téléchargement des données de réplication de Azure Site Recovery
- Activité des données de disque protégé Azure Site Recovery
- Détails de l’élément répliqué par Azure Site Recovery
Configurer Site Recovery pour envoyer des journaux
Dans le coffre, sélectionnez Paramètres de diagnostic>Ajouter un paramètre de diagnostic.
Dans les paramètres de diagnostic, entrez un nom et cochez la case Envoyer à Log Analytics.
Sélectionnez l’abonnement des journaux Azure Monitor et l’espace de travail Log Analytics.
Sélectionnez Diagnostics Azure dans le basculement.
Dans la liste des journaux, sélectionnez tous les journaux ayant le préfixe AzureSiteRecovery. Sélectionnez ensuite OK.
Les journaux Site Recovery commencent à être alimentés dans une table (AzureDiagnostics) de l’espace de travail sélectionné.
Configurer l’agent d’analyse Microsoft sur le serveur de processus afin d’envoyer les journaux de taux d’évolution et de chargement
Vous pouvez capturer les informations de taux d’évolution des données et les informations de débit de chargement de données sources pour vos machines VMware et physiques localement. Pour activer cette fonctionnalité, installez un agent de supervision Microsoft sur le serveur de processus.
Accédez à l’espace de travail Log Analytics et sélectionnez Paramètres avancés.
Sélectionnez Sources connectées , puis sélectionnez Serveurs Windows.
Téléchargez l’agent Windows (64 bits) sur le serveur de processus.
Terminez l’installation de l’agent en fournissant l’ID et la clé de l’espace de travail obtenu.
Une fois l’installation terminée, accédez à l’espace de travail Log Analytics et sélectionnez Gestion des agents hérités. Accédez à la page Données, puis sélectionnez Compteur de performances Windows.
Sélectionnez « + » pour ajouter les deux compteurs suivants avec un intervalle d’échantillonnage de 300 secondes :
- ASRAnalytics(*)\SourceVmChurnRate
- ASRAnalytics(*)\SourceVmThrpRate
Les données de taux de modification (churn) et de débit de chargement commencent à alimenter l’espace de travail.
Actuellement, les compteurs Site Recovery suivants ne peuvent pas faire l’objet d’une recherche :
- ASRAnalytics(*)\SourceVmChurnRate
- ASRAnalytics(*)\SourceVmThrpRate
Toutefois, vous pouvez les ajouter en collant les noms en intégralité.
Remarque
Actuellement, vous ne pouvez pas rechercher ces compteurs. Toutefois, vous pouvez les ajouter en copiant et en collant leurs noms complets.
- SourceVmThrpRate affiche le débit réseau sur la source.
- SourceVmChurnRate affiche le taux de modification des données sur le disque sur la machine virtuelle source.
Interroger les journaux - Exemples
Vous pouvez récupérer les données des journaux à l’aide de requêtes de journal écrites à l’aide du langage de requête Kusto. Cette section fournit quelques exemples de requêtes courantes que vous pouvez utiliser pour la supervision Site Recovery.
Remarque
Certains de ces exemples utilisent replicationProviderName_s avec une valeur de A2A. Cette valeur récupère les machines virtuelles Azure répliquées dans une région Azure secondaire à l’aide de Site Recovery. Dans ces exemples, vous pouvez remplacer A2A par InMageRcm si vous souhaitez récupérer des machines virtuelles VMware locales ou des serveurs physiques répliqués sur Azure à l’aide de Site Recovery.
Interroger l’intégrité de la réplication
Cette requête crée un graphique en secteurs représentant l’état actuel de la réplication de toutes les machines virtuelles Azure protégées. Le graphique décompose l'état de santé en trois états : Normal, Attention ou Critique.
AzureDiagnostics
| where replicationProviderName_s == "A2A"
| where isnotempty(name_s) and isnotnull(name_s)
| summarize hint.strategy=partitioned arg_max(TimeGenerated, *) by name_s
| project name_s , replicationHealth_s
| summarize count() by replicationHealth_s
| render piechart
Interroger la version du service de Mobilité
Cette requête crée un graphique en secteurs pour les machines virtuelles Azure répliquées avec Site Recovery. Le graphique décompose les machines virtuelles par la version de l’agent de mobilité qu’elles exécutent.
AzureDiagnostics
| where replicationProviderName_s == "A2A"
| where isnotempty(name_s) and isnotnull(name_s)
| summarize hint.strategy=partitioned arg_max(TimeGenerated, *) by name_s
| project name_s , agentVersion_s
| summarize count() by agentVersion_s
| render piechart
Interroger la durée des RPO
Cette requête crée un graphique à barres de machines virtuelles Azure répliquées avec Site Recovery. Le graphique décompose les machines virtuelles par objectif de point de récupération (RPO) : moins de 15 minutes, entre 15 et 30 minutes, plus de 30 minutes.
AzureDiagnostics
| where replicationProviderName_s == "A2A"
| where isnotempty(name_s) and isnotnull(name_s)
| extend RPO = case(rpoInSeconds_d <= 900, "<15Min",
rpoInSeconds_d <= 1800, "15-30Min", ">30Min")
| summarize hint.strategy=partitioned arg_max(TimeGenerated, *) by name_s
| project name_s , RPO
| summarize Count = count() by RPO
| render barchart
Interroger les travaux Azure Site Recovery
Cette requête récupère tous les travaux Site Recovery (pour tous les scénarios de récupération d’urgence) qui sont déclenchés au cours des 72 dernières heures et leur état d’achèvement.
AzureDiagnostics
| where Category == "AzureSiteRecoveryJobs"
| where TimeGenerated >= ago(72h)
| project JobName = OperationName , VaultName = Resource , TargetName = affectedResourceName_s, State = ResultType
Interroger les événements Site Recovery
Cette requête récupère tous les événements Site Recovery pour tous les scénarios de récupération d’urgence déclenchés par le système au cours des 72 dernières heures, ainsi que leur gravité.
AzureDiagnostics
| where Category == "AzureSiteRecoveryEvents"
| where TimeGenerated >= ago(72h)
| project AffectedObject=affectedResourceName_s , VaultName = Resource, Description_s = healthErrors_s , Severity = Level
Interroger l’état du test de basculement (graphique à secteurs)
Cette requête génère un graphique en secteurs illustrant l’état du basculement de test des machines virtuelles Azure répliquées avec Site Recovery.
AzureDiagnostics
| where replicationProviderName_s == "A2A"
| where isnotempty(name_s) and isnotnull(name_s)
| where isnotempty(failoverHealth_s) and isnotnull(failoverHealth_s)
| summarize hint.strategy=partitioned arg_max(TimeGenerated, *) by name_s
| project name_s , Resource, failoverHealth_s
| summarize count() by failoverHealth_s
| render piechart
Interroger l’état du test de basculement (table)
Cette requête affiche un tableau indiquant l’état du basculement de test des machines virtuelles Azure répliquées avec Site Recovery.
AzureDiagnostics
| where replicationProviderName_s == "A2A"
| where isnotempty(name_s) and isnotnull(name_s)
| where isnotempty(failoverHealth_s) and isnotnull(failoverHealth_s)
| summarize hint.strategy=partitioned arg_max(TimeGenerated, *) by name_s
| project VirtualMachine = name_s , VaultName = Resource , TestFailoverStatus = failoverHealth_s
Interroger les RPO des machines
Cette requête trace un graphique de tendance qui suit l’évolution du RPO d’une machine virtuelle Azure (ContosoVM123) au cours des 72 dernières heures.
AzureDiagnostics
| where replicationProviderName_s == "A2A"
| where TimeGenerated > ago(72h)
| where isnotempty(name_s) and isnotnull(name_s)
| where name_s == "ContosoVM123"
| project TimeGenerated, name_s , RPO_in_seconds = rpoInSeconds_d
| render timechart
Taux de modification des données de requête (évolution) et vitesse de téléchargement pour une machine virtuelle Azure
Cette requête trace un graphique de tendance pour une machine virtuelle Azure spécifique (ContosoVM123) qui représente le taux de modification des données (octets d’écriture par seconde) et le taux de chargement des données.
AzureDiagnostics
| where Category in ("AzureSiteRecoveryProtectedDiskDataChurn", "AzureSiteRecoveryReplicationDataUploadRate")
| extend CategoryS = case(Category contains "Churn", "DataChurn",
Category contains "Upload", "UploadRate", "none")
| extend InstanceWithType=strcat(CategoryS, "_", InstanceName_s)
| where TimeGenerated > ago(24h)
| where InstanceName_s startswith "ContosoVM123"
| project TimeGenerated , InstanceWithType , Churn_MBps = todouble(Value_s)/1048576
| render timechart
Taux de modification des données de requête (évolution) et vitesse de téléchargement pour une machine virtuelle VMware ou une machine physique
Remarque
Veillez à configurer l’agent d’analyse sur le serveur de processus pour extraire ces journaux. Reportez-vous aux étapes de configuration de l’agent d’analyse.
Cette requête trace un graphe de tendance pour le disque disk0 de l’élément répliqué win-9r7sfh9qlru qui représente le taux de changement des données (Octets écrits par seconde) et le taux de chargement des données. Le nom du disque se trouve dans le panneau Disques de l’élément répliqué, dans le coffre Recovery Services. Le nom de l’instance à utiliser dans la requête est le nom DNS de l’ordinateur suivi de _ et le nom du disque comme dans cet exemple.
Perf
| where ObjectName == "ASRAnalytics"
| where InstanceName contains "win-9r7sfh9qlru_disk0"
| where TimeGenerated >= ago(4h)
| project TimeGenerated ,CounterName, Churn_MBps = todouble(CounterValue)/5242880
| render timechart
Le serveur de traitement envoie ces données toutes les cinq minutes à l’espace de travail Log Analytics. Ces points de données représentent la moyenne calculée pendant cinq minutes.
Interroger le récapitulatif d’une reprise d’activité (au sein d’Azure)
Cette requête trace un tableau récapitulatif des machines virtuelles Azure qui ont été répliquées dans une région Azure secondaire. Il indique le nom de la machine virtuelle, l’état de la réplication et de la protection, le RPO, l’état du test de basculement, la version de l’agent de mobilité, les erreurs de réplication actives et l’emplacement source.
AzureDiagnostics
| where replicationProviderName_s == "A2A"
| where isnotempty(name_s) and isnotnull(name_s)
| summarize hint.strategy=partitioned arg_max(TimeGenerated, *) by name_s
| project VirtualMachine = name_s , Vault = Resource , ReplicationHealth = replicationHealth_s, Status = protectionState_s, RPO_in_seconds = rpoInSeconds_d, TestFailoverStatus = failoverHealth_s, AgentVersion = agentVersion_s, ReplicationError = replicationHealthErrors_s, SourceLocation = primaryFabricName_s
Interroger le récapitulatif du plan de reprise après sinistre (serveurs VMware et physiques)
Cette requête trace un tableau récapitulatif des machines virtuelles VMware et des serveurs physiques répliqués dans Azure. Il indique le nom de la machine, l’état de la réplication et de la protection, le RPO, l’état du test de basculement, la version de l’agent de mobilité, les erreurs de réplication actives et le serveur de processus impliqué.
AzureDiagnostics
| where replicationProviderName_s == "InMageRcm"
| where isnotempty(name_s) and isnotnull(name_s)
| summarize hint.strategy=partitioned arg_max(TimeGenerated, *) by name_s
| project VirtualMachine = name_s , Vault = Resource , ReplicationHealth = replicationHealth_s, Status = protectionState_s, RPO_in_seconds = rpoInSeconds_d, TestFailoverStatus = failoverHealth_s, AgentVersion = agentVersion_s, ReplicationError = replicationHealthErrors_s, ProcessServer = processServerName_g
Configurer des alertes - Exemples
Vous pouvez configurer des alertes Site Recovery en fonction des données Azure Monitor. En savoir plus sur la configuration des alertes de logs
Remarque
Certains de ces exemples utilisent replicationProviderName_s avec une valeur de A2A. Cette valeur définit des alertes pour les machines virtuelles Azure répliquées vers une région Azure secondaire. Dans ces exemples, vous pouvez remplacer A2A par InMageRcm si vous souhaitez configurer des alertes pour des machines virtuelles VMware locales ou des serveurs physiques ayant été répliqués dans Azure.
Plusieurs machines dans un état critique
Configurez une alerte si plus de 20 machines virtuelles Azure répliquées passent à l’état Critique.
AzureDiagnostics
| where replicationProviderName_s == "A2A"
| where replicationHealth_s == "Critical"
| where isnotempty(name_s) and isnotnull(name_s)
| summarize hint.strategy=partitioned arg_max(TimeGenerated, *) by name_s
| summarize count()
Pour l’alerte, définissez la Valeur de seuil sur 20.
Une seule machine dans un état critique
Configurez une alerte si une machine virtuelle Azure répliquée passe à l’état Critique.
AzureDiagnostics
| where replicationProviderName_s == "A2A"
| where replicationHealth_s == "Critical"
| where name_s == "ContosoVM123"
| where isnotempty(name_s) and isnotnull(name_s)
| summarize hint.strategy=partitioned arg_max(TimeGenerated, *) by name_s
| summarize count()
Pour l’alerte, définissez la Valeur de seuil sur 1.
Plusieurs machines dépassent le RPO
Configurez une alerte si le RPO de plus de 20 machines virtuelles Azure dépasse 30 minutes.
AzureDiagnostics
| where replicationProviderName_s == "A2A"
| where isnotempty(name_s) and isnotnull(name_s)
| where rpoInSeconds_d > 1800
| summarize hint.strategy=partitioned arg_max(TimeGenerated, *) by name_s
| project name_s , rpoInSeconds_d
| summarize count()
Pour l’alerte, définissez la Valeur de seuil sur 20.
Une seule machine dépasse le RPO
Configurez une alerte si le RPO d’une machine virtuelle Azure dépasse 30 minutes.
AzureDiagnostics
| where replicationProviderName_s == "A2A"
| where isnotempty(name_s) and isnotnull(name_s)
| where name_s == "ContosoVM123"
| where rpoInSeconds_d > 1800
| summarize hint.strategy=partitioned arg_max(TimeGenerated, *) by name_s
| project name_s , rpoInSeconds_d
| summarize count()
Pour l’alerte, définissez la Valeur de seuil sur 1.
Le test de basculement de plusieurs machines remonte à plus de 90 jours
Configurez une alerte si le dernier basculement de test réussi date de plus de 90 jours pour plus de 20 machines virtuelles.
AzureDiagnostics
| where replicationProviderName_s == "A2A"
| where Category == "AzureSiteRecoveryReplicatedItems"
| where isnotempty(name_s) and isnotnull(name_s)
| where lastSuccessfulTestFailoverTime_t <= ago(90d)
| summarize hint.strategy=partitioned arg_max(TimeGenerated, *) by name_s
| summarize count()
Pour l’alerte, définissez la Valeur de seuil sur 20.
Le test de basculement d’une seule machine remonte à plus de 90 jours
Configurez une alerte si le dernier basculement de test réussi d’une machine virtuelle spécifique date de plus de 90 jours.
AzureDiagnostics
| where replicationProviderName_s == "A2A"
| where Category == "AzureSiteRecoveryReplicatedItems"
| where isnotempty(name_s) and isnotnull(name_s)
| where lastSuccessfulTestFailoverTime_t <= ago(90d)
| where name_s == "ContosoVM123"
| summarize hint.strategy=partitioned arg_max(TimeGenerated, *) by name_s
| summarize count()
Pour l’alerte, définissez la Valeur de seuil sur 1.
Échec d’un travail de Site Recovery
Configurez une alerte si un travail Site Recovery (dans le cas présent, un travail de reprotection) échoue lors du dernier jour, dans n’importe quel scénario Site Recovery.
AzureDiagnostics
| where Category == "AzureSiteRecoveryJobs"
| where OperationName == "Reprotect"
| where ResultType == "Failed"
| summarize count()
Pour l’alerte, définissez la valeur Seuil sur 1 et Période sur 1 440 minutes pour vérifier les échecs au cours du dernier jour.