Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Gäller för: ✔️ AKS Automatic ✔️ AKS Standard
Azure Kubernetes Service (AKS) övervakar kontinuerligt hälsotillståndet för arbetsnoder och reparerar automatiskt noderna om de inte är felfria. Plattformen för virtuella Azure-datorer utför underhåll på virtuella datorer som har problem. AKS och virtuella Azure-datorer arbetar tillsammans för att minimera tjänstavbrott för kluster.
För de flesta produktionsarbetsbelastningar är AKS Automatic den rekommenderade produktionsklara standardupplevelsen för AKS. Både AKS Automatic- och AKS Standard-kluster är förkonfigurerade med automatisk reparation av noden.
I den här artikeln får du lära dig hur automatisk reparation av noder fungerar, när reparationsåtgärder utlöses, vilka begränsningar som gäller och hur du övervakar reparationshändelser.
Beteende för automatisk reparation av nod efter klusterläge
Båda AKS-klusterlägena är förkonfigurerade med automatisk reparation av noden:
- AKS Automatic: Förkonfigurerad som en del av AKS Automatics produktionsklara standardinställningar.
- AKS Standard: Förkonfigurerad på AKS Standard-kluster utan extra installation.
Båda lägena använder samma nodhälsokontroller och samma reparationssekvens som beskrivs i den här artikeln.
Mer information om standardinställningar för AKS-automatiska plattformar finns i Vad är Azure Kubernetes Service (AKS) Automatisk?
Så här söker AKS efter NotReady-noder
AKS använder följande regler för att avgöra om en nod är skadad och behöver repareras:
- Noden rapporterar NotReady-status för efterföljande kontroller inom en tidsram på 10 minuter.
- Noden rapporterar ingen status inom 10 minuter.
Du kan kontrollera hälsotillståndet för dina noder manuellt med kubectl get nodes kommandot .
Så här fungerar automatisk reparation
Kommentar
AKS initierar reparationsåtgärder med användarkontot aks-remediator.
Om AKS identifierar en felaktig nod som förblir felaktig i minst fem minuter, utför AKS följande åtgärder:
- AKS startar om noden.
- Om noden fortfarande är ohälsosam efter omstart avbildar AKS om noden.
- Om noden fortfarande är felaktig efter omavbildning och det är en Linux-nod, distribuerar AKS noden på nytt.
AKS försöker köra sekvensen för omstart, omavbildning och omdistribution igen upp till tre gånger om noden fortsätter att vara felaktig. Den övergripande processen för automatisk reparation kan ta upp till en timme att slutföra.
Produktionsöverväganden
Automatisk reparation av noder är en grundläggande återhämtningsmekanism, men kombinerar den med återhämtningsmetoder på arbetsbelastningsnivå:
- Kör kritiska arbetsbelastningar med flera repliker.
- Använd PodDisruptionBudgets och readiness-prober för att minska synlig påverkan för användarna.
- Övervaka reparationsaktivitet och felhändelser för att identifiera upprepade nodproblem.
- Införliva tid för automatisk reparation i SLO/SLA och incidenthanteringsplanering.
Begränsningar
Automatisk reparation av AKS-noder är en tjänst av typen best effort. AKS garanterar inte att en nod återställs till felfri status i varje scenario. Om en nod fortfarande är skadad utför du manuell undersökning. Mer information finns i Felsökning av nodens NotReady-status.
AKS kanske inte utför automatisk reparation i följande scenarier:
- Ett nätverkskonfigurationsfel förhindrar rapportering av nodstatus.
- Det går inte att registrera en nod som en felfri nod.
- En nod har något av följande taints:
node.cloudprovider.kubernetes.io/shutdownToBeDeletedByClusterAutoscaler
- En nod uppgraderas och har följande anteckningar:
"cluster-autoscaler.kubernetes.io/scale-down-disabled": "true""kubernetes.azure.com/azure-cluster-autoscaler-scale-down-disabled-reason": "upgrade"
Övervaka automatisk reparation av noder med Kubernetes-händelser
När AKS utför automatisk nodreparation genererar den Kubernetes-händelser från aks-auto-repair källan. Följande händelser visas på ett nodobjekt när automatisk reparation sker.
Mer information om åtkomst, lagring och aviseringar för Kubernetes-händelser finns i Använda Kubernetes-händelser för felsökning i AKS.
| Anledning | Händelsemeddelande | beskrivning |
|---|---|---|
| NodeRebootStart | Automatisk reparation av nod initierar en omstartsåtgärd på grund av att NotReady-statusen bevaras i mer än fem minuter. | Den här händelsen meddelar dig när omstarten ska utföras på noden. Den här åtgärden är den första i den övergripande sekvensen för automatisk reparation av noden. |
| NodeRebootEnd | Omstartsåtgärden från självreparationen av noden har slutförts. | Genereras när omstarten är klar på noden. Den här händelsen anger inte nodens hälsostatus (felfri eller inte felfri) efter omstarten. |
| NodeReimageStart | Automatisk nodreparation initierar en omavbildning eftersom statusen NotReady har kvarstått i mer än fem minuter. | Den här händelsen meddelar dig om när avbildning ska utföras på din nod. |
| NodeReimageEnd | Åtgärden för att återskapa nodens automatiska reparation har slutförts. | Genereras när omavbildning har slutförts på noden. Den här händelsen indikerar inte hälsostatusen (felfri eller ofrisk) för noden efter att omavbildningen har utförts. |
| Starta omdistribution av nod | Automatisk nodreparation påbörjar en omdistribution eftersom NotReady-statusen har kvarstått i mer än fem minuter. | Den här händelsen meddelar dig när omdistributionen ska utföras på din nod. Omdistribuering är den sista åtgärden i sekvensen för automatisk reparation av noden. |
| Slut på nodåterdisponering | Omdistribueringsåtgärden från den automatiska nodreparationen har slutförts. | Genereras när omdistributionen har slutförts på noden. Den här händelsen anger inte nodens hälsostatus (felfri eller inte felfri) när omdistributionen har utförts. |
Om fel uppstår under automatisk reparation av noden genererar AKS följande händelser med det ordagranta felmeddelandet. Mer information finns i Felsöka vanliga fel vid automatisk reparation av noder.
Kommentar
Felkoden i följande händelsemeddelanden varierar beroende på det rapporterade felet.
| Anledning | Händelsemeddelande | beskrivning |
|---|---|---|
| NodeRebootError | Omstarten av nodens automatiserade reparation misslyckades på grund av ett funktionsfel. Se felinformation här: Felkod | Genereras när det uppstår ett fel med omstartsåtgärden. |
| NodeReimageError | Åtgärden för att ominstallera noden automatiskt misslyckades på grund av ett driftsfel. Se felinformation här: Felkod | Genereras när det finns ett fel med återimeringsåtgärden. |
| Fel vid omplacering av nod | Åtgärden för automatisk reparation av nod misslyckades på grund av ett operativt fel. Se felinformation här: Felkod | Genereras när det uppstår ett fel med omdistributionsåtgärden. |