Wat is betrouwbaarheidstechniek?

Voltooid

Site Reliability Engineering (SRE) stelt softwareontwikkelaars in staat om eigenaar te zijn van de lopende dagelijkse werking van hun toepassingen in productie. Het doel is om de kloof te overbruggen tussen het ontwikkelteam dat continu moet worden verzonden en het operationele team dat verantwoordelijk is voor de betrouwbaarheid van de productieomgeving. Sitebetrouwbaarheidstechniek verschuift de verantwoordelijkheid van productiebetrouwbaarheid naar de SRE in het ontwikkelteam.

Sitebetrouwbaarheidstechnici besteden doorgaans tot 50% van hun tijd aan de dagelijkse taken die de toepassing betrouwbaar en de rest van hun tijd aan het ontwikkelen van software houden.

Een belangrijke vaardigheid van een softwarebetrouwbaarheidstechnicus is dat ze een grondige kennis van de toepassing hebben. Dit omvat kennis van de code, hoe de toepassing wordt uitgevoerd, hoe deze wordt geconfigureerd en hoe deze wordt geschaald.

Enkele van de typische verantwoordelijkheden van een sitebetrouwbaarheidstechnicus zijn:

  • Bewaak en controleer de prestaties van toepassingen proactief.
  • Afhandelen op oproep en hulp bij noodgevallen.
  • Zorg ervoor dat de software goede logboekregistratie en diagnostische gegevens heeft.
  • Operationele runbooks maken en onderhouden.
  • Help bij het classificeren van geëscaleerde ondersteuningstickets.
  • Werk aan functieaanvragen, defecten en andere ontwikkelingstaken.
  • Bijdragen aan de algemene productroadmap.
  • Live sitebeoordelingen uitvoeren en feedback vastleggen voor systeemstoringen.

Sitebetrouwbaarheidstechniek versus DevOps

DevOps bouwt een gezonde werkrelatie tussen de operationele medewerkers en het ontwikkelteam. Door de silo's tussen de twee af te breken, produceert DevOps een robuuster, betrouwbaarder product.

Zowel SRE als DevOps zijn methodologieën die de behoefte van een organisatie aanpakken om de productieomgeving te beheren. Zoals u in de vorige modules hebt geleerd, kunnen DevOps-feedbacksystemen problemen identificeren en de ontwikkelaars waarschuwen, die het probleem vervolgens oplossen. Met SRE zoekt een persoon in het ontwikkelteam dagelijks naar problemen met de betrouwbaarheid van sites en is dit waarschijnlijk ook de persoon die deze problemen oplost. Hoewel DevOps-teams er meestal voor kiezen om de productieomgeving ongewijzigd te laten, tenzij dit absoluut noodzakelijk is, zullen SRE's waarschijnlijk wijzigingen aanbrengen.

Technische vaardigheden voor sitebetrouwbaarheid

Het type vaardigheden dat nodig is, is afhankelijk van de toepassing, hoe en waar deze wordt geïmplementeerd en hoe deze wordt bewaakt. Organisaties die serverloze technologieën gebruiken, hebben bijvoorbeeld niemand nodig met diepgaande kennis van Het beheer van Windows- of Linux-systemen. Deze vaardigheden zijn echter essentieel voor teams die servers gebruiken voor implementaties.

Andere belangrijke vaardigheden voor een goede SRE-focus op toepassingsbewaking en diagnostische gegevens. Een SRE moet ervaring hebben met hulpprogramma's voor het beheer van toepassingsprestaties, zoals Application Insights. Ze moeten ook de aanbevolen procedures voor toepassingslogboeken en de verwerking van uitzonderingen begrijpen.