Retour aux 8 piliers
Pilier 4

LesFiabilitéPilier

Construisez des systèmes qui récupèrent gracieusement de l'échec et servent les utilisateurs régulièrement à l'échelle - avec des SLO, des budgets d'erreurs et une architecture résiliente.

Résilience Erreurs budgétaires Récupération rapide
Aperçu général

La fiabilité est la disponibilité en cas de défaillance

Les charges de travail en nuage échouent. Le pilier de fiabilité conçoit la défaillance, la mesure et fait de la récupération une pratique répétable.

Génie de la résilience

La redondance, l'isolement, la dégradation gracieuse et les disjoncteurs empêchent les pannes partielles de devenir des pannes.

Erreurs budgétaires

Équilibrez la vitesse et la stabilité avec les ALS et les budgets d'erreurs qui indiquent aux équipes quand expédier et quand réparer.

Récupération rapide

La mise en échec automatisée, les runbooks, la réponse incidente et les postmortems irréprochables réduisent le temps moyen de récupération.

CAPACITÉS

Ce que couvre le pilier de fiabilité

De la conception HA/DR à l'observation et la gestion des incidents.

Budgets d'erreur SLOs &

Objectifs de fiabilité orientés vers l'utilisateur, mesurés et défendus avec des budgets d'erreurs et des alertes de taux de combustion.

Architecture HA/DR

Les plans multi-AZ, multi-régions, de sauvegarde et de récupération des catastrophes ont été testés régulièrement, et non seulement documentés.

Observabilité

Métriques, journaux, traces et contrôles de santé qui révèlent des modes de défaillance avant que les utilisateurs les remarquent.

Essais de chaos des runbooks &

Procédures de réponse documentées et exercices de jour de jeu qui valident la récupération dans des conditions réalistes.

MATURITÉ

Trois niveaux d'échéance de fiabilité

Passer de l'espoir qu'il reste à la hauteur des systèmes d'ingénierie qui échouent en toute sécurité.

Niveau 1

Référence

Des sauvegardes, une surveillance de base et des étapes de récupération documentées existent pour les charges de production.

Niveau 2

Normaliser

Les SLO, les runbooks, les alertes automatisées et les pannes testées font partie de chaque lancement de service.

Niveau 3

Optimiser

Ingénierie du chaos, détection prédictive et amélioration continue de la fiabilité grâce aux données.

Commencer

Construire des systèmes fiables

Lisez la documentation complète du pilier de fiabilité ou exécutez votre premier examen automatisé avec WAFPass.

SLO HA/DR Essais de Chaos