Volver a los 8 Pilares
Pilar 4

ElConfiabilidadPilar

Construye sistemas que se recuperan con gracia del fracaso y sirven a los usuarios constantemente a escala, con SLOs, presupuestos de errores y arquitectura resiliente.

Resiliencia Presupuestos de error Recuperación rápida
OVERVIEW

La fiabilidad es disponibilidad en caso de fracaso

Las cargas de trabajo de la nube fallan. El pilar de fiabilidad diseña para el fracaso, lo mide y hace de la recuperación una práctica repetible.

Ingeniería de resiliencia

Redundancia, aislamiento, degradación agraciada y disyuntor de circuitos evitan que las fallas parciales se conviertan en salpicaduras.

Presupuestos de error

Velocidad de equilibrio y estabilidad con SLOs y presupuestos de errores que indican a los equipos cuándo enviar y cuándo arreglar.

Recuperación rápida

Fallo automatizado, corredores, respuesta a incidentes y postmortems sin culpa reducen el tiempo medio de recuperación.

CAPABILIDADES

Lo que cubre el pilar de fiabilidad

Desde el diseño HA/DR hasta la observabilidad y la gestión de incidentes.

SLOs y presupuestos de errores

Objetivos de confiabilidad orientados al usuario, medidos y defendidos con presupuestos de error y alertas de quemadura.

Arquitectura HA/DR

Multi-AZ, multi-región, respaldos y planes de recuperación de desastres probados regularmente, no sólo documentados.

Observabilidad

métricas, registros, trazas y controles de salud que revelan modos de falla antes de que los usuarios noten.

Runbooks y pruebas de caos

Procedimientos de respuesta documentados y ejercicios de día de juego que validan la recuperación en condiciones realistas.

MATURIDAD

Tres niveles de madurez de confiabilidad

Muévete de esperar que se mantenga a los sistemas de ingeniería que fallan con seguridad.

Nivel 1

Base de referencia

Existen respaldos, supervisión básica y medidas de recuperación documentadas para el volumen de trabajo de producción.

Nivel 2

Normalización

SLOs, runbooks, alerta automatizada y fallos probados son parte de cada lanzamiento de servicio.

Nivel 3

Optimize

Ingeniería de caos, detección predictiva y mejoras de confiabilidad continua impulsadas por los datos.

Empieza

Sistemas fiables

Lea la documentación completa del pilar de fiabilidad o ejecute su primera revisión automatizada con WAFPass.

SLOS HA/DR Pruebas de caos