Resiliency
14 pages
-
Availability
concept
Uptime/downtime definition; the nines table (90%–99.999%); techniques for high availability; dependency chaining effects; design-for-production philosophy; ROI of availability investment; MTBF/MTTR/RPO/RTO measurement framework; tyranny of the nines antipattern; Allspaw: MTTR > MTBF; SRE: 100% is always the wrong target
-
Bulkhead Pattern
pattern
Resource partitioning, shuffle sharding, cellular architecture
-
Chaos Engineering
concept
definition, prerequisites, experiment design, injection types (Chaos Monkey/Latency Monkey/FIT), targeting strategy, automation and moderation, disaster simulations; theoretical foundations (drift into failure, regulator paradox, antifragility); complex systems foundations (accidental vs essential complexity, emergent failures, composability of safety); Netflix origin story; Chaos Maturity Model
-
Chaos Engineering: System Resiliency in Practice
source
*Chaos Engineering: System Resiliency in Practice* — Rosenthal & Jones (eds.); complex systems theory, Five Advanced Principles, Game Days, LDFI, Chaos Maturity Model, Continuous Verification, Security Chaos Engineering, organisational/human factors
-
Circuit Breaker
pattern
Closed/open/half-open state machine for downstream resiliency
-
Common Failure Causes
concept
failure taxonomy: hardware, incorrect error handling (2014 study), configuration changes, SPOFs, gray failures, resource leaks, cascading/metastable failures; risk = probability × impact; airline/Black Friday/"Trampled" case studies; building-for-tests vs building-for-production; GC death spiral, queue management (LIFO/CoDel), deadline propagation, latency vs capacity cache
-
Failure Detection
concept
Timeouts (fundamental limitation), pings vs heartbeats, when to use active detection; imperfect failure detection theorem
-
Rate Limiting and Upstream Resiliency
concept
Load shedding (503, priority/age ordering), load leveling (async channel + auto-scaling), rate limiting (sliding window buckets, distributed atomic increment, fail-open), constant work pattern (periodic full-state dump, antifragile, self-healing)
-
Release It! Design and Deploy Production-Ready Software
source
*Release It! Design and Deploy Production-Ready Software* — Michael Nygard
-
Retry
pattern
Transient failure recovery; exponential backoff with jitter; retry amplification in chains; idempotency prerequisite; retry queues
-
Sidecar / Service Mesh
pattern
East–west traffic governance: mTLS, service authorisation, evolution from libraries to eBPF; sidecar as reuse mechanism for operational concerns; orthogonal coupling; data-sinking sidecar for EDM legacy integration
-
Synchronous vs Asynchronous Communication
comparison
When to use synchronous vs asynchronous communication; temporal coupling as the core distinction; availability chaining risk; async concerns (idempotency, ordering, correlation, observability); mixed model (sync north-south, async east-west); decision guide
-
Timeout
pattern
Bounding wait time on every blocking call; sizing by P99.9; absent-timeout gotchas; relationship to circuit breaker and retry
-
Understanding Distributed Systems
source
*Understanding Distributed Systems* — Roberto Vitillo