BBuddyAI Learn
DevOps · Beginner → Expert

📈 Site Reliability Engineering and Observability

Operate reliable systems using SLOs, metrics, logs, traces, alerting, incident management, capacity planning, resilience testing and automation.

Course roadmap

Pass each module exam to unlock the next module.

Module 1 · Beginner

SRE Principles, Reliability and Error Budgets

Locked
Module 2 · Beginner

SLIs, SLOs and Service-Level Reporting

Locked
Module 3 · Beginner

Metrics and Time-Series Monitoring

Locked
Module 4 · Beginner

Centralized Logging and Structured Events

Locked
Module 5 · Intermediate

Distributed Tracing and Context Propagation

Locked
Module 6 · Intermediate

Dashboards, Visualization and Operational Views

Locked
Module 7 · Intermediate

Alert Design, Paging and Noise Reduction

Locked
Module 8 · Intermediate

Incident Command, Triage and Communication

Locked
Module 9 · Advanced

Postmortems, Root Cause and Corrective Actions

Locked
Module 10 · Advanced

Capacity Planning and Performance Engineering

Locked
Module 11 · Advanced

Resilience, Redundancy and Failure Domains

Locked
Module 12 · Advanced

Chaos Engineering and Controlled Failure Testing

Locked
Module 13 · Expert

On-Call Design, Runbooks and Operational Readiness

Locked
Module 14 · Expert

Automation, Toil Reduction and Self-Healing

Locked
Module 15 · Expert

Observability Security, Cost and Data Governance

Locked
Module 16 · Expert

Expert Capstone: Reliability Program for a Production Service

Locked
Certification gate

Final course exam

Pass mark: 80%. Time limit: 360 minutes. All module exams must be passed first.

Locked until modules are passed