Cloud Computing

Chaos Engineering Cloud-Native: Uji Resiliensi Kubernetes dengan LitmusChaos, OpenTelemetry, Prometheus, dan SLO

Bangun eksperimen chaos yang aman untuk menguji resiliensi Kubernetes dengan LitmusChaos, observability, Prometheus, dan SLO.

Diperbarui 27 Agu 2026id7 bagian · 35 pelajaran4 jam 30 menit
Belum ada ulasan
Level Advanced
Kategori Cloud Computing
Perkiraan Durasi 4 jam 30 menit

Skill yang dibangun

Apa yang akan Anda pelajari

Merancang steady-state hypothesis, blast radius, rollback plan, dan guardrail untuk eksperimen chaos di Kubernetes.

Menjalankan serta mengustomisasi eksperimen LitmusChaos seperti pod delete, pod network latency, dan node-level failure secara aman.

Menginstrumentasi workload cloud-native dengan OpenTelemetry dan membaca hubungan antara traces, metrics, logs, serta dampak eksperimen.

Menggunakan Prometheus, SLI, SLO, dan error budget untuk mengukur hasil chaos experiment serta menentukan apakah sistem siap dirilis.

Siapa Target Audiens Kursus Ini

Software engineer, DevOps engineer, platform engineer, SRE, dan cloud architect yang sudah memahami Linux, container, Kubernetes, CI/CD, serta konsep dasar monitoring dan ingin membangun sistem produksi yang mampu menghadapi kegagalan secara terukur.

Project outcomes

Apa yang Akan Anda Buat

Kamu akan membangun proyek end-to-end berupa layanan microservice sederhana yang berjalan di Kubernetes, lengkap dengan telemetry OpenTelemetry, dashboard dan query Prometheus, definisi SLO, serta rangkaian eksperimen LitmusChaos. Proyek ini mencakup pengujian pod failure, network degradation, dan dependency failure dengan guardrail, observasi sebelum dan sesudah eksperimen, analisis error budget, serta laporan hasil yang bisa dipakai sebagai artefak portofolio atau bahan diskusi reliability di tim.

Konten Kursus

Fondasi Chaos Engineering dan Resiliensi Cloud-Native

5 pelajaran | 185 menit
Chaos Engineering: Dari Asumsi ke Hipotesis Terukur
30 menit
Failure Mode pada Aplikasi Kubernetes
35 menit
Resilience Pattern: Health Check, Retry, Timeout, dan Graceful Degradation
40 menit
Risk Assessment dan Blast Radius Eksperimen
35 menit
Guided Practice: Menulis Chaos Experiment Plan
45 menit

Menyiapkan Lab Kubernetes dan LitmusChaos

5 pelajaran | 215 menit
Membangun Cluster Lab yang Repeatable
40 menit
Arsitektur LitmusChaos dan Chaos Operator
35 menit
Instalasi LitmusChaos dengan Helm
45 menit
Menjalankan Pod Delete Experiment
45 menit
Independent Practice: Membatasi Target dan Rollback Chaos
50 menit

Metrik Resiliensi dengan Prometheus dan OpenTelemetry

5 pelajaran | 235 menit
Prometheus untuk Golden Signals
40 menit
PromQL untuk Membaca Dampak Eksperimen
45 menit
OpenTelemetry: Trace, Span, dan Context Propagation
45 menit
Menghubungkan OpenTelemetry Collector dengan Backend Observability
50 menit
Guided Practice: Dashboard Eksperimen Resiliensi
55 menit

SLO, Error Budget, dan Validasi Eksperimen

5 pelajaran | 225 menit
SLI dan SLO untuk Service Kubernetes
40 menit
Menghitung Error Budget dan Burn Rate
40 menit
Prometheus Recording Rule untuk SLO
50 menit
Mendefinisikan Abort Condition Berbasis SLO
40 menit
Independent Practice: Menganalisis Hasil Eksperimen
55 menit

Eksperimen Gangguan Network, Resource, dan Dependency

5 pelajaran | 270 menit
Network Chaos: Delay, Loss, dan Deny Traffic
50 menit
Resource Chaos: CPU dan Memory Stress
50 menit
Dependency Failure pada Database dan External API
55 menit
Node dan Availability Zone Failure
55 menit
Guided Practice: GameDay Multi-Failure yang Aman
60 menit

Otomasi Chaos di CI/CD dan Operasional Produksi

5 pelajaran | 235 menit
Chaos Experiment sebagai Quality Gate
45 menit
Menjalankan LitmusChaos dari Pipeline CI/CD
55 menit
RBAC, Secret, dan Guardrail untuk Production Chaos
45 menit
Alerting, Incident Response, dan Evidence Collection
50 menit
Maturity Model dan Culture of Reliability
40 menit

Proyek Akhir: Membangun Resilience Validation Platform

5 pelajaran | 425 menit
Perancangan & Setup Resilience Validation Platform
75 menit
Implementasi Aplikasi Demo dan Telemetry Pipeline
90 menit
Implementasi Chaos Workflow dan SLO Guardrail
90 menit
Integrasi Pipeline CI/CD dan Evidence Report
80 menit
Pengujian Akhir, GameDay, dan Presentasi Hasil
90 menit

Deskripsi Kursus

Sistem production pasti akan mengalami failure: pod crash, network latency, node bermasalah, atau dependency yang timeout. Masalahnya bukan apakah failure akan terjadi, tapi apakah tim kamu sudah tahu dampaknya dan bisa membuktikan sistem tetap memenuhi target layanan. Di sini kamu belajar chaos engineering sebagai proses terukur, bukan sekadar mematikan pod lalu berharap semuanya baik-baik saja.

Kamu akan membangun lab Kubernetes dengan LitmusChaos, lalu menghubungkan eksperimen ke OpenTelemetry dan Prometheus untuk melihat dampak failure dari sisi metrics, traces, dan service behavior. Setelah itu, kamu akan menerjemahkan hasil pengujian ke dalam SLI, SLO, error budget, serta keputusan go/no-go yang bisa dipakai dalam workflow engineering nyata.

Materinya disusun dari fondasi ke praktik. Kamu mulai dari threat model dan steady-state hypothesis, lanjut menulis eksperimen chaos yang punya blast radius terbatas, membaca telemetry, dan menganalisis hasilnya. Di bagian akhir, kamu menyusun pipeline pengujian resiliensi yang repeatable dan aman untuk diintegrasikan ke proses delivery. Intinya, kamu bukan cuma bisa menjalankan chaos experiment, tapi juga bisa menjelaskan bukti teknisnya saat code review atau incident review.

Rating & Ulasan

0 ratings