AI & Data Science

Membangun Sistem Monitoring dan Retraining Model ML yang Aman dari Data Drift

Bangun pipeline untuk mendeteksi data drift, memicu retraining secara terukur, dan membuktikan model baru layak dideploy.

Diperbarui 28 Agu 2026id7 bagian · 35 pelajaran4 jam 30 menit
Belum ada ulasan
Level Advanced
Kategori AI & Data Science
Perkiraan Durasi 4 jam 30 menit

Skill yang dibangun

Apa yang akan Anda pelajari

Mengukur data drift pada fitur tabular dengan baseline, metrik yang sesuai, dan interpretasi yang membedakan perubahan statistik dari bukti penurunan kualitas prediksi.

Merancang aturan intervensi berbasis threshold, kombinasi sinyal, dan ketersediaan label sambil menilai risiko false positive, false negative, serta retraining yang tidak perlu.

Mengotomatisasi alur retraining yang reproducible dengan versioning data dan model, validasi kandidat, quality gate, serta strategi rollback ketika kandidat gagal memenuhi kriteria.

Menyediakan bukti teknis untuk deployment model melalui laporan evaluasi, metadata eksperimen, log keputusan, pengujian pipeline, dan pemeriksaan failure mode seperti data kosong, schema berubah, atau proses berjalan bersamaan.

Siapa Target Audiens Kursus Ini

Data scientist, machine learning engineer, dan programmer yang telah menguasai Python, pengolahan data tabular dengan pandas, konsep supervised learning, evaluasi model, Git, serta dasar penggunaan API atau container. Kursus ini ditujukan bagi peserta yang sudah dapat melatih model, tetapi membutuhkan kompetensi praktis untuk menjaga kualitas model setelah deployment: mendeteksi data drift, menetapkan aturan intervensi, mengotomatisasi retraining secara aman, dan menyediakan bukti teknis bahwa perubahan model telah diuji sebelum digunakan.

Project outcomes

Apa yang Akan Anda Buat

Peserta akan membangun mini-sistem monitoring dan retraining untuk model klasifikasi berbasis data tabular. Sistem ini menerima batch data baru, memeriksa schema dan kualitas data, membandingkan distribusinya dengan baseline, menghasilkan laporan drift, lalu memutuskan apakah retraining perlu dijalankan. Kandidat model dilatih menggunakan data berversi, diuji pada skenario evaluasi yang konsisten, dan hanya dipromosikan jika melewati quality gate. Pipeline juga menghasilkan artefak yang dapat ditinjau, termasuk metrik, konfigurasi threshold, versi dataset, versi model, dan alasan keputusan.

Konten Kursus

Menetapkan Kontrak Kualitas Model di Production

5 pelajaran | 190 menit
Ketika Model yang Benar Mulai Salah
30 menit
Memisahkan Data Drift, Concept Drift, dan Data Quality Issue
35 menit
Baseline Bukan Sekadar Statistik Awal
40 menit
Mendefinisikan SLO dan Kontrak Data
40 menit
Menyiapkan Dataset Eksperimen yang Memiliki Drift
45 menit

Mengukur Perubahan Distribusi Tanpa Menipu Diri Sendiri

5 pelajaran | 220 menit
PSI, KS, dan Jarak Distribusi dalam Konteks
45 menit
Fitur Kategorikal, Rare Category, dan Missingness
40 menit
Ukuran Sampel, Confidence, dan False Alarm
45 menit
Drift Feature Tidak Sama dengan Drift Performa
40 menit
Menguji Detektor pada Drift yang Terarah
50 menit

Merancang Jalur Observabilitas Model

5 pelajaran | 205 menit
Apa yang Harus Dicatat dari Setiap Prediksi
35 menit
Batch Monitoring atau Streaming Monitoring
40 menit
Feature-Level Metrics dan Model-Level Metrics
45 menit
Dashboard yang Membantu Diagnosis
40 menit
Label Datang Belakangan: Menjaga Evaluasi Tetap Jujur
45 menit

Mengubah Sinyal Menjadi Kebijakan Intervensi

5 pelajaran | 215 menit
Dari Alert ke Keputusan yang Dapat Dipertanggungjawabkan
45 menit
Threshold Statis, Adaptif, dan Berbasis Segmen
45 menit
Runbook Investigasi untuk Alarm Drift
40 menit
Human-in-the-Loop dan Persetujuan Perubahan
40 menit
Menangani Alarm yang Saling Bertentangan
45 menit

Membangun Retraining Pipeline yang Reproducible

5 pelajaran | 235 menit
Kapan Data Baru Layak Masuk Training Set
45 menit
Pipeline Training yang Dapat Diulang
50 menit
Evaluasi Temporal dan Backtesting
50 menit
Gerbang Kualitas untuk Kandidat Model
45 menit
Versioning Dataset, Model, dan Konfigurasi
45 menit

Mengamankan Rilis, Otomasi, dan Operasi Berkelanjutan

5 pelajaran | 240 menit
Champion-Challenger dan Canary Release
45 menit
Rollback yang Tidak Bergantung pada Ingatan Operator
45 menit
Idempotency, Lock, dan Race Condition pada Retraining
50 menit
Security Boundary untuk Data dan Artefak Model
45 menit
Menguji Sistem Monitoring sebagai Sistem Produksi
55 menit

Proyek Akhir: Membangun DriftGuard untuk Prediksi Risiko Transaksi

5 pelajaran | 435 menit
Perancangan Arsitektur dan Setup DriftGuard
75 menit
Implementasi Ingestion, Baseline, dan Detektor Drift
90 menit
Integrasi Decision Engine dan Retraining Pipeline
90 menit
Rilis Aman, Rollback, dan Bukti Audit
90 menit
Uji Failure Mode dan Presentasi Sistem
90 menit

Deskripsi Kursus

Model machine learning dapat terus menghasilkan prediksi meskipun karakteristik data produksi telah berubah. Perubahan ini dapat menurunkan kualitas prediksi secara perlahan, sulit terlihat dari error aplikasi, dan berisiko memicu retraining yang tidak perlu atau justru terlambat. Kursus ini membangun model mental tentang hubungan antara data drift, perubahan performa, aturan intervensi, dan risiko operasional.

Peserta akan merancang sistem monitoring untuk fitur dan target, memilih metrik serta baseline yang sesuai, lalu menguji bagaimana threshold drift memengaruhi keputusan engineering. Pembahasan mencakup keterbatasan ketika label aktual belum tersedia, perbedaan antara sinyal statistik dan bukti penurunan performa, serta trade-off antara sensitivitas deteksi, biaya komputasi, dan jumlah false alarm.

Proyek kursus menggunakan pipeline Python yang mencatat versi data dan model, mengevaluasi kandidat retraining melalui validasi yang dapat diulang, serta menerapkan quality gate sebelum model baru dipromosikan. Setiap keputusan menghasilkan artefak teknis seperti laporan drift, metrik evaluasi, metadata eksperimen, dan log keputusan sehingga perubahan model dapat diaudit dan ditelusuri.

Rating & Ulasan

0 ratings