AI & Data Science

Membangun Contextual Bandit untuk Personalisasi Aman dengan Evaluasi Counterfactual

Rancang contextual bandit untuk personalisasi, ukur risiko, dan evaluasi kebijakan baru dari data historis secara counterfactual.

Diperbarui 28 Agu 2026id7 bagian · 35 pelajaran4 jam 30 menit
Belum ada ulasan
Level Advanced
Kategori AI & Data Science
Perkiraan Durasi 4 jam 30 menit

Skill yang dibangun

Apa yang akan Anda pelajari

Memformulasikan masalah personalisasi sebagai contextual bandit dengan konteks, himpunan aksi, reward, policy, dan logging policy yang eksplisit.

Mengimplementasikan strategi eksplorasi dan kebijakan berbasis model sambil mengukur dampaknya terhadap reward, coverage aksi, dan risiko operasional.

Menghitung serta menginterpretasikan inverse propensity scoring dan doubly robust estimation, termasuk memeriksa overlap, clipping, bias, dan varians.

Menguji policy service melalui simulasi dan data historis, lalu menetapkan guardrail, skema logging, serta kriteria keputusan sebelum eksperimen online.

Siapa Target Audiens Kursus Ini

Data scientist, machine learning engineer, peneliti terapan, dan programmer yang telah menguasai Python, NumPy atau pandas, konsep supervised learning, probabilitas dasar, aljabar linear, evaluasi model, serta pengembangan API sederhana. Peserta membutuhkan kemampuan untuk merancang sistem pengambilan keputusan adaptif dan menilai dampaknya dari data historis, bukan sekadar melatih model prediksi statis.

Project outcomes

Apa yang Akan Anda Buat

Peserta membangun prototipe layanan personalisasi yang memilih rekomendasi berdasarkan konteks pengguna, mencatat aksi, reward, dan propensity score, lalu menyediakan evaluasi offline untuk membandingkan kebijakan kandidat dengan kebijakan historis. Proyek dilengkapi simulasi untuk menguji eksplorasi, pemeriksaan overlap dan distribusi, clipping propensity, serta guardrail yang mencegah keputusan berisiko ketika keyakinan model rendah atau data berada di luar cakupan pelatihan.

Konten Kursus

Dari Prediksi Statis ke Keputusan Adaptif

5 pelajaran | 195 menit
Mengapa Skor Prediksi Belum Menjadi Kebijakan
35 menit
Formulasi Contextual Bandit pada Feed Konten
40 menit
Eksplorasi, Eksploitasi, dan Biaya Keputusan
35 menit
Reward Bukan Sekadar Klik
40 menit
Dataset Log sebagai Kontrak Eksperimen
45 menit

Membangun Simulator dan Baseline yang Dapat Dipercaya

5 pelajaran | 215 menit
Simulator User–Content dengan Reward Tersembunyi
50 menit
Baseline Random dan Policy Berbasis Aturan
35 menit
Validasi Skema Log dan Propensity
40 menit
Eksperimen Online di Dalam Simulator
45 menit
Membaca Gejala Bug pada Sistem Adaptif
45 menit

Policy Contextual Bandit dan Pembelajaran Online

5 pelajaran | 245 menit
Eksplorasi Epsilon-Greedy yang Terukur
45 menit
LinUCB dan Ketidakpastian Estimasi
55 menit
Thompson Sampling dengan Model Linear
55 menit
Update Incremental, Cold Start, dan Nonstationarity
50 menit
Memilih Algoritme dengan Matriks Trade-off
40 menit

Evaluasi Counterfactual dari Logged Bandit Feedback

5 pelajaran | 250 menit
Mengapa Outcome Alternatif Tidak Teramati
40 menit
Inverse Propensity Scoring dari Dasar
50 menit
SNIPS, Clipping, dan Bias–Variance
50 menit
Doubly Robust dan Model Reward
55 menit
Confidence Interval dan Diagnostik Overlap
55 menit

Personalisasi Aman dan Constraint pada Policy

5 pelajaran | 235 menit
Safety Layer sebelum Action Dieksekusi
45 menit
Constraint Keras dan Penalti Reward
45 menit
Fairness, Exposure, dan Segmentasi Risiko
50 menit
Privasi, Kebocoran Fitur, dan Data Minimization
45 menit
Fallback, Kill Switch, dan Audit Keputusan
50 menit

Serving, Eksperimen, dan Operasionalisasi

5 pelajaran | 240 menit
Interface Policy untuk Layanan Keputusan
45 menit
Batch Scoring dan Online Serving
45 menit
Contract Test, Replay, dan Reproducibility
50 menit
Rollout Bertahap dan A/B dengan Guardrail
50 menit
Monitoring Drift dan Kualitas Eksplorasi
50 menit

Proyek Akhir: Membangun Layanan Personalisasi Feed Aman

5 pelajaran | 435 menit
Perancangan dan Setup Proyek
75 menit
Simulator, Logging, dan Baseline
90 menit
Policy Adaptif dan Safety Filter
90 menit
Evaluasi Counterfactual dan Analisis Risiko
90 menit
Serving, Pengujian, dan Presentasi Hasil
90 menit

Deskripsi Kursus

Sistem personalisasi tidak hanya memprediksi respons pengguna; sistem juga memilih tindakan yang memengaruhi data berikutnya. Keputusan yang tampak meningkatkan klik dapat mempersempit eksplorasi, memperkuat bias historis, atau menimbulkan risiko ketika kebijakan baru diterapkan. Kursus ini membangun model mental tersebut melalui contextual bandit, mulai dari konteks, aksi, reward, policy, hingga mekanisme eksplorasi yang dapat diaudit.

Kita mengimplementasikan pipeline berbasis Python untuk membentuk data log, melatih kebijakan, mengelola propensity score, dan mengukur performa menggunakan evaluasi counterfactual seperti inverse propensity scoring dan doubly robust estimation. Setiap metode dibahas bersama asumsi, sumber bias, varians estimator, serta kondisi ketika hasil offline tidak cukup kuat untuk mendukung deployment.

Proyek akhir menggabungkan policy service sederhana dengan guardrail keselamatan, logging yang memadai, pemeriksaan distribusi, dan prosedur validasi. Peserta juga berlatih membaca kegagalan—misalnya dukungan aksi yang tidak memadai, propensity yang ekstrem, data leakage, dan perubahan distribusi konteks—sehingga hasil evaluasi dapat ditelusuri dan keputusan engineering memiliki dasar yang terukur.

Rating & Ulasan

0 ratings