Analisis Sentimen Berbasis Aspek untuk Ulasan Produk Bahasa Indonesia dengan Python
Bangun pipeline Python untuk menemukan aspek produk dan mengukur sentimen dari ulasan berbahasa Indonesia.
Rancang prediksi dengan jaminan cakupan, estimasi risiko, dan mekanisme abstention untuk menyerahkan kasus meragukan kepada manusia.
Skill yang dibangun
Membagi data menjadi training, calibration, dan test set tanpa mencampurkan informasi evaluasi ke dalam proses kalibrasi.
Mengimplementasikan split conformal prediction untuk menghasilkan prediction interval pada regresi dan prediction set pada klasifikasi.
Mengukur empirical coverage, lebar interval atau ukuran prediction set, error rate, serta hubungan antara risiko dan tingkat cakupan prediksi.
Merancang aturan abstention berbasis skor ketidakpastian, menguji trade-off antara otomatisasi dan risiko, lalu mendokumentasikan asumsi serta failure mode sistem.
Mahasiswa atau praktisi pemula-menengah di bidang data science yang sudah mampu menggunakan Python, pandas, dan scikit-learn, memahami regresi atau klasifikasi dasar, serta pernah melakukan train-test split dan evaluasi model. Kursus ini ditujukan bagi peserta yang ingin naik tingkat dari sekadar membuat prediksi menjadi merancang sistem yang mengetahui kapan prediksinya dapat dipercaya, kapan perlu memberikan rentang hasil, dan kapan harus menyerahkan keputusan kepada manusia.
Project outcomes
Peserta akan membangun pipeline Python yang memuat data, melatih model scikit-learn, melakukan kalibrasi conformal, dan mengeluarkan keputusan dalam tiga bentuk: prediksi yang diterima, prediksi dengan rentang atau beberapa kandidat kelas, dan kasus yang diabstain untuk ditinjau manusia. Pipeline dilengkapi evaluasi coverage dan risk-coverage curve sehingga perubahan threshold dapat dibandingkan secara kuantitatif. Proyek menggunakan notebook atau skrip terpisah, dengan output berupa tabel prediksi, metrik evaluasi, visualisasi, dan aturan keputusan yang dapat ditelusuri.
Model dengan akurasi tinggi belum tentu aman digunakan untuk mengambil keputusan. Ia dapat menghasilkan prediksi yang tampak meyakinkan saat data berbeda dari data pelatihan, sementara sistem tidak memberi sinyal bahwa keyakinannya rendah. Kursus ini membahas cara merancang lapisan keandalan di atas model machine learning: kapan prediksi dapat diterima, kapan hasil perlu disajikan sebagai rentang atau himpunan kelas, dan kapan sistem sebaiknya tidak memutuskan sendiri.
Peserta akan menggunakan Python dan scikit-learn untuk membangun alur split conformal prediction pada regresi dan klasifikasi. Pembahasan mencakup calibration set, nonconformity score, prediction interval, prediction set, coverage, ukuran interval, serta evaluasi selective prediction melalui risk-coverage curve. Setiap langkah dikaitkan dengan asumsi pertukaran data, potensi data leakage, pemilihan threshold, dan konsekuensi operasional ketika biaya false positive, false negative, dan abstention berbeda.
Proyek akhir menggabungkan model prediksi, pengukur ketidakpastian, aturan abstention, dan laporan evaluasi yang dapat diaudit. Hasilnya bukan klaim bahwa semua prediksi pasti benar, melainkan sistem yang secara terukur menunjukkan batas kepercayaannya serta menyediakan jalur eskalasi untuk kasus yang tidak layak diputuskan otomatis.
Bangun pipeline Python untuk menemukan aspek produk dan mengukur sentimen dari ulasan berbahasa Indonesia.
Bangun pipeline ekstraksi entitas dan relasi dari teks Bahasa Indonesia, lalu evaluasi hasilnya sebagai knowledge graph yang terukur.
Bangun alur Python untuk mengekstrak tabel dari PDF operasional, memvalidasi hasilnya, lalu menyimpannya sebagai CSV siap analisis.
Bangun pipeline synthetic data tabular yang dapat diuji dari sisi privasi, kualitas statistik, dan dampaknya terhadap performa model.