Analisis Sentimen Berbasis Aspek untuk Ulasan Produk Bahasa Indonesia dengan Python
Bangun pipeline Python untuk menemukan aspek produk dan mengukur sentimen dari ulasan berbahasa Indonesia.
Rancang strategi active learning untuk memilih data paling informatif dan mengurangi biaya pelabelan klasifikasi teks Bahasa Indonesia.
Skill yang dibangun
Membangun baseline klasifikasi teks Bahasa Indonesia dan menetapkan protokol evaluasi yang memisahkan data awal, pool tanpa label, validation set, dan test set.
Mengimplementasikan beberapa strategi pemilihan sampel berbasis ketidakpastian serta menghitung dampaknya terhadap performa model pada anggaran label yang sama.
Membandingkan random sampling, uncertainty sampling, dan sampling berbasis keragaman menggunakan seed, metrik, serta visualisasi kurva label-performa yang konsisten.
Mendiagnosis bias sampling, ketidakseimbangan kelas, label noise, kebocoran data, dan kondisi ketika active learning tidak memberikan penghematan yang layak.
Data scientist, machine learning engineer, peneliti terapan, atau programmer Python yang sudah memahami aljabar linear dasar, probabilitas, supervised learning, evaluasi klasifikasi, pemrosesan data tabular dan teks, serta penggunaan pandas dan scikit-learn. Peserta membutuhkan kompetensi untuk merancang strategi pelabelan yang efisien, menjalankan eksperimen komparatif yang dapat dipertanggungjawabkan, dan menghubungkan hasil eksperimen dengan keputusan engineering dalam proyek AI nyata.
Project outcomes
Peserta akan membangun pipeline eksperimen pool-based active learning untuk klasifikasi teks Bahasa Indonesia. Pipeline tersebut memuat pemuatan dan pemeriksaan data, preprocessing yang konsisten, baseline random sampling, pemilihan sampel oleh beberapa strategi, pembaruan model secara iteratif, pencatatan anggaran label, evaluasi pada test set yang tidak disentuh selama eksperimen, serta laporan komparatif untuk mendukung keputusan penggunaan strategi pelabelan.
Pelabelan data teks sering menjadi hambatan utama ketika model klasifikasi membutuhkan banyak contoh beranotasi, sementara waktu dan anggaran annotator terbatas. Kursus ini membahas cara memilih sampel yang paling bernilai untuk dilabeli, bukan sekadar menambah data secara acak. Kita akan menghubungkan ketidakpastian model, keragaman data, kualitas anotasi, dan perubahan performa pada set evaluasi yang terjaga.
Materi mencakup pembentukan baseline, simulasi pool-based active learning, strategi uncertainty sampling, margin sampling, entropy sampling, serta pendekatan berbasis keragaman. Eksperimen dirancang agar perbandingan ant strategi dapat dipertanggungjawabkan melalui split data yang benar, beberapa random seed, kurva performa terhadap anggaran label, dan metrik yang sesuai dengan karakteristik kelas Bahasa Indonesia.
Peserta juga akan menelaah failure mode seperti bias pemilihan sampel, distribusi kelas yang berubah, kebocoran data, label noise, dan penghentian eksperimen yang terlalu dini. Implementasi menggunakan Python, pandas, scikit-learn, dan pustaka pemodelan teks yang sesuai, dengan penekanan pada struktur eksperimen yang dapat dipelihara serta keputusan engineering yang dapat dijelaskan.
Bangun pipeline Python untuk menemukan aspek produk dan mengukur sentimen dari ulasan berbahasa Indonesia.
Bangun pipeline ekstraksi entitas dan relasi dari teks Bahasa Indonesia, lalu evaluasi hasilnya sebagai knowledge graph yang terukur.
Bangun alur Python untuk mengekstrak tabel dari PDF operasional, memvalidasi hasilnya, lalu menyimpannya sebagai CSV siap analisis.
Bangun pipeline synthetic data tabular yang dapat diuji dari sisi privasi, kualitas statistik, dan dampaknya terhadap performa model.