Analisis Sentimen Berbasis Aspek untuk Ulasan Produk Bahasa Indonesia dengan Python
Bangun pipeline Python untuk menemukan aspek produk dan mengukur sentimen dari ulasan berbahasa Indonesia.
Pelajari cara memeriksa bias data dan prediksi model AI dengan Python melalui audit keadilan yang terukur dan dapat dijelaskan.
Skill yang dibangun
Memeriksa struktur, nilai hilang, distribusi kelompok, dan potensi ketimpangan pada data tabular menggunakan pandas.
Menghitung serta membandingkan selection rate, true positive rate, false positive rate, dan akurasi untuk beberapa kelompok.
Membuat visualisasi dan tabel audit yang membantu membedakan masalah kualitas data, perbedaan kinerja model, dan indikasi bias.
Menyusun laporan audit Python yang menyatakan asumsi, keterbatasan metrik, temuan berbasis bukti, dan rekomendasi validasi lanjutan.
Pemula yang sudah memahami dasar Python seperti variabel, fungsi, percabangan, dan penggunaan notebook, serta memiliki sedikit pengalaman membaca tabel atau CSV. Kursus ini ditujukan bagi calon data analyst, mahasiswa, pengembang aplikasi, dan praktisi nonspesialis yang ingin memahami cara menemukan bias pada data maupun hasil prediksi model tanpa harus menguasai matematika machine learning tingkat lanjut.
Project outcomes
Peserta akan membangun notebook audit keadilan model AI menggunakan dataset tabular berisi atribut kelompok, label aktual, dan prediksi model. Notebook tersebut memuat pemeriksaan kualitas data, ringkasan distribusi, perhitungan metrik per kelompok, visualisasi perbandingan, serta kesimpulan yang membedakan temuan, asumsi, dan hal yang masih perlu diuji.
Model AI dapat menghasilkan prediksi yang tampak akurat, tetapi tetap merugikan kelompok tertentu. Masalahnya bisa berasal dari ketimpangan data, cara label dibuat, pemilihan fitur, atau perbedaan tingkat kesalahan antarkelompok. Kursus ini mengajak kita menelusuri penyebab tersebut melalui bukti yang dapat dihitung, bukan sekadar dugaan terhadap model.
Dengan Python dan notebook, peserta akan menyiapkan data, mengidentifikasi kelompok sensitif, membandingkan distribusi data, serta menghitung metrik audit seperti selection rate, true positive rate, false positive rate, dan perbedaan kinerja antarkelompok. Setiap hasil akan dibaca dalam konteks keputusan engineering: metrik apa yang relevan, asumsi apa yang digunakan, dan kapan suatu perbedaan belum cukup untuk menyimpulkan adanya bias.
Proyek akhir berupa notebook audit yang mendokumentasikan kualitas data, hasil prediksi, perbandingan metrik, visualisasi, dan rekomendasi tindak lanjut. Kursus ini menekankan batasan analisis: audit statistik tidak otomatis membuktikan sebab diskriminasi, dan perbaikan pada satu metrik keadilan dapat memengaruhi metrik atau tujuan bisnis lainnya.
Bangun pipeline Python untuk menemukan aspek produk dan mengukur sentimen dari ulasan berbahasa Indonesia.
Bangun pipeline ekstraksi entitas dan relasi dari teks Bahasa Indonesia, lalu evaluasi hasilnya sebagai knowledge graph yang terukur.
Bangun alur Python untuk mengekstrak tabel dari PDF operasional, memvalidasi hasilnya, lalu menyimpannya sebagai CSV siap analisis.
Bangun pipeline synthetic data tabular yang dapat diuji dari sisi privasi, kualitas statistik, dan dampaknya terhadap performa model.