Analisis Sentimen Berbasis Aspek untuk Ulasan Produk Bahasa Indonesia dengan Python
Bangun pipeline Python untuk menemukan aspek produk dan mengukur sentimen dari ulasan berbahasa Indonesia.
Bangun alat Python untuk membersihkan, mencocokkan, dan mendeteksi duplikasi data pelanggan dari berkas CSV.
Skill yang dibangun
Membaca dan memeriksa struktur data pelanggan dari berkas CSV menggunakan Python dan pandas, termasuk nilai kosong, tipe data, serta kolom yang tidak konsisten.
Menormalisasi nama, email, nomor telepon, dan alamat dengan aturan yang dapat diuji serta membandingkan hasil sebelum dan sesudah pembersihan.
Membuat pencocokan pasti dan fuzzy berdasarkan beberapa kolom, kemudian menetapkan ambang keputusan untuk membedakan cocok, perlu ditinjau, dan tidak cocok.
Memvalidasi hasil deteksi duplikasi dengan contoh positif dan negatif, membaca kasus salah cocok, serta mengekspor hasil pencocokan dan data gabungan ke CSV.
Pemula yang sudah memahami dasar Python seperti variabel, fungsi, list, dictionary, serta operasi file sederhana; analis data awal, staf operasional, atau mahasiswa yang sering bekerja dengan spreadsheet dan CSV; dan programmer pemula yang ingin memahami penerapan AI sederhana untuk membersihkan serta menggabungkan data nyata. Peserta tidak perlu memiliki latar belakang machine learning, tetapi diharapkan mampu mengikuti contoh kode dan memahami konsep dasar tabel, kolom, serta baris data.
Project outcomes
Peserta akan membangun skrip Python yang membaca dua atau lebih berkas CSV pelanggan, membersihkan nilai penting, mencari pasangan baris yang kemungkinan merujuk pada pelanggan yang sama, dan memberi label berdasarkan aturan pencocokan. Sistem menghasilkan laporan kandidat duplikat beserta skor atau alasan pencocokan, serta berkas data gabungan yang dapat ditinjau sebelum digunakan lebih lanjut.
Data pelanggan dari spreadsheet atau sistem berbeda sering memiliki perbedaan penulisan: nama mengandung variasi spasi, nomor telepon memakai format berbeda, atau alamat tidak tercatat secara konsisten. Akibatnya, satu pelanggan dapat muncul sebagai beberapa baris dan proses pelaporan maupun penggabungan data menjadi tidak akurat. Kursus ini mengajak kita menyelesaikan masalah tersebut dengan pendekatan yang dapat diperiksa, bukan sekadar mencocokkan teks secara membabi buta.
Peserta akan menggunakan Python dan pandas untuk membaca data CSV, melakukan standardisasi nilai, mengenali pasangan data yang mungkin merujuk pada pelanggan yang sama, lalu mengukur kemiripan berdasarkan beberapa kolom. Kita akan membedakan pencocokan pasti dan pencocokan fuzzy, menetapkan aturan keputusan, serta memeriksa contoh salah cocok dan data yang belum dapat dipastikan. Konsep machine learning tidak diperlukan; fokusnya adalah logika pencocokan, heuristik, dan validasi hasil.
Di akhir kursus, peserta membangun alur kerja sederhana yang menghasilkan daftar pasangan duplikat, skor atau alasan pencocokan, serta data pelanggan yang telah digabungkan secara lebih konsisten. Batasan pendekatan juga dibahas agar hasil tidak dianggap benar hanya karena sistem memberikan skor tinggi. Contoh dapat dijalankan pada data CSV latihan dan diadaptasi untuk kebutuhan operasional skala kecil.
Bangun pipeline Python untuk menemukan aspek produk dan mengukur sentimen dari ulasan berbahasa Indonesia.
Bangun pipeline ekstraksi entitas dan relasi dari teks Bahasa Indonesia, lalu evaluasi hasilnya sebagai knowledge graph yang terukur.
Bangun alur Python untuk mengekstrak tabel dari PDF operasional, memvalidasi hasilnya, lalu menyimpannya sebagai CSV siap analisis.
Bangun pipeline synthetic data tabular yang dapat diuji dari sisi privasi, kualitas statistik, dan dampaknya terhadap performa model.