Analisis Sentimen Berbasis Aspek untuk Ulasan Produk Bahasa Indonesia dengan Python
Bangun pipeline Python untuk menemukan aspek produk dan mengukur sentimen dari ulasan berbahasa Indonesia.
Bangun model Python untuk mengelompokkan transaksi pribadi dari teks deskripsi, lalu uji hasilnya dengan evaluasi yang dapat dijelaskan.
Skill yang dibangun
Menyusun dataset berlabel dari file CSV transaksi dan memeriksa masalah seperti nilai kosong, label tidak konsisten, serta distribusi kategori.
Mengubah deskripsi transaksi menjadi fitur teks menggunakan pendekatan bag-of-words atau TF-IDF, lalu menjelaskan pengaruh representasi tersebut terhadap prediksi.
Melatih model klasifikasi sederhana dengan pipeline scikit-learn, memisahkan data latih dan data uji, serta menghasilkan kategori untuk transaksi baru.
Mengukur dan menafsirkan accuracy, precision, recall, confusion matrix, serta menelusuri contoh prediksi keliru untuk menentukan perbaikan berikutnya.
Pemula yang sudah memiliki dasar Python seperti variabel, fungsi, list, membaca file CSV, dan penggunaan notebook, tetapi belum memahami alur kerja machine learning dari data mentah hingga evaluasi model. Kursus ini cocok bagi mahasiswa, pekerja nonteknis yang ingin memahami otomasi analisis transaksi, atau programmer awal yang membutuhkan proyek AI yang konkret dan dapat dijelaskan. Peserta tidak dituntut memiliki latar belakang matematika tingkat lanjut maupun pengalaman menggunakan framework machine learning.
Project outcomes
Sebuah aplikasi kecil berbasis Python atau notebook yang membaca data transaksi berlabel dari CSV, melatih model pengelompokan teks, menampilkan metrik evaluasi, dan memprediksi kategori untuk deskripsi transaksi baru seperti makanan, transportasi, belanja, atau tagihan. Struktur proyek dibuat cukup sederhana untuk diperiksa, diubah, dan dikembangkan dengan data milik sendiri.
Deskripsi transaksi seperti "makan siang", "isi bensin", atau "tagihan internet" mengandung petunjuk, tetapi belum berbentuk kategori yang siap dianalisis. Kursus ini mengajak kita mengubah data transaksi mentah menjadi dataset berlabel, merepresentasikan teks sebagai fitur, melatih model klasifikasi sederhana, dan memeriksa apakah prediksinya layak digunakan.
Dengan Python dan scikit-learn, peserta mengikuti alur machine learning dari awal hingga evaluasi: membaca serta membersihkan CSV, memisahkan data latih dan uji, membangun pipeline pemrosesan teks, dan membandingkan label prediksi dengan kategori yang benar. Setiap langkah dikaitkan dengan asumsi dan perilaku yang dapat diamati, termasuk penyebab data bocor, kategori yang sulit dibedakan, serta dampak kualitas label terhadap model.
Proyek akhirnya menghasilkan notebook atau skrip yang menerima deskripsi transaksi baru dan mengusulkan kategori pengeluaran. Hasil tersebut bukan pengganti pemeriksaan manusia secara otomatis; peserta juga belajar membaca confusion matrix, meninjau prediksi keliru, dan mengenali kondisi ketika model perlu diperbaiki atau tidak sebaiknya digunakan.
Bangun pipeline Python untuk menemukan aspek produk dan mengukur sentimen dari ulasan berbahasa Indonesia.
Bangun pipeline ekstraksi entitas dan relasi dari teks Bahasa Indonesia, lalu evaluasi hasilnya sebagai knowledge graph yang terukur.
Bangun alur Python untuk mengekstrak tabel dari PDF operasional, memvalidasi hasilnya, lalu menyimpannya sebagai CSV siap analisis.
Bangun pipeline synthetic data tabular yang dapat diuji dari sisi privasi, kualitas statistik, dan dampaknya terhadap performa model.