Analisis Sentimen Berbasis Aspek untuk Ulasan Produk Bahasa Indonesia dengan Python
Bangun pipeline Python untuk menemukan aspek produk dan mengukur sentimen dari ulasan berbahasa Indonesia.
Bangun model Python untuk memprediksi keterlambatan pengiriman, membersihkan data, mengukur kinerja, dan menerjemahkan hasilnya menjadi keputusan operasional.
Skill yang dibangun
Merumuskan target klasifikasi keterlambatan dari data pengiriman dan mengidentifikasi informasi yang boleh digunakan saat prediksi dibuat.
Memuat, memeriksa, dan membersihkan data tabular dengan pandas, termasuk menangani nilai hilang, tipe data, duplikasi, dan kategori yang tidak konsisten.
Membangun pipeline scikit-learn yang mengolah fitur numerik serta kategorikal, membagi data latih dan uji, lalu melatih model klasifikasi dasar tanpa kebocoran data.
Menghitung dan menafsirkan accuracy, precision, recall, F1-score, serta confusion matrix untuk memilih tindakan operasional yang sesuai dengan jenis kesalahan prediksi.
Peserta yang telah memahami dasar penggunaan komputer, spreadsheet, dan sintaks Python sederhana seperti variabel, kondisi, perulangan, fungsi, serta membaca file CSV. Kursus ini ditujukan bagi pemula yang ingin memahami praktik machine learning pada data tabular secara konkret, tetapi belum terbiasa melakukan pembersihan data, evaluasi model, dan menerjemahkan hasil analisis menjadi keputusan operasional. Pengetahuan statistik tingkat sekolah menengah akan membantu, namun konsep yang diperlukan diperkenalkan secara bertahap.
Project outcomes
Peserta akan membangun notebook Python yang membaca file CSV pengiriman, menyiapkan fitur, melatih model untuk memprediksi apakah sebuah pengiriman terlambat, mengevaluasi hasil pada data uji, dan menampilkan prediksi beserta dasar interpretasinya. Proyek menggunakan dataset tabular contoh dengan kolom seperti jenis layanan, wilayah, berat paket, jarak, dan status keterlambatan; nama kolom dapat disesuaikan dengan struktur data yang tersedia.
Keterlambatan pengiriman tidak cukup ditangani dengan menebak dari satu kolom atau memilih model secara sembarangan. Kita akan mengubah data tabular pengiriman menjadi pertanyaan prediksi yang terukur: berdasarkan informasi yang tersedia sebelum pengiriman, apakah pesanan berisiko terlambat? Dari sini, setiap keputusan—membersihkan data, memilih fitur, membagi dataset, hingga menentukan metrik—dihubungkan dengan risiko kesalahan yang dapat terjadi pada operasi.
Kursus ini menggunakan Python dengan pandas dan scikit-learn untuk memuat serta memeriksa data CSV, menangani nilai yang hilang, mengolah fitur kategorikal, membagi data tanpa kebocoran informasi, dan melatih model klasifikasi dasar. Hasil model dievaluasi menggunakan metrik yang sesuai, lalu dibaca melalui confusion matrix dan contoh prediksi agar angka evaluasi tidak terlepas dari makna bisnis.
Di akhir kursus, peserta menghasilkan alur kerja prediksi yang dapat dijalankan ulang pada data serupa. Kita juga membahas batas penggunaan model, perbedaan antara performa pada data uji dan kondisi operasional, serta cara memeriksa asumsi ketika hasil terlihat terlalu baik atau tidak masuk akal.
Bangun pipeline Python untuk menemukan aspek produk dan mengukur sentimen dari ulasan berbahasa Indonesia.
Bangun pipeline ekstraksi entitas dan relasi dari teks Bahasa Indonesia, lalu evaluasi hasilnya sebagai knowledge graph yang terukur.
Bangun alur Python untuk mengekstrak tabel dari PDF operasional, memvalidasi hasilnya, lalu menyimpannya sebagai CSV siap analisis.
Bangun pipeline synthetic data tabular yang dapat diuji dari sisi privasi, kualitas statistik, dan dampaknya terhadap performa model.