Analisis Sentimen Berbasis Aspek untuk Ulasan Produk Bahasa Indonesia dengan Python
Bangun pipeline Python untuk menemukan aspek produk dan mengukur sentimen dari ulasan berbahasa Indonesia.
Rancang benchmark Bahasa Indonesia dengan label terukur, analisis kegagalan, dan eksperimen yang dapat diulang.
Skill yang dibangun
Merumuskan tujuan evaluasi, unit analisis, skema label, dan kriteria keberhasilan untuk tugas klasifikasi Bahasa Indonesia.
Membangun pipeline dataset yang mencatat sumber data, validasi skema, deduplikasi, pembagian data, dan seed agar hasil dapat direproduksi.
Menilai konsistensi label serta membandingkan metrik agregat dan metrik per kelompok untuk menemukan bias atau celah cakupan benchmark.
Menganalisis prediksi salah secara sistematis, mengelompokkan failure mode, dan menyusun eksperimen pembanding yang dapat memisahkan dampak data, model, dan konfigurasi.
Peserta yang sudah memahami Python, pandas, konsep dasar machine learning terawasi, pembagian data latih dan uji, serta metrik klasifikasi seperti accuracy, precision, recall, dan F1-score. Kursus ini ditujukan bagi data scientist, machine learning engineer pemula-menengah, peneliti, atau pengembang produk AI yang ingin meningkatkan kemampuan merancang dataset evaluasi, menilai kualitas label, menganalisis kegagalan model, dan membuat eksperimen model Bahasa Indonesia yang dapat direproduksi.
Project outcomes
Peserta akan membangun repositori benchmark klasifikasi teks Bahasa Indonesia yang berisi format dataset tervalidasi, konfigurasi eksperimen, skrip pembagian data dan evaluasi, laporan metrik, serta analisis kesalahan. Proyek ini dapat dijalankan ulang pada lingkungan yang sama untuk membandingkan model atau perubahan dataset secara terukur.
Evaluasi model Bahasa Indonesia sering menghasilkan angka yang sulit ditafsirkan karena dataset tidak mewakili tujuan penggunaan, label tidak konsisten, atau pembagian data memungkinkan kebocoran informasi. Kursus ini membahas cara merancang benchmark yang menghubungkan definisi tugas, kualitas anotasi, karakteristik data, dan metrik evaluasi dengan perilaku model yang dapat diamati.
Peserta akan menyusun skema data dan label, membuat pembagian data yang dapat direproduksi, memeriksa konsistensi anotasi, serta membandingkan beberapa konfigurasi model secara terkontrol. Analisis tidak berhenti pada satu skor agregat: kita akan memeriksa performa per kategori, menemukan pola kegagalan, dan menguji apakah perubahan data atau konfigurasi benar-benar menghasilkan perbaikan.
Di akhir kursus, peserta memiliki proyek benchmark yang menyimpan dataset, konfigurasi, skrip evaluasi, hasil eksperimen, dan laporan analisis. Pendekatan ini membantu membedakan perubahan yang kebetulan dari perubahan yang dapat diulang, sekaligus memperjelas batas interpretasi hasil ketika data, label, atau cakupan bahasa tidak sempurna.
Bangun pipeline Python untuk menemukan aspek produk dan mengukur sentimen dari ulasan berbahasa Indonesia.
Bangun pipeline ekstraksi entitas dan relasi dari teks Bahasa Indonesia, lalu evaluasi hasilnya sebagai knowledge graph yang terukur.
Bangun alur Python untuk mengekstrak tabel dari PDF operasional, memvalidasi hasilnya, lalu menyimpannya sebagai CSV siap analisis.
Bangun pipeline synthetic data tabular yang dapat diuji dari sisi privasi, kualitas statistik, dan dampaknya terhadap performa model.