Analisis Sentimen Berbasis Aspek untuk Ulasan Produk Bahasa Indonesia dengan Python
Bangun pipeline Python untuk menemukan aspek produk dan mengukur sentimen dari ulasan berbahasa Indonesia.
Bangun sistem deteksi fraud terdistribusi dengan PyTorch dan Flower tanpa memindahkan data mentah, lalu tambahkan differential privacy.
Skill yang dibangun
Membangun model klasifikasi fraud dengan PyTorch untuk dataset yang imbalanced serta mengevaluasinya memakai precision, recall, F1-score, dan ROC-AUC.
Mendesain alur federated learning dengan Flower, termasuk client training, server aggregation, konfigurasi round, dan pertukaran model parameters.
Menangani perbedaan distribusi data antar-client atau non-IID data serta menganalisis dampaknya terhadap performa model global.
Menerapkan differential privacy pada proses federated learning dan menjelaskan trade-off antara privacy budget, utility model, dan risiko kebocoran informasi.
Data scientist, machine learning engineer, AI engineer, backend engineer, dan peneliti yang sudah menguasai Python, konsep supervised learning, evaluasi model, PyTorch dasar, serta ingin membangun sistem machine learning terdistribusi yang menjaga privasi data.
Project outcomes
Kamu akan membangun prototype sistem deteksi fraud terdistribusi dengan beberapa client simulasi. Setiap client menyimpan dataset lokal dan melatih model PyTorch tanpa mengirim data mentah ke server. Server Flower akan mengagregasi model update menjadi global model. Di tahap akhir, pipeline dilengkapi differential privacy, evaluasi metrik fraud detection, logging eksperimen, serta analisis perbandingan antara centralized learning, federated learning biasa, dan federated learning yang diberi perlindungan privasi.
Data fraud biasanya tersebar di banyak bank, merchant, atau layanan digital. Masalahnya, data mentah tidak boleh sembarangan dikumpulkan ke satu server. Di kursus ini, kamu akan membangun solusi federated learning yang melatih model di masing-masing client, lalu hanya mengirim update model ke server agregator.
Kita mulai dari pipeline deteksi fraud dengan PyTorch, memahami pembagian data non-IID, lalu menghubungkan client dan server memakai Flower. Setelah fondasinya kuat, kamu akan menambahkan differential privacy untuk mengurangi risiko kebocoran informasi dari model update. Setiap bagian dibangun bertahap, jadi kamu tidak langsung dilempar ke konfigurasi yang bikin pusing.
Kamu juga akan belajar membaca metrik seperti precision, recall, F1-score, dan ROC-AUC dalam konteks fraud detection yang datanya imbalanced. Di akhir, kamu punya proyek yang lebih dekat dengan kebutuhan kerja nyata: sistem federated learning yang bisa diuji, dievaluasi, dan dijelaskan trade-off privasinya.
Bangun pipeline Python untuk menemukan aspek produk dan mengukur sentimen dari ulasan berbahasa Indonesia.
Bangun pipeline ekstraksi entitas dan relasi dari teks Bahasa Indonesia, lalu evaluasi hasilnya sebagai knowledge graph yang terukur.
Bangun alur Python untuk mengekstrak tabel dari PDF operasional, memvalidasi hasilnya, lalu menyimpannya sebagai CSV siap analisis.
Bangun pipeline synthetic data tabular yang dapat diuji dari sisi privasi, kualitas statistik, dan dampaknya terhadap performa model.