Analisis Sentimen Berbasis Aspek untuk Ulasan Produk Bahasa Indonesia dengan Python
Bangun pipeline Python untuk menemukan aspek produk dan mengukur sentimen dari ulasan berbahasa Indonesia.
Bangun aplikasi tanya-jawab dokumen berbasis RAG dengan Python, LlamaIndex, Qdrant, dan evaluasi groundedness.
Skill yang dibangun
Menjelaskan alur kerja RAG dan membedakan retrieval, context, generation, serta groundedness dalam aplikasi tanya-jawab dokumen.
Membangun pipeline Python dengan LlamaIndex untuk memuat, mengindeks, mengambil, dan menjawab pertanyaan dari dokumen.
Mengonfigurasi Qdrant sebagai vector database dan mendiagnosis masalah umum pada embedding, collection, chunking, serta retrieval.
Mengevaluasi groundedness jawaban dengan kriteria yang jelas dan memperbaiki pipeline berdasarkan hasil evaluasi.
Developer Python, data analyst, junior data scientist, dan praktisi bisnis yang sudah memahami dasar pemrograman serta ingin membangun aplikasi AI yang dapat menjawab pertanyaan berdasarkan kumpulan dokumen nyata secara akurat dan dapat ditelusuri.
Project outcomes
Kamu akan membangun aplikasi asisten tanya-jawab dokumen berbasis RAG. Aplikasi ini memproses kumpulan dokumen, menyimpan representasi vector di Qdrant, mengambil potongan dokumen yang relevan, lalu menghasilkan jawaban beserta sumber konteksnya. Di tahap akhir, kamu menambahkan evaluasi groundedness untuk mengecek apakah jawaban memang didukung oleh dokumen dan bukan hasil halusinasi.
Kamu akan membangun asisten AI yang bisa menjawab pertanyaan berdasarkan kumpulan dokumen nyata, bukan sekadar menebak dari pengetahuan umum model. Kita mulai dari fondasi RAG: memuat dokumen, memecah teks, membuat embedding, menyimpan vector di Qdrant, lalu mengambil konteks yang relevan saat pertanyaan masuk.
Semua langkah dibedah lewat contoh Python yang runnable dan bertahap. Kamu akan melihat alur data dari dokumen sampai jawaban, memahami peran LlamaIndex dan Qdrant, serta belajar menangani masalah yang sering bikin pusing seperti chunk yang kurang tepat, konfigurasi collection yang tidak cocok, dan hasil retrieval yang melenceng.
Bagian akhirnya fokus pada evaluasi groundedness. Kamu akan menguji apakah jawaban benar-benar didukung oleh konteks dokumen, bukan cuma terdengar meyakinkan. Ada guided practice untuk membangun fitur sedikit demi sedikit dan independent practice untuk mengembangkan aplikasi agar lebih siap dipakai di dunia kerja.
Bangun pipeline Python untuk menemukan aspek produk dan mengukur sentimen dari ulasan berbahasa Indonesia.
Bangun pipeline ekstraksi entitas dan relasi dari teks Bahasa Indonesia, lalu evaluasi hasilnya sebagai knowledge graph yang terukur.
Bangun alur Python untuk mengekstrak tabel dari PDF operasional, memvalidasi hasilnya, lalu menyimpannya sebagai CSV siap analisis.
Bangun pipeline synthetic data tabular yang dapat diuji dari sisi privasi, kualitas statistik, dan dampaknya terhadap performa model.