AI & Data Science

Membangun Sistem Pencocokan dan Deteksi Duplikasi Data Pelanggan dengan Python

Bangun alat Python untuk membersihkan, mencocokkan, dan mendeteksi duplikasi data pelanggan dari berkas CSV.

Diperbarui 28 Agu 2026id5 bagian · 20 pelajaran4 jam 30 menit
Belum ada ulasan
Level Beginner
Kategori AI & Data Science
Perkiraan Durasi 4 jam 30 menit

Skill yang dibangun

Apa yang akan Anda pelajari

Membaca dan memeriksa struktur data pelanggan dari berkas CSV menggunakan Python dan pandas, termasuk nilai kosong, tipe data, serta kolom yang tidak konsisten.

Menormalisasi nama, email, nomor telepon, dan alamat dengan aturan yang dapat diuji serta membandingkan hasil sebelum dan sesudah pembersihan.

Membuat pencocokan pasti dan fuzzy berdasarkan beberapa kolom, kemudian menetapkan ambang keputusan untuk membedakan cocok, perlu ditinjau, dan tidak cocok.

Memvalidasi hasil deteksi duplikasi dengan contoh positif dan negatif, membaca kasus salah cocok, serta mengekspor hasil pencocokan dan data gabungan ke CSV.

Siapa Target Audiens Kursus Ini

Pemula yang sudah memahami dasar Python seperti variabel, fungsi, list, dictionary, serta operasi file sederhana; analis data awal, staf operasional, atau mahasiswa yang sering bekerja dengan spreadsheet dan CSV; dan programmer pemula yang ingin memahami penerapan AI sederhana untuk membersihkan serta menggabungkan data nyata. Peserta tidak perlu memiliki latar belakang machine learning, tetapi diharapkan mampu mengikuti contoh kode dan memahami konsep dasar tabel, kolom, serta baris data.

Project outcomes

Apa yang Akan Anda Buat

Peserta akan membangun skrip Python yang membaca dua atau lebih berkas CSV pelanggan, membersihkan nilai penting, mencari pasangan baris yang kemungkinan merujuk pada pelanggan yang sama, dan memberi label berdasarkan aturan pencocokan. Sistem menghasilkan laporan kandidat duplikat beserta skor atau alasan pencocokan, serta berkas data gabungan yang dapat ditinjau sebelum digunakan lebih lanjut.

Konten Kursus

Mendefinisikan Masalah dan Menyiapkan Data Pelanggan

4 pelajaran | 135 menit
Mengapa Satu Pelanggan Bisa Muncul sebagai Banyak Baris
25 menit
Membaca CSV dan Memeriksa Bentuk Data
35 menit
Mencari Duplikasi yang Terlihat Jelas
35 menit
Membuat Dataset Uji yang Mewakili Kasus Nyata
40 menit

Normalisasi: Membuat Nilai yang Setara Menjadi Konsisten

4 pelajaran | 160 menit
Merancang Fungsi Pembersihan yang Dapat Diaudit
35 menit
Menyeragamkan Nama, Email, dan Nomor Telepon
45 menit
Membentuk Kolom Kunci Tanpa Merusak Data Asli
40 menit
Menguji Dampak Normalisasi pada False Match
40 menit

Pencocokan Bertahap dengan Aturan yang Dapat Dijelaskan

4 pelajaran | 180 menit
Menentukan Kapan Exact Match Cukup
40 menit
Mengurangi Perbandingan dengan Blocking
45 menit
Mengukur Kemiripan Teks dengan Levenshtein dan RapidFuzz
45 menit
Menggabungkan Bukti Menjadi Skor dan Status
50 menit

Menghasilkan Keputusan yang Aman dan Dapat Dipertanggungjawabkan

4 pelajaran | 185 menit
Memisahkan Match Otomatis dari Kasus Review
40 menit
Menggabungkan Record dengan Aturan Konflik
50 menit
Menguji Pipeline dan Membaca Hasil yang Janggal
50 menit
Menyusun Laporan Audit dan Antarmuka Command Line
45 menit

Proyek Akhir: Membangun Sistem Pencocokan Pelanggan

4 pelajaran | 300 menit
Perancangan Spesifikasi dan Setup Proyek
60 menit
Implementasi Pipeline Normalisasi dan Kandidat Match
75 menit
Integrasi Skor, Penggabungan, dan Laporan Audit
90 menit
Pengujian, Evaluasi, dan Presentasi Hasil
75 menit

Deskripsi Kursus

Data pelanggan dari spreadsheet atau sistem berbeda sering memiliki perbedaan penulisan: nama mengandung variasi spasi, nomor telepon memakai format berbeda, atau alamat tidak tercatat secara konsisten. Akibatnya, satu pelanggan dapat muncul sebagai beberapa baris dan proses pelaporan maupun penggabungan data menjadi tidak akurat. Kursus ini mengajak kita menyelesaikan masalah tersebut dengan pendekatan yang dapat diperiksa, bukan sekadar mencocokkan teks secara membabi buta.

Peserta akan menggunakan Python dan pandas untuk membaca data CSV, melakukan standardisasi nilai, mengenali pasangan data yang mungkin merujuk pada pelanggan yang sama, lalu mengukur kemiripan berdasarkan beberapa kolom. Kita akan membedakan pencocokan pasti dan pencocokan fuzzy, menetapkan aturan keputusan, serta memeriksa contoh salah cocok dan data yang belum dapat dipastikan. Konsep machine learning tidak diperlukan; fokusnya adalah logika pencocokan, heuristik, dan validasi hasil.

Di akhir kursus, peserta membangun alur kerja sederhana yang menghasilkan daftar pasangan duplikat, skor atau alasan pencocokan, serta data pelanggan yang telah digabungkan secara lebih konsisten. Batasan pendekatan juga dibahas agar hasil tidak dianggap benar hanya karena sistem memberikan skor tinggi. Contoh dapat dijalankan pada data CSV latihan dan diadaptasi untuk kebutuhan operasional skala kecil.

Rating & Ulasan

0 ratings