CODEA | Koding dan Kecerdasan ArtificialSemester 1Pertemuan 5 · 1 Pertemuan × 4 JP (180 menit)
Eksplorasi Data dengan Pandas
Menganalisis dataset menggunakan Pandas — head, info, describe, identifikasi outlier
#csv#pandas#data exploration#outlier#eda
Eksplorasi Data dengan Pandas
| Aspek | Detail |
|---|---|
| Identitas Sekolah | SMK ... (disesuaikan) |
| Mata Pelajaran | CODEA — Koding dan Kecerdasan Artificial |
| Kelas/Fase | XI / F |
| Semester | 1 (Gasal) |
| Tahun Pelajaran | 2026/2027 |
| Pertemuan ke- | 5 |
| Alokasi Waktu | 1 Pertemuan × 4 JP (180 menit) |
| Materi Pokok | Eksplorasi Data dengan Pandas (head, info, describe), Identifikasi Outlier, GIGO Principle |
| Model Pembelajaran | Praktikum Langsung, Problem Based Learning, Discovery Learning |
| Metode | Praktik Coding, Analisis Data, Diskusi Kasus |
| Sarana & Prasarana | Komputer/Laptop, koneksi internet, Google Colab, file CSV dataset |
| Target Peserta Didik | Reguler |
| Jumlah Peserta Didik | 32–36 orang |
Alur Kegiatan Keseluruhan
| Tahap | Aktivitas | Waktu |
|---|---|---|
| Pendahuluan | Orientasi, apersepsi, motivasi | 15 menit |
| Inti — Load CSV | Upload dan load CSV ke Colab, head(), info(), describe() | 50 menit |
| Inti — Eksplorasi | Analisis statistik, cari outlier suhu & nilai, filter & simpan (P8 = pengayaan opsional) | 70 menit |
| Inti — Diskusi | Garbage In Garbage Out dalam pengolahan data | 40 menit |
| Penutup | Rangkuman, refleksi, tugas | 10 menit |
Capaian Pembelajaran (CP)
Pada akhir fase F, peserta didik mampu memuat (load) dataset CSV ke dalam Google Colab, mengeksplorasi data menggunakan fungsi-fungsi dasar Pandas (head, info, describe), mengidentifikasi outlier dalam dataset, serta memahami prinsip Garbage In Garbage Out (GIGO) dalam konteks pengolahan data.
Tujuan Pembelajaran (TP)
- Memuat file CSV ke dalam Google Colab menggunakan Pandas
- Menggunakan fungsi
head(),info(), dandescribe()untuk mengeksplorasi dataset - Menganalisis statistik deskriptif dari dataset (mean, min, max)
- Mengidentifikasi data kosong (missing values) dalam dataset
- Memfilter data berdasarkan kondisi tertentu
- Menyimpan hasil eksplorasi data ke file CSV baru
Kriteria Ketercapaian Tujuan Pembelajaran (KKTP)
| No | Kriteria | Indikator |
|---|---|---|
| 1 | Praktik | Peserta didik berhasil load CSV dan menjalankan head(), info(), describe() tanpa error |
| 2 | Analitis | Peserta didik mampu mengidentifikasi minimal 2 outlier dalam dataset |
| 3 | Konseptual | Peserta didik mampu menjelaskan prinsip GIGO dengan contoh sehari-hari |
| 4 | Komunikatif | Peserta didik mampu menyajikan hasil eksplorasi data secara lisan/tulisan |
Profil Lulusan
| Dimensi | Elemen | Indikator |
|---|---|---|
| Beriman, Bertakwa kepada Tuhan YME, dan Berakhlak Mulia | Akhlak beragama | Bersyukur atas kemajuan dalam belajar dan tidak mudah menyerah saat menghadapi error |
| Bernalar Kritis | Memperoleh dan memproses informasi | Menganalisis penyebab outlier dan dampaknya pada pengambilan keputusan |
| Kreatif | Menghasilkan gagasan yang orisinal | Menemukan insight/wawasan unik dari data yang dieksplorasi |
| Gotong Royong | Kolaborasi | Berdiskusi dalam kelompok tentang temuan outlier dan interpretasinya |
| Mandiri | Regulasi diri | Mengeksplorasi dataset secara mandiri setelah diberikan panduan dasar |
| Bergotong Royong | Kerja sama tim | Membantu teman yang mengalami kesulitan saat eksplorasi data |
| Berakhlak Mulia | Integritas | Menulis kode sendiri dan tidak menyalin hasil orang lain |
Materi Pembelajaran
Pertemuan 5: Eksplorasi Data dengan Pandas
-
Mengapa Eksplorasi Data Penting?
- Eksplorasi Data (Exploratory Data Analysis / EDA) adalah langkah pertama sebelum ML
- Tujuan: memahami struktur data, distribusi, outlier, missing values
- Analogi: seperti seorang detektif yang memeriksa bukti-bukti sebelum menyimpulkan kasus — cek keaslian, cari keanehan, pahami pola
-
Fungsi-Fungsi Penting Pandas untuk EDA
Fungsi Kegunaan df.head(n)Melihat n baris pertama data df.tail(n)Melihat n baris terakhir data df.info()Informasi tipe data, jumlah non-null, memory usage df.describe()Statistik deskriptif (count, mean, std, min, 25%, 50%, 75%, max) df.shapeJumlah baris dan kolom df.columnsDaftar nama kolom df.isnull().sum()Jumlah missing values per kolom df['kolom'].value_counts()Frekuensi nilai unik (untuk data kategorikal) df['kolom'].hist()Histogram distribusi data -
Outlier dalam Data Sehari-hari
Outlier adalah data yang berbeda secara signifikan dari data lainnya. Contoh dalam kehidupan sehari-hari:
Dataset Nilai Normal Outlier Suhu udara (°C) 22–35°C (Indonesia) > 40°C atau < 15°C Nilai ujian (0–100) 50–90 > 100 (salah entry) atau < 10 Harga makanan (ribu) 5–100 > 500 (salah input) Curah hujan (mm) 0–50 > 200 (ekstrem) Berat badan (kg) 40–100 > 200 atau < 20 Penyebab Outlier:
- Kesalahan entry data (human error)
- Sensor rusak (alat ukur tidak akurat)
- Kondisi ekstrem yang memang valid (suhu 45°C saat gelombang panas)
- Responden tidak jujur (data survey bohong)
-
Prinsip Garbage In, Garbage Out (GIGO)
- Jika data yang dimasukkan ke model/sistem berkualitas buruk, outputnya juga buruk
- Contoh umum:
- Salah entry: Nilai siswa 1000 padahal maksimal 100 → analisis rata-rata kelas kacau
- Sensor rusak: Sensor cuaca rusak (laporan suhu 50°C terus) → keputusan salah (sekolah diliburkan padahal cuaca normal)
- Survey bohong: Responden mengisi data asal-asalan → kesimpulan riset tidak akurat
- Missing data: Data absensi siswa banyak yang kosong → laporan kehadiran tidak valid
Daftar Isi