CODEA | Koding dan Kecerdasan ArtificialSemester 1Pertemuan 5 · 1 Pertemuan × 4 JP (180 menit)

Eksplorasi Data dengan Pandas

Menganalisis dataset menggunakan Pandas — head, info, describe, identifikasi outlier

#csv#pandas#data exploration#outlier#eda

Eksplorasi Data dengan Pandas

AspekDetail
Identitas SekolahSMK ... (disesuaikan)
Mata PelajaranCODEA — Koding dan Kecerdasan Artificial
Kelas/FaseXI / F
Semester1 (Gasal)
Tahun Pelajaran2026/2027
Pertemuan ke-5
Alokasi Waktu1 Pertemuan × 4 JP (180 menit)
Materi PokokEksplorasi Data dengan Pandas (head, info, describe), Identifikasi Outlier, GIGO Principle
Model PembelajaranPraktikum Langsung, Problem Based Learning, Discovery Learning
MetodePraktik Coding, Analisis Data, Diskusi Kasus
Sarana & PrasaranaKomputer/Laptop, koneksi internet, Google Colab, file CSV dataset
Target Peserta DidikReguler
Jumlah Peserta Didik32–36 orang

Alur Kegiatan Keseluruhan

TahapAktivitasWaktu
PendahuluanOrientasi, apersepsi, motivasi15 menit
Inti — Load CSVUpload dan load CSV ke Colab, head(), info(), describe()50 menit
Inti — EksplorasiAnalisis statistik, cari outlier suhu & nilai, filter & simpan (P8 = pengayaan opsional)70 menit
Inti — DiskusiGarbage In Garbage Out dalam pengolahan data40 menit
PenutupRangkuman, refleksi, tugas10 menit

Capaian Pembelajaran (CP)

Pada akhir fase F, peserta didik mampu memuat (load) dataset CSV ke dalam Google Colab, mengeksplorasi data menggunakan fungsi-fungsi dasar Pandas (head, info, describe), mengidentifikasi outlier dalam dataset, serta memahami prinsip Garbage In Garbage Out (GIGO) dalam konteks pengolahan data.

Tujuan Pembelajaran (TP)

  1. Memuat file CSV ke dalam Google Colab menggunakan Pandas
  2. Menggunakan fungsi head(), info(), dan describe() untuk mengeksplorasi dataset
  3. Menganalisis statistik deskriptif dari dataset (mean, min, max)
  4. Mengidentifikasi data kosong (missing values) dalam dataset
  5. Memfilter data berdasarkan kondisi tertentu
  6. Menyimpan hasil eksplorasi data ke file CSV baru

Kriteria Ketercapaian Tujuan Pembelajaran (KKTP)

NoKriteriaIndikator
1PraktikPeserta didik berhasil load CSV dan menjalankan head(), info(), describe() tanpa error
2AnalitisPeserta didik mampu mengidentifikasi minimal 2 outlier dalam dataset
3KonseptualPeserta didik mampu menjelaskan prinsip GIGO dengan contoh sehari-hari
4KomunikatifPeserta didik mampu menyajikan hasil eksplorasi data secara lisan/tulisan

Profil Lulusan

DimensiElemenIndikator
Beriman, Bertakwa kepada Tuhan YME, dan Berakhlak MuliaAkhlak beragamaBersyukur atas kemajuan dalam belajar dan tidak mudah menyerah saat menghadapi error
Bernalar KritisMemperoleh dan memproses informasiMenganalisis penyebab outlier dan dampaknya pada pengambilan keputusan
KreatifMenghasilkan gagasan yang orisinalMenemukan insight/wawasan unik dari data yang dieksplorasi
Gotong RoyongKolaborasiBerdiskusi dalam kelompok tentang temuan outlier dan interpretasinya
MandiriRegulasi diriMengeksplorasi dataset secara mandiri setelah diberikan panduan dasar
Bergotong RoyongKerja sama timMembantu teman yang mengalami kesulitan saat eksplorasi data
Berakhlak MuliaIntegritasMenulis kode sendiri dan tidak menyalin hasil orang lain

Materi Pembelajaran

Pertemuan 5: Eksplorasi Data dengan Pandas

  1. Mengapa Eksplorasi Data Penting?

    • Eksplorasi Data (Exploratory Data Analysis / EDA) adalah langkah pertama sebelum ML
    • Tujuan: memahami struktur data, distribusi, outlier, missing values
    • Analogi: seperti seorang detektif yang memeriksa bukti-bukti sebelum menyimpulkan kasus — cek keaslian, cari keanehan, pahami pola
  2. Fungsi-Fungsi Penting Pandas untuk EDA

    FungsiKegunaan
    df.head(n)Melihat n baris pertama data
    df.tail(n)Melihat n baris terakhir data
    df.info()Informasi tipe data, jumlah non-null, memory usage
    df.describe()Statistik deskriptif (count, mean, std, min, 25%, 50%, 75%, max)
    df.shapeJumlah baris dan kolom
    df.columnsDaftar nama kolom
    df.isnull().sum()Jumlah missing values per kolom
    df['kolom'].value_counts()Frekuensi nilai unik (untuk data kategorikal)
    df['kolom'].hist()Histogram distribusi data
  3. Outlier dalam Data Sehari-hari

    Outlier adalah data yang berbeda secara signifikan dari data lainnya. Contoh dalam kehidupan sehari-hari:

    DatasetNilai NormalOutlier
    Suhu udara (°C)22–35°C (Indonesia)> 40°C atau < 15°C
    Nilai ujian (0–100)50–90> 100 (salah entry) atau < 10
    Harga makanan (ribu)5–100> 500 (salah input)
    Curah hujan (mm)0–50> 200 (ekstrem)
    Berat badan (kg)40–100> 200 atau < 20

    Penyebab Outlier:

    • Kesalahan entry data (human error)
    • Sensor rusak (alat ukur tidak akurat)
    • Kondisi ekstrem yang memang valid (suhu 45°C saat gelombang panas)
    • Responden tidak jujur (data survey bohong)
  4. Prinsip Garbage In, Garbage Out (GIGO)

    • Jika data yang dimasukkan ke model/sistem berkualitas buruk, outputnya juga buruk
    • Contoh umum:
      • Salah entry: Nilai siswa 1000 padahal maksimal 100 → analisis rata-rata kelas kacau
      • Sensor rusak: Sensor cuaca rusak (laporan suhu 50°C terus) → keputusan salah (sekolah diliburkan padahal cuaca normal)
      • Survey bohong: Responden mengisi data asal-asalan → kesimpulan riset tidak akurat
      • Missing data: Data absensi siswa banyak yang kosong → laporan kehadiran tidak valid