Bagaimana Cara Menyiapkan Data yang Berantakan Sebelum Digunakan dalam Machine Learning?

Machine learning memang dapat membantu komputer mengenali pola dan membuat prediksi, tetapi hasilnya sangat bergantung pada data yang digunakan. Bayangkan sebuah dataset berisi nama yang ditulis dengan format berbeda, kolom umur yang kosong, angka yang salah, hingga data yang tercatat berulang kali. Jika langsung digunakan, kondisi tersebut dapat membuat proses pembelajaran model menjadi kurang optimal. Karena itu, menyiapkan data yang berantakan sebelum digunakan dalam machine learning menjadi salah satu tahap penting yang perlu dipahami, terutama bagi pemula.

Kenapa Data yang Berantakan Bisa Menjadi Masalah?

Data mentah biasanya belum siap langsung digunakan. Dalam satu dataset, bisa saja terdapat informasi yang tidak lengkap, format yang tidak konsisten, atau nilai yang sebenarnya tidak masuk akal.

Contohnya, sebuah kolom umur memiliki nilai seperti:

  • 19
  • 20
  • “dua puluh”
  • kosong
  • 250

Sekilas terlihat sederhana, tetapi model machine learning dapat mengalami kesulitan ketika harus membaca format data yang berbeda-beda. Nilai 250 juga perlu diperiksa karena kemungkinan merupakan kesalahan input.

Di sinilah proses data cleaning dibutuhkan. Tujuannya bukan sekadar membuat tabel terlihat rapi, tetapi memastikan data lebih konsisten dan relevan sebelum masuk ke tahap pemodelan.

Mengenal Kondisi Data Sebelum Membersihkannya

Sebelum melakukan perubahan, jangan langsung menghapus data yang terlihat aneh. Langkah pertama adalah memahami isi dataset terlebih dahulu.

Beberapa hal yang dapat diperiksa antara lain:

  1. Jumlah baris dan kolom.
  2. Jenis data pada setiap kolom.
  3. Jumlah data kosong.
  4. Data yang memiliki nilai tidak wajar.
  5. Baris yang tercatat lebih dari satu kali.
  6. Format penulisan yang tidak konsisten.

Misalnya, kolom jenis kelamin berisi “L”, “Laki-laki”, “laki laki”, dan “Pria”. Informasinya mungkin mengarah pada kategori yang sama, tetapi formatnya berbeda. Kondisi seperti ini perlu diseragamkan agar data lebih mudah diproses.

Bagi mahasiswa yang ingin memahami cara mengelola data secara lebih mendalam, Ma’soem University menyediakan program studi S1 Sistem Informasi yang dapat menjadi pilihan untuk mempelajari pengolahan data, sistem informasi, teknologi, serta keterampilan yang berkaitan dengan kebutuhan dunia digital. Informasi mengenai program studi dan pendaftaran dapat ditanyakan kepada Admin Univ Ma’soem melalui +62 851 8563 4253.

Masalah yang Sering Ditemukan dalam Dataset

Data berantakan tidak selalu memiliki bentuk yang sama. Justru, semakin beragam sumber datanya, semakin banyak kemungkinan masalah yang perlu diperiksa.

Beberapa masalah yang umum ditemukan yaitu:

  • Missing value, yaitu adanya informasi yang kosong.
  • Duplicate data, yaitu data yang tercatat lebih dari satu kali.
  • Outlier, yaitu nilai yang jauh berbeda dari sebagian besar data.
  • Format tidak konsisten, seperti tanggal atau kategori yang ditulis dengan gaya berbeda.
  • Kesalahan input, misalnya umur 200 tahun atau harga yang memiliki satuan berbeda.

Memahami jenis masalah tersebut membantu menentukan solusi yang tepat. Tidak semua data kosong harus dihapus dan tidak semua nilai ekstrem otomatis merupakan kesalahan.

Bagaimana Cara Membersihkan Data?

Setelah kondisi dataset dipahami, proses pembersihan dapat dilakukan secara bertahap. Salah satu prinsip pentingnya adalah jangan mengubah data tanpa alasan yang jelas.

Untuk data kosong, misalnya, pilihannya dapat berupa menghapus baris tertentu, mengisi nilai berdasarkan metode statistik, atau menggunakan pendekatan lain sesuai karakteristik dataset.

Untuk data duplikat, data dapat diperiksa berdasarkan kolom tertentu sebelum menentukan apakah salah satunya perlu dihapus. Sementara itu, format yang berbeda dapat diseragamkan agar model dapat membaca informasi secara konsisten.

Jika proses ini terasa rumit, justru di sinilah kemampuan pengelolaan data perlu dilatih. Belajar di bidang Sistem Informasi dapat membantu mahasiswa memahami bagaimana data dikumpulkan, dikelola, diperiksa, hingga dimanfaatkan untuk mendukung kebutuhan sistem.

Jangan Lupa Menangani Data yang Tidak Seimbang

Ada satu persoalan yang sering luput diperhatikan, yaitu imbalanced data. Kondisi ini terjadi ketika jumlah data pada satu kategori jauh lebih banyak dibandingkan kategori lainnya.

Contohnya, sebuah dataset transaksi memiliki 9.500 transaksi normal dan hanya 500 transaksi bermasalah. Jika langsung digunakan, model bisa lebih sering mengenali kategori mayoritas dan kurang memahami kategori yang jumlahnya sedikit.

Beberapa pendekatan yang dapat dipertimbangkan adalah:

  • melakukan oversampling pada kategori minoritas,
  • melakukan undersampling pada kategori mayoritas,
  • menggunakan metode pembobotan tertentu,
  • mengevaluasi model dengan metrik yang sesuai.

Pemilihannya tetap perlu disesuaikan dengan karakteristik dataset, bukan dilakukan secara asal.

Setelah Bersih, Apakah Data Langsung Bisa Dipakai?

Belum tentu. Data yang sudah dibersihkan masih perlu dipersiapkan agar sesuai dengan kebutuhan algoritma machine learning. Tahap berikutnya dapat mencakup transformasi data, encoding kategori, normalisasi atau standardisasi, serta pemisahan data untuk training dan testing.

Misalnya, komputer tidak dapat memperlakukan kategori “Jakarta”, “Bandung”, dan “Surabaya” seperti angka biasa. Data kategori perlu diubah ke representasi yang dapat dipahami algoritma.

Artinya, membersihkan data hanyalah satu bagian dari rangkaian data preprocessing. Semakin baik seseorang memahami proses tersebut, semakin mudah pula memahami mengapa sebuah model menghasilkan prediksi tertentu.

Kunci Utamanya: Data Harus Dipahami, Bukan Sekadar Dibersihkan

Menyiapkan data yang berantakan sebelum digunakan dalam machine learning membutuhkan ketelitian. Jangan terburu-buru menghapus data hanya karena terlihat berbeda. Periksa sumber masalahnya, pahami konteks setiap kolom, kemudian tentukan metode pengolahan yang sesuai.

Bagi pemula, tantangan seperti missing value, data duplikat, outlier, hingga encoding memang dapat terasa membingungkan. Namun, kemampuan tersebut bisa dipelajari secara bertahap melalui latihan dan pemahaman dasar pengelolaan sistem serta data.

Jika ingin lebih serius mempelajari bagaimana data dikelola dan digunakan dalam sistem berbasis teknologi, masuk ke Ma’soem University melalui program studi S1 Sistem Informasi dapat menjadi salah satu jalur pembelajaran. Dengan belajar secara terarah, proses yang awalnya terlihat seperti sekadar merapikan tabel dapat dipahami sebagai bagian penting dari bagaimana sebuah sistem menghasilkan informasi yang dapat digunakan.