Berapa Banyak Data yang Dibutuhkan Untuk Membuat Proyek Machine Learning Sederhana?

Machine learning sering dianggap membutuhkan data dalam jumlah sangat besar. Padahal, untuk membuat proyek machine learning sederhana, jumlah data yang dibutuhkan tidak selalu harus mencapai jutaan baris. Kebutuhannya bergantung pada jenis proyek, metode yang digunakan, jumlah fitur, serta tingkat ketelitian yang ingin dicapai.

Untuk proyek pemula, ratusan hingga beberapa ribu data sudah dapat menjadi titik awal yang cukup untuk melakukan eksperimen. Misalnya, proyek untuk memprediksi kategori sederhana dapat dimulai dari sekitar 500–1.000 data yang memiliki informasi lengkap. Namun, angka tersebut bukan aturan mutlak karena setiap kasus memiliki karakteristik berbeda.

Apakah 100 Data Sudah Cukup untuk Machine Learning?

Jawabannya bisa cukup untuk latihan, tetapi belum tentu cukup untuk menghasilkan model yang dapat diandalkan. Jumlah data yang sedikit membuat model lebih sulit mengenali pola yang beragam.

Bayangkan ingin membuat model yang membedakan foto kucing dan anjing. Jika hanya tersedia 100 gambar, model mungkin dapat belajar pola dasar. Namun, ketika diberikan foto dengan kondisi pencahayaan, posisi, atau jenis hewan yang berbeda, hasilnya bisa kurang akurat.

Karena itu, jumlah data sebaiknya disesuaikan dengan tujuan proyek:

  • 100–500 data: cocok untuk latihan konsep dan eksperimen awal.
  • 500–5.000 data: dapat digunakan untuk proyek sederhana dengan pola yang relatif jelas.
  • Lebih dari 5.000 data: dapat membantu ketika variasi data semakin banyak dan model membutuhkan pembelajaran yang lebih luas.

Angka tersebut merupakan gambaran umum, bukan batas resmi. Kualitas data tetap menjadi faktor yang sangat menentukan.

Ma’soem University dan Pembelajaran Sistem Informasi

Bagi mahasiswa yang ingin memahami machine learning dari dasar, Ma’soem University menyediakan program studi S1 Sistem Informasi yang dapat menjadi tempat untuk mempelajari berbagai konsep teknologi informasi, termasuk pengolahan data, sistem informasi, pemrograman, hingga penerapan teknologi untuk menyelesaikan permasalahan. Pembelajaran di bidang ini dapat membantu mahasiswa memahami bagaimana data dikumpulkan, dikelola, dianalisis, kemudian dimanfaatkan untuk menghasilkan informasi yang mendukung pengambilan keputusan.

Mengapa Jumlah Data Tidak Bisa Ditentukan Sembarangan?

Kesalahan yang cukup sering dilakukan pemula adalah menganggap semakin banyak data pasti semakin baik. Faktanya, data yang banyak tetapi berantakan belum tentu lebih berguna daripada data yang lebih sedikit tetapi berkualitas.

Contohnya, seseorang ingin membuat model untuk memprediksi harga rumah. Jika terdapat 5.000 data, tetapi sebagian besar tidak memiliki informasi luas bangunan, lokasi, atau jumlah kamar, model akan kesulitan menemukan hubungan antardata.

Setidaknya, perhatikan beberapa hal berikut:

  • Data harus relevan dengan tujuan proyek.
  • Format data sebaiknya konsisten.
  • Data kosong perlu diperiksa dan ditangani.
  • Data yang sama atau duplikat perlu diidentifikasi.
  • Setiap kategori harus memiliki jumlah data yang cukup.

Jadi, sebelum sibuk mencari ribuan data, lebih baik pastikan terlebih dahulu apakah data yang tersedia memang layak digunakan.

Masalah Pemula: Data Sedikit, Bingung Harus Mulai dari Mana

Tidak sedikit pemula yang baru belajar machine learning langsung merasa terhambat ketika mendengar istilah dataset, training, testing, fitur, dan model. Akhirnya, proses belajar berhenti bahkan sebelum proyek pertama selesai.

Masalah lainnya adalah terlalu fokus mencari dataset berukuran besar. Padahal, untuk belajar konsep dasar, dataset sederhana justru bisa membuat proses lebih mudah dipahami.

Misalnya, daripada langsung membuat sistem yang menganalisis jutaan transaksi, pemula dapat mencoba proyek seperti:

  1. Memprediksi harga berdasarkan beberapa karakteristik.
  2. Mengelompokkan data berdasarkan kategori tertentu.
  3. Memprediksi apakah suatu data termasuk kelompok A atau B.
  4. Menganalisis pola sederhana dari data penjualan.

Dengan proyek yang lebih kecil, proses mulai dari memasukkan data hingga mengevaluasi hasil model menjadi lebih mudah diamati.

Berapa Banyak Data yang Ideal untuk Proyek Pertama?

Tidak ada satu angka yang berlaku untuk semua proyek. Namun, pemula dapat menggunakan sekitar 500–1.000 data sebagai target awal ketika ingin membuat proyek machine learning sederhana.

Misalnya tersedia 1.000 baris data. Data tersebut dapat dibagi menjadi data untuk melatih model dan data untuk menguji kemampuan model. Pembagian ini membantu mengetahui apakah model hanya menghafal data latihan atau benar-benar mampu mengenali pola pada data yang belum pernah dilihat.

Jika hasilnya belum baik, jangan langsung menyimpulkan bahwa jumlah datanya kurang. Periksa juga:

  • Apakah fitur yang digunakan sudah relevan?
  • Apakah terdapat data yang tidak konsisten?
  • Apakah pembagian data sudah tepat?
  • Apakah metode machine learning sesuai dengan masalah?
  • Apakah data terlalu tidak seimbang?

Untuk mendapatkan pemahaman yang lebih terarah mengenai pengolahan data, pemrograman, dan sistem informasi, mahasiswa dapat mempelajarinya secara bertahap di lingkungan akademik seperti Ma’soem University.

Informasi lebih lanjut: Admin Univ Ma’soem +62 851 8563 4253.

Solusinya Bukan Sekadar Menambah Dataset

Ketika model menghasilkan prediksi yang kurang baik, solusi pertama tidak selalu menambahkan data sebanyak-banyaknya. Pemula perlu melihat masalahnya terlebih dahulu. Jika datanya berantakan, lakukan pembersihan. Jika kategorinya tidak seimbang, cari strategi untuk menanganinya. Jika fiturnya kurang relevan, evaluasi kembali informasi yang digunakan. Setelah itu, barulah pertimbangkan menambah jumlah data.

Inilah alasan belajar machine learning tidak cukup hanya memahami cara menjalankan kode. Mahasiswa juga perlu memahami bagaimana data bekerja dan mengapa suatu model menghasilkan keluaran tertentu.

Data Sedikit Bisa Menjadi Awal yang Menarik

Proyek machine learning pertama tidak harus langsung besar dan rumit. Dataset sederhana dengan beberapa ratus data pun dapat menjadi latihan yang menarik untuk memahami bagaimana komputer mengenali pola.

Yang paling penting adalah memulai dari masalah yang jelas, menggunakan data yang relevan, kemudian menguji hasilnya secara bertahap. Setelah memahami alurnya, jumlah dan kompleksitas data dapat ditingkatkan sesuai kebutuhan proyek.

Dengan cara tersebut, machine learning tidak lagi terlihat seperti sesuatu yang hanya bisa dilakukan dengan dataset jutaan baris. Justru dari proyek kecil, pemula dapat memahami prosesnya sedikit demi sedikit hingga siap mengerjakan proyek yang lebih kompleks.