Pernah bertanya bagaimana sebuah sistem bisa mengenali apakah sebuah gambar berisi kucing atau anjing, memprediksi harga rumah, atau memperkirakan apakah pelanggan akan membeli suatu produk? Di balik kemampuan tersebut terdapat proses pelatihan machine learning. Model tidak langsung memahami pola sejak pertama kali digunakan. Model perlu diberikan data, mempelajari hubungan yang terdapat di dalamnya, kemudian diuji untuk melihat apakah pola yang dipelajari dapat digunakan pada data baru.
Semua Berawal dari Data yang Tepat
Sebelum melatih model, hal pertama yang perlu diperhatikan adalah data. Model machine learning belajar berdasarkan contoh yang diberikan. Jika data yang digunakan tidak relevan, terlalu sedikit, atau memiliki banyak kesalahan, pola yang dipelajari model juga dapat menjadi kurang tepat.
Misalnya, sebuah model ingin dilatih untuk memprediksi harga rumah. Data yang tersedia dapat berisi:
- Luas bangunan.
- Luas tanah.
- Jumlah kamar.
- Lokasi.
- Fasilitas.
- Harga jual.
Semakin relevan informasi yang tersedia, semakin banyak pola yang dapat dipelajari model. Namun, banyak data bukan berarti otomatis menghasilkan model yang bagus. Kualitas data tetap menjadi faktor penting.
Data Perlu Dibersihkan Sebelum Dipelajari
Coba bayangkan seorang siswa diminta mempelajari materi dari buku yang sebagian halamannya hilang dan memiliki banyak kesalahan informasi. Hasil belajarnya tentu bisa terganggu. Hal serupa dapat terjadi pada machine learning. Data biasanya perlu melalui proses data preprocessing sebelum digunakan. Pada tahap ini, data yang kosong, duplikat, tidak konsisten, atau memiliki format yang tidak sesuai dapat diperiksa dan diperbaiki.
Contohnya, data usia pelanggan mungkin berisi angka “20”, “21”, tetapi ada pula yang tertulis “dua puluh”. Format seperti ini perlu diseragamkan agar dapat diproses dengan baik. Tahap preprocessing dapat mencakup:
- Menghapus atau menangani data yang tidak lengkap.
- Menghilangkan data duplikat.
- Mengubah format data.
- Menangani nilai yang terlalu ekstrem.
- Melakukan normalisasi atau standardisasi jika diperlukan.
Mengenalkan Data kepada Model
Setelah data siap, langkah berikutnya adalah memberikan data kepada algoritma machine learning. Di sinilah proses training berlangsung.
Secara sederhana, model menerima data input dan mencoba menghasilkan prediksi. Hasil prediksi tersebut kemudian dibandingkan dengan jawaban yang benar. Jika terdapat kesalahan, algoritma akan melakukan penyesuaian terhadap parameter internalnya agar prediksi berikutnya menjadi lebih baik.
Proses tersebut dilakukan berulang kali. Semakin banyak proses pembelajaran yang dilakukan dengan pengaturan yang tepat, model dapat semakin memahami hubungan atau pola yang terdapat pada data.
Misalnya, dalam klasifikasi email, model dapat mempelajari bahwa kombinasi kata, struktur pesan, dan karakteristik tertentu sering muncul pada email spam. Setelah mempelajari banyak contoh, model dapat menggunakan pola tersebut ketika menerima email baru.
Jangan Langsung Percaya pada Hasil Training
Salah satu kesalahan yang sering terjadi adalah menganggap model sudah bagus hanya karena mampu memberikan hasil sangat baik pada data latihan. Padahal, model bisa saja terlalu menghafal data training dan kesulitan mengenali pola pada data baru. Kondisi ini dikenal sebagai overfitting.
Untuk menghindarinya, data biasanya dibagi menjadi beberapa bagian, misalnya data training dan data testing. Data training digunakan untuk melatih model, sedangkan data testing digunakan untuk melihat bagaimana kemampuan model ketika menghadapi data yang belum pernah dipelajari. Model yang baik bukan hanya mampu mengingat contoh lama, tetapi juga mampu menerapkan pola yang dipelajarinya pada data baru.
Ketika Model Tidak Belajar dengan Baik
Masalah lain dapat muncul ketika model justru terlalu sederhana sehingga gagal menangkap pola penting dalam data. Kondisi ini dikenal sebagai underfitting. Jadi, proses pelatihan model perlu mencari keseimbangan. Model tidak boleh terlalu “menghafal”, tetapi juga tidak boleh terlalu sederhana. Beberapa hal yang dapat dievaluasi antara lain:
- Kualitas dan jumlah data.
- Pemilihan fitur yang digunakan.
- Algoritma machine learning.
- Parameter model.
- Hasil evaluasi pada data yang belum pernah dilihat.
Jika hasilnya belum sesuai, proses dapat diperbaiki dengan menyesuaikan data, fitur, algoritma, maupun parameter model.
Belajar Machine Learning Tidak Cukup Hanya Mencoba Kode
Ma’soem University menyediakan program studi S1 Sistem Informasi yang dapat menjadi pilihan bagi calon mahasiswa yang ingin mempelajari hubungan antara teknologi, data, dan kebutuhan sistem informasi. Pembelajaran di bidang ini dapat membantu mahasiswa memahami dasar pengolahan data, sistem, pemrograman, serta pemanfaatan teknologi untuk menyelesaikan berbagai kebutuhan. Bagi yang ingin mengetahui informasi lebih lanjut mengenai program studi dan pendaftaran, dapat menghubungi Admin Univ Ma’soem di +62 851 8563 4253.
Bagaimana Mengetahui Model Sudah Cukup Baik?
Setelah training selesai, model perlu dievaluasi. Cara evaluasinya bergantung pada jenis masalah yang ingin diselesaikan. Untuk klasifikasi, misalnya, beberapa metrik yang dapat digunakan adalah accuracy, precision, recall, dan F1-score. Sementara untuk prediksi nilai numerik, metrik seperti MAE atau RMSE dapat digunakan untuk melihat seberapa jauh hasil prediksi dari nilai sebenarnya. Tidak ada satu ukuran yang selalu cocok untuk semua kasus. Pemilihan metrik perlu disesuaikan dengan tujuan model.
Dari Data Menjadi Pola yang Bisa Digunakan
Melatih model machine learning pada dasarnya merupakan proses bertahap. Data dikumpulkan dan dipersiapkan, kemudian diberikan kepada algoritma untuk dipelajari. Setelah itu, model diuji dan dievaluasi agar diketahui apakah pola yang dipelajarinya benar-benar dapat digunakan pada data baru.
Menariknya, proses ini tidak hanya membutuhkan kemampuan coding. Pemahaman mengenai data, logika, algoritma, sistem informasi, dan cara mengevaluasi hasil juga sangat diperlukan. Karena itu, bagi calon mahasiswa yang tertarik mendalami machine learning, mempelajari dasar-dasar sistem informasi secara terstruktur dapat menjadi langkah awal untuk memahami bagaimana data dapat diolah menjadi informasi dan digunakan untuk menghasilkan solusi berbasis teknologi.




