Beberapa aplikasi text mining awal menggunakan penyajian sederhana yang disebut dengan ‘bag-of-words' ketika mengenalkan struktur ke suatu kumpulan dokumen berbasis teks untuk mengklasifikasikan nya menjadi dua atau lebih kelas yang sudah ditentukan atau untuk meng-cluster nya menjadi pengelompokan-pengelompokan alami. [ Baca juga: Pengertian Clustering atau Analisa Cluster ]. Dalam model ‘bag-of-words’ tersebut, teks, misalnya suatu kalimat, paragraph, atau dokumen penuh, disajikan sebagai kumpulan kata, dengan mengabaikan tata bahasa atau urutan kata-kata yang akan muncul. Model ‘bag-of-words’ masih digunakan dalam beberapa tool klasifikasi dokumen yang sederhana. Contohnya, dalam memfilter spam email, suatu pesan di email bisa dimodelkan sebagai suatu kumpulan kata-kata yang tak berurutan (a bag-of-words) yang dibandingkan dengan dua ‘bags’ berbeda yang sudah ditentukan sebelumnya. Satu ‘bag’ diisi dengan kata-kata yang ditemukan di dalam pesan-pesan spam dan yang satunya d...
Belajar Gratis Seputar Sistem Informasi, Informatika, Bisnis, Akuntansi, & Manajemen