Skip to main content

Posts

Showing posts with the label Seri Text Mining dan Web Mining

Apa itu text mining

Text mining adalah proses pengambilan informasi dari teks yang berasal dari berbagai sumber, seperti dokumen, artikel, email , dan lainnya. Text mining menggunakan teknik analisis data yang digabungkan dengan teknologi komputasi untuk mengekstrak informasi yang relevan dan berguna dari teks yang besar dan tidak terstruktur. Text mining dapat digunakan untuk berbagai tujuan, seperti: Klasifikasi teks: mengelompokkan teks menjadi kategori yang sesuai Summarization : menyederhanakan teks dengan mengambil informasi yang esensial Sentiment analysis : menentukan perasaan atau opini dari teks Named entity recognition : mengekstrak entitas yang dikenal seperti nama orang, perusahaan, negara, dan lainnya Relasi: menentukan relasi antara entitas dalam teks Text mining juga digunakan dalam berbagai bidang, seperti bisnis, kesehatan, politik, dan ilmu sosial.

Kisah Sukses Web Mining - Seri Text Mining dan Web Mining (9)

Ask.com adalah salah satu search engine yang terkenal. Ask.com percaya bahwa komponen mendasar dari kesuksesannya terletak pada kemampuannya untuk memberikan secara konsisten hasil pencarian yang lebih baik. Namun, menentukan kualitas hasil pencarian adalah sesuatu yang mustahil  untuk diukur secara akurat dengan menggunakan ukuran-ukuran kuantitatif seperti click-through rate, abandonment (hasil pencarian yang tidak di-klik atau ditindklanjuti), dan frekwensi pencarian; sepertinya diperlukan ukuran-ukuran kuantitatif dan kualitatif tambahan. Dengan men-survey secara regular pengunjungnya, ask.com menggunakan kombinasi ukuran-ukuran kualitatif fan kuantitatif sebagai dasar indikator kinerja, seperti “jumlah persen pengguna yang mengatakan bahwa mereka menemukan apa yang mereka cari”, selain menggunakan survey dengan pertanyaan terbuka untuk mengevaluasi pengalaman pengguna. Dengan menyatukan data kuantitatif dan kualitatif, ask.com bisa memvalidasi perubahannya ke desain 3D mere...

Penambangan Penggunaan Web (Web Usage Mining) - Seri Text Mining dan Web Mining (8)

Penambangan penggunaan web (web usage mining) adalah proses mengekstral informasi yang berasal dari data yang dihasilkan dari kunjungan dan transaksi di halaman-halaman web. Masand (pakar web mining) mengatakan bahwa sedikitnya ada tiga jenis data yang dihasilkan dari kunjungan di web: Data yang secara otomatis dihasilkan dan disimpan dalam bentuk log akses ke server, log perujuk (link yang merujuk), log tentang agent (browser),  dan cookie di komputer klien Profile user Metadata, seperti atribut halaman, atribut konten, dan data penggunaan web. [ Baca juga tentang Metadata di dalam data warehouse dan apa isinya ]

Penambangan Konten Web dan Struktur Web - Seri Text Mining dan Web Mining (7)

Penambangan Konten Web (web content mining) mengacu ke suatu ekstraksi informasi yang memberi manfaat dari berbagai halaman web. Dokumen bisa diekstrak dalam suatu format yang bisa dibaca oleh mesin sehingga teknik-teknik yang ter-otomatisasi bisa menghasilkan suatu informasi tentang halaman-halaman web tersebut. Web crawler digunakan untuk membaca melalui konten suatu web secara otomatis. Informasi yang dikumpulkan mungkin memasukkan karakteristik dokumen yang mirip dengan apa yang digunakan dalam text mining ,  tetapi mungkin memasukkan konsep tambahan, seperti hirarki dokumen. Penambangan konten web (web content mining) juga bisa digunakan untuk meningkatkan hasil yang dibuat oleh mesin pencari (search engine). Contohnya, Turetken dan Sharda (pakar data mining), menjelaskan suatu sistem visualisasi yang mengambil hasil suatu pencarian dari search engine seperti Google, membaca 100 dokumen teratas, meng-cluster dokumen-dokumen tersebut dengan memprosesnya dengan mengguna...

Sekilas tentang Web Mining (Penambangan Web) - Seri Text Mining dan Web Mining (6)

World Wide Web atau singkatnya Web saja  memiliki tempat penyimpanan data dan informasi yang sangat besar sekali yang bisa dibayangkan oleh seseorang  tentang segala hal secara virtual. Web barangkali adalah tempat penyimpanan data dan teks terbesar di dunia, dan jumlah informasi di web terus menerus tumbuh setiap hari. Banyak sekali informasi menarik bisa ditemukan di dunia online:  homepage siapa di link ke halaman-halaman lain mana, berapa banyak orang memiliki link ke halaman web tertentu, dan bagaimana situs tertentu diorganisir. Selain itu, setiap pengunjung yang datang ke web, setiap pencarian pada search engine, setiap klik pada suatu link, dan setiap transaksi pada situs e-commerce selalu menciptakan data baru. Meskipun data teks yang tak-terstruktur di web dikodekan dalam bentuk HTML atau XML merupakan konten web yang paling dominan, tetapi infrastruktur web juga berisi informasi tentang hyperlink (koneksi-koneksi ke berbagai halaman web lain) dan informasi t...

Berbagai Software Text Mining - Seri Text Mining dan Web Mining (5)

Karena nilai pemanfaatan text mining semakin lama semakin disadari oleh berbagai organisasi atau perusahaan, jumlaj software yang ditawarkan oleh perusahaan-perusahaan software maupun perusahaan nirlaba juga terus meningkat. Berikut ini adalah berbagai software text mining yang paling popular yang diklasifikasikan berdasarkan software komersial dan software gratis (freeware).

Proses dalam Text Mining - Seri Text Mining dan Web Mining (4)

Supaya berhasil, berbagai kajian text mining seharusnya mengikuti methodologi yang baik berdasarkan ‘best practices’.  Model proses standard diperlukan yang mirip dengan CRISP-DM, yang merupakan standard industry untuk project-project data mining. Meskipun sebagian besar CRISP-DM juga bisa diterapkan ke project-project text minig, model proses tertentu untuk text mining akan memasukkan berbagai macam aktivitas data preprocessing yang jauh lebih rumit. Gambar di samping menggambarkan diagram context tingkat tinggi dari suatu proses text mining pada umumnya. Diagram context ini menyajikan lingkup proses, dengan menekankan beberapa antarmukanya dengan lingkungan yang lebih besar.  Pada dasarnya, gambar tersebut menjelaskan batas-batas dikeitar proses tertentu untuk mengidentifikasi secara eksplisit apa yang akan dimasukkan (dan dikeluarkan) dari proses text mining.

Penerapan-penerapan Text Mining - Seri Text Mining dan Web Mining (3)

Karena jumlah data tak-terstruktur yang dikumpulkan perusahaan semakin banyak, maka nilai dan popularitas tools text mining juga meningkat. Saat ini banyak sekali perusahaan menyadari betapa pentingnya mengekstrak knowledge (pengetahuan) yang ada di berbagai data berbasis dokumen yang mereka miliki dengan menggunakan tools text mining. Berikut ini adalah beberapa contoh kecil beberapa kategori penerapan text mining. [ Baca juga: Kisah sukses web mining ]

Pemrosesan Bahasa Alami (Natural Language Processing) - Seri Text Mining dan Web Mining (2)

Beberapa aplikasi text mining awal menggunakan penyajian sederhana yang disebut dengan ‘bag-of-words' ketika mengenalkan struktur ke suatu kumpulan dokumen berbasis teks untuk mengklasifikasikan nya menjadi dua atau lebih kelas yang sudah ditentukan atau untuk meng-cluster nya menjadi pengelompokan-pengelompokan alami. [ Baca juga: Pengertian Clustering atau Analisa Cluster ]. Dalam model ‘bag-of-words’ tersebut, teks, misalnya suatu kalimat, paragraph, atau dokumen penuh, disajikan sebagai kumpulan kata, dengan mengabaikan tata bahasa atau  urutan kata-kata yang akan muncul. Model ‘bag-of-words’ masih digunakan dalam beberapa tool klasifikasi dokumen yang sederhana. Contohnya, dalam memfilter spam email, suatu pesan di email bisa dimodelkan sebagai suatu kumpulan kata-kata yang tak berurutan (a bag-of-words) yang dibandingkan dengan dua ‘bags’ berbeda yang sudah ditentukan sebelumnya. Satu ‘bag’ diisi dengan kata-kata yang ditemukan di dalam pesan-pesan spam dan yang satunya d...

Konsep dan Definisi Text Mining - Seri Text Mining dan Web Mining (1)

Seri ini menjelaskan ikhtisar yang agak komprehensif tentang text mining dan web mining karena keduanya terkait dengan business intelligence (BI) dan decision support systems (dss) . Keduanya pada dasarnya adalah turunan dari data mining . Karena text mining dan web mining selalu meningkat jumlahnya dan besarnya lebih dari data yang ada dalam database terstruktur, maka sangat penting untuk mengetahui beberapa teknik yang digunakan dalam memproses jumlah data tak-terstruktur yang sangat besar. Text Mining: Konsep dan Definisi Era informasi dimana kita sekarang jalani dicirikan dengan pertumbuhan data dan informasi yang banyak dan cepat yang dikumpulkan, disimpan, dan disediakan di media elektronik. Sebagian besar data bisnis disimpan dalam bentuk dokumen teks yang secara virtual sama sekali tidak terstruktur.  Menurut kajian dari Merrill Lynch dan gartner, 85 hingga 90 persen dari semua data korporat diambil dan disipan dalam bentuk data tak-terstruktur (McKnight, 2005)....