Prediksi Outlier Menggunakan Data Tepi Klaster

Nuqoba, Barry (2009) Prediksi Outlier Menggunakan Data Tepi Klaster. Masters thesis, Institut Teknologi Sepuluh Nopember.

[thumbnail of 5107201009-Master_thesis.pdf] Text
5107201009-Master_thesis.pdf
Restricted to Repository staff only

Download (25MB)

Abstract

Sebagian besar algoritma terkait analisis outlier yang dipublikasikan oleh para peneliti berhubungan dengan deteksi outlier dan belum banyak yang membahas tentang prediksi outlier. Prediksi outlier penting untuk menjaga validitas data. Algoritma prediksi outlier konvensional memiliki kelemahan dalam hal efisiensi karena harus membandingkan data yang akan diprediksi dengan seluruh data dalam dataset. Konsep baru yang melibatkan solving set muncul sebagai solusi atas permasalahan efisiensi dalam prediksi outlier. Dengan menggunakan solving set, waktu prediksi menjadi lebih cepat, tetapi akurasi prediksi menjadi lebih rendah. Dalam penelitian ini dikembangkan suatu algoritma prediksi outlier baru yang efisien dalam melakukan prediksi, tetapi tidak mengorbankan akurasi hasil prediksi. Algoritma baru ini merupakan inovasi terhadap konsep solving set yang telah dikembangkan sebelumnya. Dalam penelitian sebelumnya, solving set didefinisikan sebagai subset dari dataset yang beranggotakan data yang menjadi top-n outlier sebagai representasi dataset. Sedangkan dalam penelitian ini, solving set didefinisikan sebagai subset dari dataset yang merupakan data tepi klaster beserta pusat klasternya sebagai representasi dataset. Data tepi klaster dideteksi menggunakan algoritma BORDER yang telah terbukti dapat mendeteksi data tepi klaster secara efisien, sedangkan algoritma klasterisasi berbasis hirarki digunakan untuk melakukan klasterisasi data tepi yang telah terdeteksi. Selanjutnya, pusat masing-masing klaster dicari dengan menghitung nilai median dari data tepi pada masing-masing klaster. Algoritma Prediksi Outlier Menggunakan Tepi Klaster (APOTEK) dalam penelitian ini dilakukan dengan membandingkan jarak antara data yang akan diprediksi (query data) dengan pusat klaster dan jarak antara query data dengan data tepi klaster yang terdekat. Setelah dilakukan beberapa percobaan terhadap beberapa dataset dengan distribusi normal dan seragam, APOTEK terbukti dapat melakukan perbaikan terhadap algoritma prediksi outlier yang telah ada sebelumnya. Dalam aspek akurasi prediksi, APOTEK berhasil melakukan peningkatan sebesar 5% dibandingkan dengan algoritma prediksi outlier yang dikembangkan oleh Angiulli et al. (2006), baik untuk dataset berdistribusi normal maupun seragam. Sedangkan dalam aspek kecepatan prediksi, APOTEK berhasil melakukan peningkatan berturut-turut sebesar 40% dan 73% untuk dataset berdistribusi normal dan seragam.
===================================================================================================================================
Most algorithms related to outlier analysis published by researchers focus on outlier detection, while only a few discuss outlier prediction. Outlier prediction is important for maintaining data validity. Conventional outlier prediction algorithms have a weakness in terms of efficiency because they have to compare the query data with all data in the dataset. A new concept involving a solving set emerged as a solution to the efficiency problem in outlier prediction. However, although the use of a solving set makes prediction time faster, it reduces prediction accuracy. In this research, a new outlier prediction algorithm was developed that can efficiently perform predictions without compromising prediction accuracy. This new algorithm is an innovation based on the existing concept of a solving set. In previous research, a solving set was defined as a subset of a dataset containing the top-n outliers as a representation of the dataset. In this research, however, a solving set is defined as a subset of a dataset consisting of cluster-border data and their centers as a representation of the dataset. Border data are detected using the BORDER algorithm, which has been proven to detect cluster-border data efficiently, while a hierarchical clustering algorithm is used to cluster the detected border data. Subsequently, the center of each cluster is determined by calculating the median value of the border data in each cluster. The Outlier Prediction Algorithm Using Cluster Border (APOTEK) proposed in this research predicts outliers by comparing the distance between the query data and the cluster center with the distance between the query data and the nearest cluster-border data. After conducting several experiments using datasets with normal and uniform distributions, APOTEK was shown to improve the existing outlier prediction algorithm. In terms of prediction accuracy, APOTEK achieved an improvement of 5% compared with the outlier prediction algorithm developed by Angiulli et al. (2006), for both normally and uniformly distributed datasets. In terms of prediction speed, APOTEK achieved improvements of 40% and 73% for normally and uniformly distributed datasets, respectively.

Item Type: Thesis (Masters)
Additional Information: RTIf 005.1 Nuq p
Uncontrolled Keywords: analisis outlier, prediksi outlier, data tepi klaster, solving set, data mining, outlier analysis, outlier prediction, cluster border point, solving set, data mining.
Subjects: T Technology > TK Electrical engineering. Electronics Nuclear engineering > TK5105.546 Computer algorithms
Divisions: Faculty of Information Technology > Informatics Engineering > 55101-(S2) Master Thesis
Depositing User: magang .
Date Deposited: 21 Sep 2026 04:36
Last Modified: 21 Sep 2026 04:36
URI: http://repository.its.ac.id/id/eprint/144724

Actions (login required)

View Item View Item