Nurlaily, Diana (2019) Ant Colony Optimization – Radial Based Oversampling Untuk Klasifikasi Data Microarray Yang Imbalanced Menggunakan Support Vector Machine. Masters thesis, Institut Teknologi Sepuluh Nopember.
|
Text
06211750010014-Master_Thesis.pdf Restricted to Repository staff only Download (4MB) | Request a copy |
Abstract
Data microarray berisi serangkaian sampel dengan jumlah variabel yang mencapai ribuan ekspresi gen. DNA microarray digunakan untuk menentukan tingkat ekspresi gen dan urutan gen dalam sampel. Dalam penelitian kanker, microarray digunakan untuk mempelajari variasi molekul antara tumor untuk mengembangkan diagnosis dan pengobatan yang lebih baik untuk penyakit ini. Klasifikasi adalah salah satu metode penting dalam penelitian microarray untuk mengklasifikasikan ekspresi gen. Beberapa karakteristik dataset microarray adalah dimensi tinggi dan imbalance. Karakteristik tersebut dapat menyebabkan prediksi klasifikasi tidak tepat. Tujuan dari penelitian ini adalah mengatasi masalah tersebut dengan melakukan seleksi variabel dan membangkitkan data sintetik pada pengamatan kelas minor. Metode seleksi variabel yang digunakan adalah Ant Colony Optimization (ACO), metode ini akan dibandingkan dengan Genetic Algorithm (GA). Metode untuk mengatasi data yang imbalance menggunakan Radial Based Oversampling (RBO) dan Synthetic Minority Oversampling Technique (SMOTE), Metode ini menghasilkan data sintetis dalam kelas minor sehingga proporsi kelas minor dan mayor sama. penelitian ini menggunakan Support Vector machine (SVM) untuk mengklasifikasikan data microarray. Data yang digunakan dalam penelitian ini adalah breast cancer dan lymphoma yang memiliki imbalance ratio dan jumlah variabel yang berbeda. Hasil dari penelitian ini adalah pemilihan variabel menggunakan metode ACO menghasilkan variabel yang lebih sedikit dan AUC lebih tinggi daripada metode GA, namun kurang efisien jika dilihat dari running time. SVM dengan RBO menghasilkan performansi klasifikasi yang tidak lebih baik dibandingkan SMOTE. Model Klasifikasi terbaik untuk data breast cancer dan lymphoma adalah SVM-ACO-SMOTE.
=================================================================================================================================
The microarray dataset contains a series of samples with the number of variables that reach thousands of genes expression. DNA microarrays are used to determine the level of gene expression and gene sequence in the sample. In cancer research, microarrays are used to study variation of molecular between tumors in order to develop better diagnosis and treatment for this disease. Classification is one of the important methods in microarray research to classify gene expression. Some characteristic of microarray dataset are high dimensions and imbalanced. Those characteristics cause prediction of classification is overfitting. The purpose of this study is overcome that problem with selection variables and generate synthetic data. The method for variables selection is Ant Colony Optimization (ACO), this method will compare with Genetic Algorithm (GA). The Method to solve imbalanced data is SMOTE and RBO, this method generates synthetic data in minor class so that proportion minor and mayor class balance. In this study, the Support Vector Machine (SVM) is used to classify microarray dataset. This study use breast cancer and lymphoma dataset, that have different imbalanced ratios and number of variables. The result of this research are variable selection using ACO has fewer variables selected and higher AUC than GA method. Performance of SVM with RBO no better than SVM with RBO. The best classification model for breast cancer and lymphoma dataset is SVM-ACO-SMOTE.
| Item Type: | Thesis (Masters) |
|---|---|
| Uncontrolled Keywords: | Ant Colony Optimization, Genetic Algorithm, Microarray, Radial Based Oversampling, Synthetic Minority Oversampling Technique |
| Subjects: | Q Science Q Science > QA Mathematics Q Science > QA Mathematics > QA402.5 Genetic algorithms. Interior-point methods. Q Science > QA Mathematics > QA76.9.D343 Data mining. Querying (Computer science) |
| Divisions: | Faculty of Mathematics, Computation, and Data Science > Statistics > 49101-(S2) Master Thesis |
| Depositing User: | Diana Nurlaily |
| Date Deposited: | 23 Jul 2026 04:11 |
| Last Modified: | 23 Jul 2026 04:11 |
| URI: | http://repository.its.ac.id/id/eprint/67962 |
Actions (login required)
![]() |
View Item |
