Analisis Komparatif Kombinasi Metode Embedding dan Algoritma Clustering untuk Pengelompokan Pertanyaan Admisi Perguruan Tinggi Berkarakteristik Fine-Grained

Baruwa, Gayu (2026) Analisis Komparatif Kombinasi Metode Embedding dan Algoritma Clustering untuk Pengelompokan Pertanyaan Admisi Perguruan Tinggi Berkarakteristik Fine-Grained. Other thesis, Institut Teknologi Sepuluh Nopember.

[thumbnail of 5025221247-Undergraduate_Thesis.pdf] Text
5025221247-Undergraduate_Thesis.pdf - Accepted Version
Restricted to Repository staff only

Download (9MB) | Request a copy

Abstract

Pertumbuhan layanan informasi digital meningkatkan volume pertanyaan tanya-jawab (Question Answering) yang bersifat fine-grained, yaitu memiliki kemiripan leksikal tinggi namun berbeda secara semantik, sehingga menyulitkan pengelompokan dan pencarian jawaban yang relevan. Klasterisasi teks menjadi pendekatan unsupervised yang potensial untuk mengorganisir pertanyaan tersebut sebagai dasar kerangka kerja pencarian jawaban. Penelitian ini mengevaluasi 16 skenario kombinasi empat metode embedding (TF-IDF, Word2Vec, IndoBERT pre-trained, dan IndoBERT hasil fine-tuning berbasis Triplet Loss) dengan empat algoritma clustering (K-Means, Agglomerative Hierarchical Clustering, DBSCAN, dan Spectral Clustering) dalam mengelompokkan pertanyaan admisi perguruan tinggi berbahasa Indonesia, menggunakan 573 pertanyaan asli yang setelah pembagian stratified dan augmentasi menghasilkan 1.924 data latih. Evaluasi menggunakan metrik validasi internal (Silhouette Score, Davies-Bouldin Index, Calinski-Harabasz Index) dan eksternal (Adjusted Rand Index, Normalized Mutual Information) terhadap 144 ground truth klaster, dilengkapi analisis kualitatif melalui UMAP, t-SNE, dan Word Cloud. Kerangka pencarian jawaban diuji menggunakan k-Nearest Neighbor dan Nearest Centroid pada data uji. Hasil menunjukkan IndoBERT fine-tuned secara konsisten unggul pada seluruh algoritma, dengan kombinasi terbaik mencapai Silhouette Score hingga 0,2639, ARI hingga 0,8003, dan NMI hingga 0,8854. Kerangka pencarian jawaban berbasis IndoBERT fine-tuned mencapai akurasi hingga 97,8% dengan k-Nearest Neighbor dan 93,5% dengan Nearest Centroid. Temuan ini menunjukkan adaptasi domain melalui fine-tuning lebih menentukan kualitas klaster dibandingkan pemilihan algoritma, menjadi dasar empiris pengembangan sistem pencarian jawaban otomatis pada layanan admisi perguruan tinggi.
========================================================================================================================================
The growth of digital information services has increased the volume of fine-grained question answering (QA) data, exhibiting high lexical similarity yet differing in semantic intent, posing challenges for grouping and answer retrieval. Text clustering, as an unsupervised approach, offers a potential solution for organizing such questions as the basis of an answer retrieval framework. This study evaluates 16 scenarios combining four embedding methods (TF-IDF, Word2Vec, pre-trained IndoBERT, and fine-tuned IndoBERT via Triplet Loss-based Metric Learning) with four clustering algorithms (K-Means, Agglomerative Hierarchical Clustering, DBSCAN, and Spectral Clustering) for grouping Indonesian university admission questions, using 573 original questions which after stratified division and augmentation resulted in 1,924 training data. Evaluation uses internal validation metrics (Silhouette Score, Davies-Bouldin Index, Calinski-Harabasz Index) and external metrics (Adjusted Rand Index, Normalized Mutual Information) against 144 ground truth clusters, complemented by UMAP, t-SNE, and Word Cloud visualizations. The answer retrieval framework was tested using k-Nearest Neighbor and Nearest Centroid on the test set. Results show fine-tuned IndoBERT consistently outperforms other representations, with the best combination achieving a Silhouette Score of up to 0.2639, ARI of up to 0.8003, and NMI of up to 0.8854. The answer retrieval framework based on fine-tuned IndoBERT achieves accuracy of up to 97.8% with k-Nearest Neighbor and 93.5% with Nearest Centroid. These findings indicate domain adaptation through fine-tuning is more decisive for cluster quality than algorithm choice, providing an empirical basis for automated answer retrieval systems in university admission services.

Item Type: Thesis (Other)
Uncontrolled Keywords: Clustering, Embedding, Fine-Tuning, Question Answering, Fine-Grained, Pencarian Jawaban, Answer Retrieval.
Subjects: P Language and Literature > P Philology. Linguistics > P325 Semantics.
Q Science > Q Science (General) > Q325.5 Machine learning. Support vector machines.
Q Science > QA Mathematics > QA336 Artificial Intelligence
Q Science > QA Mathematics > QA76.87 Neural networks (Computer Science)
Q Science > QA Mathematics > QA76.9.D343 Data mining. Querying (Computer science)
Q Science > QA Mathematics > QA278 Cluster Analysis. Multivariate analysis. Correspondence analysis (Statistics)
Divisions: Faculty of Intelligent Electrical and Informatics Technology (ELECTICS) > Informatics Engineering > 55201-(S1) Undergraduate Thesis
Depositing User: Gayu Baruwa
Date Deposited: 22 Jul 2026 08:15
Last Modified: 22 Jul 2026 08:15
URI: http://repository.its.ac.id/id/eprint/136536

Actions (login required)

View Item View Item