Aluska, Alfa Renaldo (2026) Sistem Temu Balik Informasi untuk Pencarian Semantik Multibahasa pada Kanon Pali dengan Adaptasi Domain Model Bahasa Berbasis Transformer. Other thesis, Institut Teknologi Sepuluh Nopember.
|
Text
5026221144-Undergraduate_Thesis.pdf Restricted to Repository staff only Download (10MB) | Request a copy |
Abstract
Pencarian informasi pada korpus agama Buddha, khususnya Kanon Pali, sering terkendala kesenjangan leksikal antara bahasa klasik dan modern, karena pendekatan berbasis kata kunci terbatas dalam menangkap makna kontekstual sehingga relevansi hasil kurang optimal bagi pengguna awam. Penelitian ini membangun sistem temu balik informasi untuk pencarian semantik multibahasa pada Kanon Pali melalui pendekatan adaptasi domain dan pemeringkatan ulang. Metode Generative Pseudo-Labeling (GPL) diterapkan untuk mengadaptasi model bahasa pra-terlatih multibahasa terhadap struktur semantik domain tanpa memerlukan data latih berlabel, sementara pemeringkatan ulang berbasis cross-encoder digunakan untuk menyempurnakan urutan hasil pencarian. Evaluasi dilakukan secara intrinsik melalui keterpisahan ruang embedding (Cosine Similarity) dan secara ekstrinsik melalui metrik nDCG@5, Precision@5, serta Spearman’s Rank Correlation yang dinilai oleh pakar dari STAB Kertarajasa, STAB Syailendra, dan model bahasa besar, dilengkapi System Usability Scale (SUS) untuk mengukur penerimaan pengguna. Hasil penelitian menunjukkan bahwa adaptasi bobot melalui GPL yang diadaptasi tidak berhasil melampaui model dasar, sekaligus menyingkap penajaman geometri ruang embedding secara intrinsik yang tidak diikuti peningkatan relevansi menurut penilaian manusia. Sebaliknya, pemeringkatan ulang terbukti menjadi pengungkit yang paling dapat diandalkan karena konsisten mengangkat retriever yang lemah tanpa menurunkan performa dan membawanya setara dengan model dasar. Prototipe antarmuka web yang turut dirancang dengan penerapan AI chatbot memperoleh skor SUS sebesar 77,11, menunjukkan tingkat penerimaan yang baik.
====================================================================================================================================
Effective Information retrieval over Buddhist religious corpora, particularly the Pali Canon, is often hindered by the lexical gap between classical and modern languages, as keyword-based approaches are limited in capturing contextual meaning, rendering result relevance suboptimal for lay users. This study develops an information retrieval system for multilingual semantic search over the Pali Canon through domain adaptation and reranking. The Generative Pseudo-Labeling (GPL) method is applied to adapt a pretrained multilingual language model to the domain's semantic structure without requiring labeled training data, while cross-encoder-based reranking is used to refine the ordering of search results. Evaluation is conducted intrinsically through embedding-space separability (Cosine Similarity) and extrinsically through the nDCG@5, Precision@5, and Spearman's Rank Correlation metrics, as assessed by experts from STAB Kertarajasa, STAB Syailendra, and large language models, complemented by the System Usability Scale (SUS) to measure user acceptance. The results show that weight adaptation via GPL did not surpass the base model, and further revealed that the intrinsic sharpening of the embedding-space geometry was not accompanied by an improvement in relevance according to human judgment. Conversely, reranking proved to be the most reliable lever, as it consistently elevated weak retrievers without degrading performance and brought them on par with the base model. The web-interface prototype, which was also designed with the implementation of an AI chatbot, obtained a SUS score of 77.11, indicating a good level of acceptance.
| Item Type: | Thesis (Other) |
|---|---|
| Uncontrolled Keywords: | Adaptasi Domain, Generative Pseudo-Labeling, Kanon Pali, Pemeringkatan Ulang, Pencarian Semantik, Temu Balik Informasi, Domain Adaptation, Generative Pseudo-Labeling, Information Retrieval, Pali Canon, Reranking, Semantic Search |
| Subjects: | B Philosophy. Psychology. Religion > BQ Buddhism P Language and Literature > PM Hyperborean, Indian, and Artificial languages Q Science > Q Science (General) > Q325.5 Machine learning. Support vector machines. Z Bibliography. Library Science. Information Resources > ZA Information resources > Z699.5 Information storage and retrieval systems |
| Divisions: | Faculty of Intelligent Electrical and Informatics Technology (ELECTICS) > Information System > 57201-(S1) Undergraduate Thesis |
| Depositing User: | Alfa Renaldo Aluska |
| Date Deposited: | 30 Jul 2026 08:06 |
| Last Modified: | 30 Jul 2026 08:06 |
| URI: | http://repository.its.ac.id/id/eprint/139498 |
Actions (login required)
![]() |
View Item |
