Rahutomo, Faisal (2009) Penerapan Algoritma Weighted Tree Similarity Untuk Pencarian Semantik Wikipedia. Masters thesis, Institut Teknologi Sepuluh Nopember.
|
Text
5107201001-Master_thesis.pdf Restricted to Repository staff only Download (82MB) |
Abstract
Pencarian full-text maupun pencarian dengan metadata biasa (metadata-enabled search) memiliki kekurangan pada kinerja pencarian. Penelitian ini bertujuan menerapkan algoritma weighted tree similarity yang telah dimodifikasi ke dalam pencarian semantik Wikipedia. Algoritma weighted tree similarity digunakan untuk menghitung kemiripan antara tree representasi artikel dan tree query pengguna. Tree ini memiliki label di cabang dan node-nya serta berbobot di cabangnya untuk menunjukkan tingkat kepentingan cabang. Modifikasi yang dilakukan meliputi pembuatan subtree khusus keywords yang penghitungan kemiripannya menggunakan cosine dua buah vektor yang dimodifikasi. Selain itu, penghitungan kemiripan berdasarkan taksonomi digunakan untuk menghitung kemiripan dua kata menggunakan taksonomi WordNet, kemiripan dua kelompok kata, dan kemiripan kategori dengan menggunakan taksonomi kategori Kiwix. Rancang bangun sistem terdiri atas bagian pengindeks dan bagian retrieval. Bagian pengindeks terdiri atas komponen pembangkit metadata dan penyimpanan metadata, sedangkan bagian retrieval terdiri atas antarmuka pengguna dan algoritma weighted tree similarity. Penelitian ini juga mengajukan algoritma penghitungan weighted tree similarity menggunakan operasi array. Tree diwujudkan ke dalam sebuah array berdasarkan depth-first traversal, dengan penyimpanan sekumpulan array representasi artikel di sebuah tabel database. Tree representasi artikel berfungsi sebagai metadata. Dari hasil uji coba dapat ditunjukkan bahwa ketepatan pencarian menggunakan algoritma weighted tree similarity memiliki kemungkinan kinerja lebih baik dibandingkan dua metode lainnya. Terdapat bentuk tree, nilai bobot, pencocokan leaf node, dan nilai ambang (threshold) dengan kinerja terbaik. Hasil pengujian menunjukkan pencarian semantik dengan bentuk TIII, threshold 0,5, bobot konten dan konteks berturut-turut 0,6 dan 0,4, serta pelibatan pencocokan semantik kata dengan merujuk WordNet memberikan kinerja F-score terbaik dibandingkan dua metode lainnya.
===================================================================================================================================
Full-text search and metadata-enabled search suffer from limitations in search performance. This research aims to implement a modified weighted tree similarity algorithm into Wikipedia semantic search. The weighted tree similarity algorithm is used to compute the similarity between the article representation tree and the user query tree, where the trees feature arc and node labels as well as weights on their arcs to represent arc preferences. Modifications made to this algorithm include the design of a keyword subtree whose similarity is computed using a modified cosine similarity between two vectors, word semantic similarity computation based on the WordNet taxonomy, similarity between two word groups, and semantic similarity based on the Kiwix category taxonomy. The system development consists of an indexing component—comprising metadata generator and metadata storage—and a retrieval component comprising the user interface and the weighted tree similarity algorithm. This research also proposes a weighted tree similarity computation algorithm using array operations, where the tree is represented as an array based on depth-first traversal and stored in a database table, with the article representation tree acting as metadata. Experimental results demonstrate that semantic search using the weighted tree similarity algorithm has the potential for better performance compared to the other two methods. Optimal performance is achieved with specific tree shapes, weight values, leaf node matching, and threshold settings. Specifically, semantic search utilizing tree shape TIII, a threshold of 0.5, content and context weights of 0.6 and 0.4 respectively, and word semantic similarity referencing the WordNet taxonomy yields the best F-score performance compared to the other two methods.
| Item Type: | Thesis (Masters) |
|---|---|
| Additional Information: | RTIf 005.1 Rah p |
| Uncontrolled Keywords: | weighted tree similarity, Wikipedia, pencarian semantik, metadata, weighted tree similarity, Wikipedia, semantic search, metadata. |
| Subjects: | T Technology > TK Electrical engineering. Electronics Nuclear engineering > TK5105.546 Computer algorithms |
| Depositing User: | magang . |
| Date Deposited: | 18 Sep 2026 08:25 |
| Last Modified: | 18 Sep 2026 08:25 |
| URI: | http://repository.its.ac.id/id/eprint/144696 |
Actions (login required)
![]() |
View Item |
