Qomariyah, Siti (2019) Topic Modeling Data Twitter Surabaya Menggunakan Metode Latent Dirichlet Allocation (LDA) Dan Probabilistic Latent Semantic Analysis (PLSA). Masters thesis, Institut Teknologi Sepuluh Nopember.
|
Text
06211750010013-Master_Thesis.pdf Restricted to Repository staff only Download (5MB) | Request a copy |
Abstract
Dunia perindustrian saat ini telah memasuki era revolusi 4.0. Di era ini, perlu adanya data untuk menunjang suatu kebijakan. Untuk menunjang hal tersebut, Pemkot Surabaya membuat Media Center Surabaya. Media Center Surabaya ini digunakan untuk menampung semua aspirasi warga Surabaya. Salah satu cara yang dapat digunakan untuk mengakses Media Center Surabaya adalah melalui twitter. Topik yang dibahas dalam semua tweet tersebut merupakan suatu informasi penting yang perlu kita ketahui. Sebab informasi tersebut dapat digunakan untuk meningkatkan kinerja Pemkot Surabaya. Data yang ada pada twitter termasuk dalam kategori big data. Untuk melakukan analisis data text pada twitter maka diperlukan analisis text mining. Salah satu teknik yang bisa digunakan dalam text mining yaitu topic modeling. Data twitter termasuk ke dalam data yang tidak terstruktur. Oleh karena itu perlu adanya preprocessing sebelum pengolahan data. Tahapan preprocessing yang dilakukan antara lain cleansing, case folding, stemming, dan stopwords. Setelah dilakukan preprocessing, maka selanjutnya dapat dilakukan analisis topic modeling. Topik yang dihasilkan dari analisis ini selanjutnya akan ditampilkan dalam bentuk bigram word cloud. Salah satu metode yang dapat digunakan dalam klastering data teks adalah Latent Dirichlet Allocation (LDA) dan Probabilistic Latent Semantic Analysis (PLSA). Kelebihan dari metode PLSA yaitu mampu mengatasi sinonim dan polisemi. Namun PLSA tidak menganalisis hubungan antar dokumen dalam korpus. Sedangkan LDA menganalisis hubungan antar dokumen dalam korpus. Oleh karena itu, penelitian ini meneliti tentang topic modeling data twitter menggunakan metode LDA dan PLSA. Berdasarkan nilai perplexity didapatkan bahwa metode PLSA menggunakan metode bigram memberikan hasil yang lebih baik jika dibandingkan dengan LDA.
=================================================================================================================================
The industrial world has entered the era of revolution 4.0. In this era, there is a need for data to support a policy. Because of that, Surabaya Government made Media Center Surabaya. Media Center Surabaya is used to accommodate all the aspiration of Surabaya citizen. To access Media Center Surabaya, citizen can use twitter. The topic which is discussed in twitter is important information that we need to know. Because the information can be used to improve the performance of Surabaya Government. Twitter data included into big data category.because it is big data and the data is text, we need to analyze using text minig. One technique that can be used in text mining is topic modeling. Twitter data is unstructured data. Therefore there is a need for preprocessing before analyze the data. The stages of preprocessing include cleansing, stemming, and stopwords. One of the method that can be used to do topic modeling is Latent Dirichlet Allocationn (LDA) and Probabilistic Latent Semantic Analysis (PLSA).The advantages of PLSA is PLSA can handle synonimuous and polysemi. But PLSA doesn’t consider the relationship between documents in corpus and LDA did it. Because of that, in this study researcher doing topic modeling twitter data using the Latent Dirichlet Allocationn (LDA) and Probabilistic Latent Semantic Analysis (PLSA). The result is PLSA using bigram data gives the best result.
| Item Type: | Thesis (Masters) |
|---|---|
| Uncontrolled Keywords: | Latent Dirichlet Allocation, Probabilistic Latent Semantic Analysis, Media Center Surabaya, Preprocessing, Twitter |
| Subjects: | H Social Sciences > H Social Sciences (General) Q Science > QA Mathematics > QA278.55 Cluster analysis Q Science > QA Mathematics > QA76.9.D343 Data mining. Querying (Computer science) |
| Divisions: | Faculty of Mathematics, Computation, and Data Science > Statistics > 49101-(S2) Master Thesis |
| Depositing User: | Qomariyah Siti |
| Date Deposited: | 23 Jul 2026 04:05 |
| Last Modified: | 23 Jul 2026 04:05 |
| URI: | http://repository.its.ac.id/id/eprint/69094 |
Actions (login required)
![]() |
View Item |
