Klasifikasi Berita Hoaks Indonesia Menggunakan XLM-R Dengan Random Sampling

Afkar, Rahbar Uzma Taswirul (2026) Klasifikasi Berita Hoaks Indonesia Menggunakan XLM-R Dengan Random Sampling. Other thesis, Institut Teknologi Sepuluh Nopember.

[thumbnail of 5026201055-Undergraduate_Thesis.pdf] Text
5026201055-Undergraduate_Thesis.pdf - Accepted Version
Restricted to Repository staff only

Download (1MB) | Request a copy

Abstract

Perkembangan teknologi informasi dan media digital telah mendorong penyebaran berita secara cepat dan besar-besaran, terutama melalui platform media sosial dan situs daring. Di sisi lain, fenomena ini turut meningkatkan peredaran berita hoaks yang berpotensi meninggalkan dampak negatif, seperti kesalahpahaman informasi, keresahan, serta gangguan terhadap stabilitas politik dan kepercayaan masyarakat. Oleh karena itu, diperlukan suatu pendekatan otomatis yang mampu mengklasifikasikan berita hoaks secara akurat dan efisien, khususnya pada konteks bahasa Indonesia. Penelitian ini bertujuan untuk mengembangkan model klasifikasi berita hoaks Indonesia dengan memanfaatkan model pre-trained multilingual XLM-RoBERTa (XLM-R) yang dikenal memiliki kemampuan representasi bahasa yang kuat pada berbagai bahasa, termasuk Bahasa Indonesia. Tantangan utama dalam penelitian ini adalah ketidakseimbangan kelas (imbalanced dataset), di mana jumlah berita faktual lebih dominan dibandingkan berita hoaks. Untuk mengatasi permasalahan tersebut, penelitian ini menerapkan teknik Random Sampling, yang meliputi random oversampling dan/atau random undersampling, guna menyeimbangkan distribusi data pada tahap pelatihan model. Dataset yang digunakan dalam penelitian ini terdiri dari kumpulan berita politik berbahasa Indonesia yang bersumber dari media daring terpercaya dengan label hoaks dan fakta. Tahapan penelitian meliputi proses studi literatur, data collection, preprocessing teks, pembagian data latih dan uji, penerapan teknik random sampling pada data latih, serta pelatihan dan evaluasi model XLM-R. Kinerja model nantinya dievaluasi menggunakan metrik akurasi, presisi, recall, dan F1-score untuk memperoleh gambaran yang komprehensif terhadap kemampuan klasifikasi model. Dengan demikian, penelitian ini diharapkan nantinya dapat memberikan kontribusi dalam pengembangan sistem klasifikasi hoaks secara otomatis serta menjadi referensi bagi penelitian selanjutnya di bidang pemrosesan bahasa alami dan klasifikasi teks berbahasa Indonesia
======================================================================================================================================
The rapid development of information technology and digital media has enabled information to spread quickly and widely, particularly through online platforms and social media. However, this phenomenon has also led to a significant increase in the dissemination of hoax news, which can cause negative impacts such as misinformation, social uneasiness, and disruption of political stability and public trust. Therefore, an automated approach is required to accurately and efficiently classify hoax news, especially in the context of the Indonesian language. This study aims to develop an Indonesian hoax news classification model by utilizing the multilingual pre-trained model XLM- RoBERTa (XLM-R), which is known for its strong language representation capabilities across multiple languages, including Indonesian. One of the main challenges addressed in this research is the issue of class imbalance, where factual news significantly outnumbers hoax news, To overcome this problem, this study applies Random Sampling techniques, including random oversampling and/or random undersampling, to balance the data distribution during the model training stage. The dataset used in this research consists of Indonesian political news articles collected from reputable online news outlets, labeled as either hoax or factual. The research methodology includes text preprocessing, dataset splitting into training and testing sets, the application of random sampling techniques to the training data, and the training evaluation of the XLM-R model. Model performance is evaluated using accuracy, precision, recall, and F1-score to provide a comprehensive assessment of the classification results. Therefore, this research is expected to contribute to the development of automated hoax detection systems and serve as a reference for future studies in the field of natural language processing and Indonesian text classification.

Item Type: Thesis (Other)
Uncontrolled Keywords: Berita Hoaks Indonesia, Klasifikasi Teks, XLM-R, Random Sampling, Indonesian Hoax News, Text Classification
Subjects: Q Science > QA Mathematics > QA336 Artificial Intelligence
Q Science > QA Mathematics > QA76.87 Neural networks (Computer Science)
Q Science > QA Mathematics > QA76.9.D343 Data mining. Querying (Computer science)
Divisions: Faculty of Intelligent Electrical and Informatics Technology (ELECTICS) > Information System > 57201-(S1) Undergraduate Thesis
Depositing User: Rahbar Uzma Taswirul Afkar
Date Deposited: 30 Jul 2026 07:03
Last Modified: 30 Jul 2026 07:03
URI: http://repository.its.ac.id/id/eprint/139740

Actions (login required)

View Item View Item