Klasifikasi Multi-Label Layanan Finansial pada Data Regulasi BI dan OJK RI menggunakan IndoBERT dengan Pendekatan Semi-Supervised Learning dan Fine-Tuning LoRA

Afiat, Muhammad Ivan Ardianadi (2026) Klasifikasi Multi-Label Layanan Finansial pada Data Regulasi BI dan OJK RI menggunakan IndoBERT dengan Pendekatan Semi-Supervised Learning dan Fine-Tuning LoRA. Other thesis, Institut Teknologi Sepuluh Nopember.

[thumbnail of 5025221178-Undergraduate_Thesis.pdf] Text
5025221178-Undergraduate_Thesis.pdf - Accepted Version
Restricted to Repository staff only

Download (7MB) | Request a copy

Abstract

Klasifikasi pasal regulasi layanan keuangan diperlukan untuk membantu mengidentifikasi kategori layanan yang relevan dalam peraturan Bank Indonesia dan Otoritas Jasa Keuangan Republik Indonesia. Permasalahan ini dirumuskan sebagai klasifikasi multi-label karena satu pasal dapat berkaitan dengan lebih dari satu kategori layanan. Penelitian ini menghadapi keterbatasan data berlabel dan distribusi kombinasi label yang ekstrem, dimana dari 1.254 pasal, hanya 223 pasal berlabel dan 1.031 pasal tidak berlabel, dengan 112 pasal berlabel tersebut tidak memiliki label positif, 84 pasal memiliki kelima label, serta tidak terdapat pasal dengan tepat dua atau tiga label. Untuk memanfaatkan data yang belum dianotasi, penelitian ini mengembangkan pipeline semi-supervised learning untuk mengklasifikasi lima kategori layanan, yaitu e-money, kartu kredit, remitansi, QRIS, dan payment gateway. Tiga metode semi-supervised learning Binary Angular Learning (BAL), Strict Contrastive Loss (SCL), dan Jaccard Similarity Contrastive Loss (JSCL) dibandingkan menggunakan IndoBERT, CahyaBERT, dan XLM-RoBERTa, serta strategi tanpa fine-tuning, fine-tuning LoRA, dan fine-tuning penuh. Evaluasi dataset regulasi dilakukan dengan skema outer five-fold menggunakan F1-Mikro dan F1-Makro sebagai metrik utama, disertai Hamming Loss, Exact Match, Ranking Loss, precision, dan recall. Konfigurasi terbaik pada dataset regulasi diraih CahyaBERT dengan SCL dan fine-tuning penuh, menghasilkan F1-Mikro dan F1-Makro sebesar 0,8756. Dalam perbandingan terkontrol menggunakan IndoBERT dan BAL, fine-tuning penuh menghasilkan F1-Makro sebesar 0,8490, lebih tinggi daripada fine-tuning LoRA (0,7859) dan tanpa fine-tuning (0,7393), namun LoRA hanya melatih 0,629% dari keseluruhan parameter, mengurangi penggunaan puncak memori CUDA sebesar 30,96%, dan menghasilkan artefak spesifik tugas berukuran sekitar 3,013 MiB. Analisis error menunjukkan performa agregat yang tinggi ini sebagian besar ditopang oleh kombinasi tanpa label dan kelima label yang dominan, dengan 190 dari 223 pasal diprediksi secara tepat, sementara model masih kurang andal pada kombinasi label yang lebih langka. Dengan demikian, hasil penelitian menunjukkan potensi klasifikasi otomatis pada skema evaluasi yang digunakan, namun interpretasinya masih dibatasi oleh jumlah data berlabel dan kurangnya variasi kombinasi label, sehingga penambahan serta validasi data berlabel oleh ahli tetap diperlukan.
=============================================================================================================================================
Classification of financial service regulation articles is needed to help identify relevant service categories within regulations issued by Bank Indonesia and the Financial Services Authority (Otoritas Jasa Keuangan) of the Republic of Indonesia. This problem is formulated as multi-label classification because a single article can relate to more than one service category. This research faces the challenge of limited labeled data and an extreme label combination distribution, where of 1,254 articles, only 223 are labeled and 1,031 remain unlabeled, with 112 of the labeled articles having no positive labels, 84 articles having all five labels active, and no articles containing exactly two or three labels. To leverage the unlabeled data, this research develops a semi-supervised learning pipeline to classify five service categories, namely e-money, credit card, remittance, QRIS, and payment gateway. Three semi-supervised learning methods, Binary Angular Learning (BAL), Strict Contrastive Loss (SCL), and Jaccard Similarity Contrastive Loss (JSCL), are compared using IndoBERT, CahyaBERT, and XLM-RoBERTa as backbones, alongside three fine-tuning strategies, namely no fine-tuning, LoRA fine-tuning, and full fine-tuning. The regulation dataset is evaluated using an outer five-fold scheme, with Micro-F1 and Macro-F1 as the primary metrics, supplemented by Hamming Loss, Exact Match, Ranking Loss, precision, and recall. The best configuration on the regulatory dataset was achieved by CahyaBERT with SCL and full fine-tuning, yielding an F1-Micro and F1-Macro of 0.8756. In a controlled comparison using IndoBERT and BAL, full fine-tuning achieved an F1-Macro of 0.8490, higher than LoRA fine-tuning (0.7859) and no fine-tuning (0.7393). LoRA, however, trained only 0.629% of the total parameters, reduced peak CUDA memory usage by 30.96%, and produced a task-specific artifact of around 3.013 MiB. Error analysis shows that this high aggregate performance is largely driven by the dominant no-label and all-five-label combinations, with 190 out of 223 articles predicted correctly, while the model remains less reliable on rarer label combinations. These findings therefore point to the potential of automated classification under the evaluation scheme used, though their interpretation is still constrained by the limited amount of labeled data and the lack of variation in label combinations, underscoring the continued need for expert-driven expansion and validation of labeled data.

Item Type: Thesis (Other)
Uncontrolled Keywords: BERT, Fine-Tuning LoRA, Klasifikasi Multi-Label, Peraturan Pemerintah Indonesia, Semi-Supervised Learning, Transformer, BERT, Indonesian Government Regulations, LoRA Fine-Tuning, Multi-Label Classification, Semi-Supervised Learning, Transformer
Subjects: H Social Sciences > HG Finance
Q Science > Q Science (General) > Q325.5 Machine learning. Support vector machines.
Q Science > QA Mathematics > QA76.87 Neural networks (Computer Science)
Divisions: Faculty of Intelligent Electrical and Informatics Technology (ELECTICS) > Informatics Engineering > 55201-(S1) Undergraduate Thesis
Depositing User: Muhammad Ivan Ardianadi Afiat
Date Deposited: 28 Jul 2026 06:49
Last Modified: 28 Jul 2026 06:49
URI: http://repository.its.ac.id/id/eprint/138571

Actions (login required)

View Item View Item