Pembelajaran Kontrastif Multimodal Untuk Klasifikasi Kode HS Zero-Shot Pada Skrining Kontainer

Aljufri, Muhammad Arifuddin (2026) Pembelajaran Kontrastif Multimodal Untuk Klasifikasi Kode HS Zero-Shot Pada Skrining Kontainer. Masters thesis, Institut Teknologi Sepuluh Nopember.

[thumbnail of 6025241023-Master_Thesis.pdf] Text
6025241023-Master_Thesis.pdf - Accepted Version
Restricted to Repository staff only

Download (10MB) | Request a copy

Abstract

Otomasi klasifikasi Kode Harmonized System (HS) penting untuk memastikan keamanan perdagangan maritim di tengah meningkatnya volume perdagangan global. Penelitian sebelumnya lebih banyak berfokus pada klasifikasi Kode HS dalam konteks deklarasi tekstual yang noisy dan keterbatasan daya diskriminatif dari citra pemindaian kontainer. Meski demikian, klasifikasi barang yang tidak diketahui sebelumnya atau langka, yang mencerminkan distribusi ekor panjang dari komoditas perdagangan, masih kurang dieksplorasi. Studi ini mempelajari masalah tersebut dengan mengusulkan kerangka pembelajaran kontras multimodal yang memungkinkan klasifikasi Kode HS tanpa pelatihan sebelumnya (zero-shot) untuk barang yang diketahui maupun tidak diketahui. Sekumpulan data multimodal yang terdiri dari pemindaian kontainer menggunakan sinar gamma dan pasangan deskripsi Kode HS diproses menggunakan enkoder citra Vision Transformer (ViT) dan enkoder teks terkini. Sebuah kepala proyeksi untuk setiap modalitas memetakan output enkoder ke dalam ruang laten terpadu dengan menggunakan pembelajaran kontrastif, sehingga memaksimalkan kemiripan kosinus antara pasangan positif dan meminimalkan kemiripan tersebut antara pasangan negatif. Klasifikasi zero-shot difasilitasi dengan menggunakan jangkar semantik dalam bentuk 5,675 deskripsi kode HS 6 digit (HS6) yang dirancang dalam bentuk prompt. Evaluasi yang dilakukan pada data skrining kontainer multikelas yang terdiri dari 123.782 baris dan 504 kelas, yang dikurasi dari Pelabuhan Tanjung Perak, Indonesia, menunjukkan kemampuan kerangka yang diusulkan untuk menjembatani kompleksitas visual dari pemindaian kontainer sinar gamma dan makna perdagangan yang terkandung dalam deskripsi Kode HS. Hasil eksperimen dengan berbagai arsitektur berbasis transformer, termasuk ViT dengan BGE-Large, MPNet, Gemma, dan CLIP, menunjukkan bahwa kerangka yang diusulkan mempertahankan performa yang sebanding dengan baseline ResNet pada kelas yang diketahui, dengan ViT-BGE mencapai Akurasi Top-10 sebesar 93.16±0.16 dan 23.99±0.64 pada kelas yang diketahui dan tidak diketahui.
==================================================================================================================================
Automated Harmonized System (HS) Code classification is essential for ensuring the security of maritime trade amidst increasing global trade volumes. Prior research primarily focuses on HS Code classification within the context of noisy textual declarations and the limited discriminative capabilities of container scans. Nonetheless, the classification of unseen or rare goods, which exemplifies the long-tail distribution of trade commodities, remains insufficiently explored. This study addresses the problem by proposing a multimodal contrastive learning framework that enables zero-shot HS Code classification for both seen and unseen goods. A collection of multimodal data consisting of gamma-ray container scans and HS Code description pairs is processed using a Vision Transformer (ViT) image encoder and a state-of-the-art text encoder. A projection head for each modality maps encoder outputs into a unified latent space employing a contrastive learning objective, thereby maximizing the cosine similarity between positive pairs and minimizing it between negative pairs. Zero-shot classification is facilitated by using semantic anchors of 5,675 prompt-engineered Six-Digit HS Code (HS6) descriptions. An evaluation conducted on multi-class container screening data comprising 123,782 instances and 504 classes, curated from the Port of Tanjung Perak, Indonesia, demonstrates the proposed framework’s ability to bridge the gap between the visual complexity of gamma-ray container scans and the trade semantics inherent in HS Code descriptions. Experimental results across various transformer-based architectures, including ViT with BGE-Large, MPNet, Gemma, and CLIP, demonstrate that the proposed framework maintains performance comparable to ResNet baselines on seen classes, with ViT-BGE achieving Top-10 Accuracy of 93.16±0.16 and 23.99±0.64 on the seen and unseen classes, respectively.

Item Type: Thesis (Masters)
Uncontrolled Keywords: Skrining Kontainer, Pembelajaran Multimodal, Pembelajaran Kontrastif, Pembelajaran Zero-Shot, Container Screening, Multi-Modal Learning, Contrastive Learning, Zero Shot Learning
Subjects: Q Science > QA Mathematics > QA336 Artificial Intelligence
Q Science > QA Mathematics > QA76.87 Neural networks (Computer Science)
T Technology > T Technology (General) > T174.5 Technology--Risk assessment.
T Technology > T Technology (General) > T57.5 Data Processing
Divisions: Faculty of Intelligent Electrical and Informatics Technology (ELECTICS) > Informatics Engineering > 55101-(S2) Master Thesis
Depositing User: Muhammad Arifuddin Aljufri
Date Deposited: 31 Jul 2026 01:19
Last Modified: 31 Jul 2026 01:19
URI: http://repository.its.ac.id/id/eprint/135346

Actions (login required)

View Item View Item