Pengembangan Sistem Multimodal Untuk Otomasi Evaluasi Presentasi Lisan Berdasarkan Aspek Content Dan Delivery

Chrisantya, Marcelinus Alvinanda (2026) Pengembangan Sistem Multimodal Untuk Otomasi Evaluasi Presentasi Lisan Berdasarkan Aspek Content Dan Delivery. Other thesis, Institut Teknologi Sepuluh Nopember.

[thumbnail of 5027221012_Undergraduate_Thesis.pdf] Text
5027221012_Undergraduate_Thesis.pdf - Accepted Version
Restricted to Repository staff only

Download (6MB) | Request a copy

Abstract

Evaluasi presentasi lisan manual rentan terhadap subjektivitas penguji dan keterbatasan waktu penilaian. Penelitian ini mengembangkan model multimodal untuk mengotomatisasi evaluasi presentasi mahasiswa berdasarkan dimensi Content (Relevansi Topik dan Elaborasi Materi) serta Delivery (Interaksi Visual dan Dinamika Suara). Sistem mengintegrasikan Optical Character Recognition (OCR) dan Automatic Speech Recognition (ASR) untuk ekstraksi fitur tekstual maupun semantik pada dimensi content, serta computer vision dan pemrosesan akustik untuk menilai tatapan mata dan kelancaran wicara pada dimensi delivery. Matriks fitur komputasional diekstrak dari 30 sampel video yang telah dianotasi secara manual sebagai ground truth, kemudian digunakan sebagai data latih untuk enam arsitektur model regresi dengan skema optimasi Repeated 5-Fold Cross-Validation. Hasil pengujian menunjukkan model XGBoost menghasilkan performa terbaik pada Dinamika Suara (Spearman 0,822; Pearson 0,766; MAE 0,167), sedangkan Random Forest optimal pada Interaksi Visual (Spearman 0,667; Pearson 0,616; MAE 0,583). Pada dimensi Content, model linier ElasticNet memimpin evaluasi Elaborasi Materi (Spearman 0,746; Pearson 0,750; MAE 0,500), sementara Relevansi Topik yang diuji dengan XGBoost masih berada pada tingkat moderat (Spearman 0,429; Pearson 0,433; MAE 0,833) akibat kendala mesin dalam membaca tata letak teks slide yang kompleks. Secara keseluruhan, penelitian ini berhasil mengembangkan rancang bangun sistem multimodal yang fungsional untuk mengotomatisasi evaluasi presentasi lisan berdasarkan aspek content dan delivery. Penelitian ini berhasil mengembangkan sistem multimodal untuk mengotomatisasi evaluasi presentasi lisan secara fungsional. Akurasi prediksi menunjukkan tingkat presisi yang baik, dengan selisih deviasi 0,5 hingga maksimal 1,0 poin dari skor pakar. Didukung oleh hasil pengujian pengguna, sistem ini layak diimplementasikan sebagai sistem penilaian otomatis yang objektif guna mereduksi bias subjektivitas penguji.
=====================================================================================================================================
Manual oral presentation evaluation is prone to examiner subjectivity and time constraints. This study develops a multimodal model to automate student presentation evaluation based on the Content dimension (Topic Relevance and Material Elaboration) and the Delivery dimension (Visual Interaction and Voice Dynamics). The system integrates Optical Character Recognition (OCR) and Automatic Speech Recognition (ASR) for textual and semantic feature extraction in the content dimension, along with computer vision and acoustic processing to assess eye contact and speech fluency in the delivery dimension. The computational feature matrix was extracted from 30 video samples manually annotated as ground truth, then used as training data for six regression model architectures with a Repeated 5-Fold Cross-Validation optimization scheme. Test results indicate that the XGBoost model yielded the best performance for Voice Dynamics (Spearman 0.822; Pearson 0.766; MAE 0.167), while Random Forest was optimal for Visual Interaction (Spearman 0.667; Pearson 0.616; MAE 0.583). In the Content dimension, the ElasticNet linear model led the evaluation of Material Elaboration (Spearman 0.746; Pearson 0.750; MAE 0.500), whereas Topic Relevance tested with XGBoost remained at a moderate level (Spearman 0.429; Pearson 0.433; MAE 0.833) due to machine constraints in reading complex slide text layouts. Overall, this study successfully developed a functional multimodal system architecture for automating oral presentation evaluations based on content and delivery aspects. This study successfully developed a multimodal system to functionally automate oral presentation evaluations. Predictive accuracy demonstrated a good level of precision, with a deviation of 0.5 to a maximum of 1.0 point from expert scores. Supported by user testing results, this system is feasible to be implemented as an objective automated assessment system to reduce examiner subjectivity bias.

Item Type: Thesis (Other)
Uncontrolled Keywords: Otomasi Evaluasi Presentasi, Multimodal Machine Learning, Optical Character Recognition, Automatic Speech Recognition, Computer Vision, Regresi.
Subjects: Q Science > Q Science (General) > Q325.5 Machine learning. Support vector machines.
T Technology > T Technology (General) > T58.62 Decision support systems
Divisions: Faculty of Intelligent Electrical and Informatics Technology (ELECTICS) > Information Technology > 59201-(S1) Undergraduate Thesis
Depositing User: Marcelinus Alvinanda Chrisantya
Date Deposited: 29 Jul 2026 01:06
Last Modified: 29 Jul 2026 01:06
URI: http://repository.its.ac.id/id/eprint/139362

Actions (login required)

View Item View Item