Wahyuni, Annisa Putri (2026) PENERAPAN CNN-BILSTM DENGAN TEMPORAL ATTENTION UNTUK INDONESIAN SPEECH EMOTION RECOGNITION MENGGUNAKAN EARLY FUSION FITUR AKUSTIK. Diploma thesis, Universitas siliwangi.
1 COVER.pdf
Download (171kB)
2 LEMBAR PENGESAHAN.pdf
Download (235kB)
3 PENGESAHAN PENGUJI.pdf
Download (226kB)
4 LEMBAR PERNYATAAN KEASLIAN.pdf
Download (247kB)
5 ABSTRACT.pdf
Download (171kB)
6 MOTO DAN PERSEMBAHAN.pdf
Download (165kB)
7 KATA PENGANTAR.pdf
Download (185kB)
8 DAFTAR ISI.pdf
Download (262kB)
9 DAFTAR TABEL.pdf
Download (176kB)
10 DAFTAR GAMBAR.pdf
Download (179kB)
11 BAB I.pdf
Download (218kB)
12 BAB II.pdf
Download (973kB)
13 BAB III.pdf
Download (912kB)
14 BAB IV.pdf
Restricted to Repository staff only
Download (1MB)
15 BAB V.pdf
Restricted to Repository staff only
Download (197kB)
16 DAFTAR PUSTAKA.pdf
Download (194kB)
17 LAMPIRAN.pdf
Restricted to Repository staff only
Download (1MB)
Abstract
Speech Emotion Recognition (SER) merupakan teknologi yang memungkinkan sistem mengenali emosi pembicara berdasarkan sinyal suara. Pengembangan SER untuk bahasa Indonesia masih menghadapi tantangan akibat keterbatasan dataset lokal, penggunaan fitur akustik tunggal yang belum mampu merepresentasikan karakteristik emosi secara komprehensif, serta evaluasi yang belum sepenuhnya mengukur kemampuan generalisasi model terhadap pembicara baru. Penelitian ini bertujuan menerapkan early fusion fitur akustik Mel-Frequency Cepstral Coefficients (MFCC), Hilbert Multispectrum, dan Cochleagram pada arsitektur CNN-BiLSTM dengan Temporal Attention untuk meningkatkan representasi fitur dan performa klasifikasi emosi ujaran berbahasa Indonesia. Penelitian menggunakan dataset IndoWaveSentiment yang terdiri atas lima kategori emosi, yaitu netral, senang, terkejut, jijik, dan kecewa. Tahapan penelitian meliputi preprocessing audio, augmentasi data menggunakan additive Gaussian noise, time stretching, pitch shifting, time shifting, dan speed perturbation, ekstraksi fitur akustik, early fusion melalui konkatenasi fitur, pelatihan model CNN-BiLSTM dengan Temporal Attention, serta evaluasi menggunakan metode Leave-One-Speaker-Out (LOSO) Cross Validation. Hasil penelitian menunjukkan bahwa model yang diusulkan memperoleh accuracy sebesar 73,33%, precision sebesar 76,90%, recall sebesar 73,33%, macro F1-score sebesar 71,42%, dan macro AUC sebesar 94,40%. Dibandingkan model dasar MFCC-BiLSTM dengan accuracy sebesar 65,67%, pendekatan yang diusulkan mampu meningkatkan performa klasifikasi sebesar 7,66%. Hasil tersebut menunjukkan bahwa kombinasi fitur akustik melalui early fusion serta penerapan Temporal Attention mampu meningkatkan representasi emosi dan kemampuan generalisasi model pada skenario speaker-independent, sehingga berpotensi menjadi pendekatan yang efektif dalam pengembangan sistem Speech Emotion Recognition berbahasa Indonesia.
Keywords: CNN-BiLSTM, Cochleagram, Early Fusion, Hilbert Multispectrum, Leave One-Speaker-Out, MFCC, Speech Emotion Recognition, Temporal Attention.
| Item Type: | Thesis (Diploma) |
|---|---|
| Subjects: | T Technology > T Technology (General) |
| Divisions: | Fakultas Teknik > Teknik Informatika |
| Depositing User: | user1 user1 user1 |
| Date Deposited: | 02 Sep 2026 08:09 |
| Last Modified: | 02 Sep 2026 08:09 |
| URI: | https://repositori.unsil.ac.id/id/eprint/7700 |
