Ramdani, Yosep Adriana Fauzi (2026) ALGORITHM-LEVEL IMBALANCE DATA HANDLING PADA CROSS-LINGUAL LANGUAGE MODEL ROBERTA UNTUK DETEKSI KOMENTAR TOXIC BERBASIS MULTI-SOURCE DATA. Other thesis, Universitas Siliwangi.
1 COVER.pdf
Download (188kB)
2 LEMBAR PENGESAHAN.pdf
Download (329kB)
3 PENGESAHAN PENGUJI.pdf
Download (297kB)
4 PERNYATAAN KEASLIAN.pdf
Download (342kB)
5 ABSTRACT.pdf
Download (292kB)
6 MOTTO DAN PERSEMBAHAN.pdf
Download (238kB)
7 KATA PENGANTAR.pdf
Download (244kB)
8 DAFTAR ISI.pdf
Download (253kB)
9 DAFTAR TABEL.pdf
Download (246kB)
10 DAFTAR GAMBAR.pdf
Download (246kB)
11 BAB I.pdf
Download (226kB)
12 BAB II.pdf
Download (865kB)
13 BAB III.pdf
Download (1MB)
14 BAB IV.pdf
Restricted to Repository staff only
Download (1MB)
15 BAB V.pdf
Restricted to Repository staff only
Download (193kB)
16 DAFTAR PUSTAKA.pdf
Download (201kB)
17 LAMPIRAN.pdf
Restricted to Repository staff only
Download (1MB)
Abstract
Meningkatnya ujaran toxic di media sosial membawa dampak negatif terhadap individu dan dinamika sosial, sehingga deteksi otomatis berbasis Natural Language Processing menjadi semakin krusial. Tantangan utama dalam tugas ini adalah distribusi data yang tidak seimbang antara kelas toxic dan non-toxic, serta mayoritas model yang masih bersifat monolingual sehingga tidak mampu menggeneralisasi deteksi toxic ke bahasa lain. Penelitian ini mengusulkan pendekatan algorithm-level method sebagai strategi imbalance data handling pada pretrained cross-lingual language model XLM-RoBERTa untuk deteksi komentar toxic dalam bahasa Inggris dan bahasa Indonesia tanpa memanfaatkan dataset hasil translasi. Metode yang diterapkan mencakup studi komparatif berbagai konfigurasi adaptive fusion loss, two-stage fine-tuning dan threshold tuning dengan data latih yang bersifat multi-source. Hasil eksperimen menunjukkan bahwa Adaptive Fusion Binary Cross-Entropy (BCE) with Focal Loss menghasilkan f1-score kelas minoritas terbaik sebesar 0,7952, meningkat 0,15% dari baseline Static Fusion BCE with Focal Loss 0,7937. Penerapan two-stage fine-tuning meningkatkan f1-score kelas minoritas menjadi 0,8052 dengan peningkatan sebesar 1,15% dibandingkan baseline pada validation set, dan threshold tuning memberikan peningkatan f1 score kelas minoritas sebesar 2,04% dari 0,7932 menjadi 0,8136 pada test set dengan f1-macro 0,8947 meningkat 5,58% dibandingkan penelitian terdahulu 0,8389. Penelitian selanjutnya disarankan untuk mengeksplorasi klasifikasi multikelas, penanganan code-mixed, mitigasi bias entitas dan leksikal, serta implementasi model pada sistem real-time.
Kata Kunci: Adaptive Fusion Loss, Cross-lingual, Imbalance Data Handling, Deteksi Komentar Toxic, XLM-RoBERTa
| Item Type: | Thesis (Other) |
|---|---|
| Subjects: | L Education > L Education (General) |
| Divisions: | Fakultas Teknik > Teknik Informatika |
| Depositing User: | user1 user1 user1 |
| Date Deposited: | 17 Sep 2026 06:39 |
| Last Modified: | 17 Sep 2026 06:39 |
| URI: | https://repositori.unsil.ac.id/id/eprint/7981 |
