ALGORITHM-LEVEL IMBALANCE DATA HANDLING PADA CROSS-LINGUAL LANGUAGE MODEL ROBERTA UNTUK DETEKSI KOMENTAR TOXIC BERBASIS MULTI-SOURCE DATA

Ramdani, Yosep Adriana Fauzi (2026) ALGORITHM-LEVEL IMBALANCE DATA HANDLING PADA CROSS-LINGUAL LANGUAGE MODEL ROBERTA UNTUK DETEKSI KOMENTAR TOXIC BERBASIS MULTI-SOURCE DATA. Other thesis, Universitas Siliwangi.

[thumbnail of 1 COVER.pdf] Text
1 COVER.pdf

Download (188kB)
[thumbnail of 2 LEMBAR PENGESAHAN.pdf] Text
2 LEMBAR PENGESAHAN.pdf

Download (329kB)
[thumbnail of 3 PENGESAHAN PENGUJI.pdf] Text
3 PENGESAHAN PENGUJI.pdf

Download (297kB)
[thumbnail of 4 PERNYATAAN KEASLIAN.pdf] Text
4 PERNYATAAN KEASLIAN.pdf

Download (342kB)
[thumbnail of 5 ABSTRACT.pdf] Text
5 ABSTRACT.pdf

Download (292kB)
[thumbnail of 6 MOTTO DAN PERSEMBAHAN.pdf] Text
6 MOTTO DAN PERSEMBAHAN.pdf

Download (238kB)
[thumbnail of 7 KATA PENGANTAR.pdf] Text
7 KATA PENGANTAR.pdf

Download (244kB)
[thumbnail of 8 DAFTAR ISI.pdf] Text
8 DAFTAR ISI.pdf

Download (253kB)
[thumbnail of 9 DAFTAR TABEL.pdf] Text
9 DAFTAR TABEL.pdf

Download (246kB)
[thumbnail of 10 DAFTAR GAMBAR.pdf] Text
10 DAFTAR GAMBAR.pdf

Download (246kB)
[thumbnail of 11 BAB I.pdf] Text
11 BAB I.pdf

Download (226kB)
[thumbnail of 12 BAB II.pdf] Text
12 BAB II.pdf

Download (865kB)
[thumbnail of 13 BAB III.pdf] Text
13 BAB III.pdf

Download (1MB)
[thumbnail of 14 BAB IV.pdf] Text
14 BAB IV.pdf
Restricted to Repository staff only

Download (1MB)
[thumbnail of 15 BAB V.pdf] Text
15 BAB V.pdf
Restricted to Repository staff only

Download (193kB)
[thumbnail of 16 DAFTAR PUSTAKA.pdf] Text
16 DAFTAR PUSTAKA.pdf

Download (201kB)
[thumbnail of 17 LAMPIRAN.pdf] Text
17 LAMPIRAN.pdf
Restricted to Repository staff only

Download (1MB)

Abstract

Meningkatnya ujaran toxic di media sosial membawa dampak negatif terhadap individu dan dinamika sosial, sehingga deteksi otomatis berbasis Natural Language Processing menjadi semakin krusial. Tantangan utama dalam tugas ini adalah distribusi data yang tidak seimbang antara kelas toxic dan non-toxic, serta mayoritas model yang masih bersifat monolingual sehingga tidak mampu menggeneralisasi deteksi toxic ke bahasa lain. Penelitian ini mengusulkan pendekatan algorithm-level method sebagai strategi imbalance data handling pada pretrained cross-lingual language model XLM-RoBERTa untuk deteksi komentar toxic dalam bahasa Inggris dan bahasa Indonesia tanpa memanfaatkan dataset hasil translasi. Metode yang diterapkan mencakup studi komparatif berbagai konfigurasi adaptive fusion loss, two-stage fine-tuning dan threshold tuning dengan data latih yang bersifat multi-source. Hasil eksperimen menunjukkan bahwa Adaptive Fusion Binary Cross-Entropy (BCE) with Focal Loss menghasilkan f1-score kelas minoritas terbaik sebesar 0,7952, meningkat 0,15% dari baseline Static Fusion BCE with Focal Loss 0,7937. Penerapan two-stage fine-tuning meningkatkan f1-score kelas minoritas menjadi 0,8052 dengan peningkatan sebesar 1,15% dibandingkan baseline pada validation set, dan threshold tuning memberikan peningkatan f1 score kelas minoritas sebesar 2,04% dari 0,7932 menjadi 0,8136 pada test set dengan f1-macro 0,8947 meningkat 5,58% dibandingkan penelitian terdahulu 0,8389. Penelitian selanjutnya disarankan untuk mengeksplorasi klasifikasi multikelas, penanganan code-mixed, mitigasi bias entitas dan leksikal, serta implementasi model pada sistem real-time.

Kata Kunci: Adaptive Fusion Loss, Cross-lingual, Imbalance Data Handling, Deteksi Komentar Toxic, XLM-RoBERTa

Item Type: Thesis (Other)
Subjects: L Education > L Education (General)
Divisions: Fakultas Teknik > Teknik Informatika
Depositing User: user1 user1 user1
Date Deposited: 17 Sep 2026 06:39
Last Modified: 17 Sep 2026 06:39
URI: https://repositori.unsil.ac.id/id/eprint/7981

Actions (login required)

View Item
View Item