Jurnal Teknologi dan Sistem Komputer (Oct 2021)

Algoritme decision tree untuk mendeteksi ujaran kebencian dan bahasa kasar multilabel pada Twitter berbahasa Indonesia

  • Fauzi Ihsan,
  • Iwan Iskandar,
  • Nazruddin Safaat Harahap,
  • Surya Agustian

DOI
https://doi.org/10.14710/jtsiskom.2021.13907
Journal volume & issue
Vol. 9, no. 4
pp. 199 – 204

Abstract

Read online

Ujaran kebencian dan bahasa kasar mudah ditemukan di dalam komunikasi tertulis di media sosial seperti Twitter, yang dapat memicu terjadinya persengketaan di antara korban dan pengujarnya. Bagaimanapun, akan sulit memeriksa apakah suatu twit mengandung ujaran kebencian dan/atau bahasa kasar bila seseorang berpihak. Penelitian ini bertujuan untuk membangun sistem untuk mengklasifikasi twit apakah mengandung ujaran kebencian dan kata-kata kasar. Apabila terdeteksi mengandung ujaran kebencian, maka level ujaran kebenciannya diukur. Dataset yang digunakan terdiri dari 13.126 twit asli dari Twitter. Word embedding digunakan untuk fitur dari teks. Algoritme Decision Tree digunakan untuk klasifikasi. Rekayasa fitur dan pengaturan parameter menunjukkan peningkatan performa deteksi. Fitur leksikon di klasifikasi Decision Tree menghasilkan akurasi tertinggi untuk deteksi ketiga kelas, yaitu kelas ujaran kebencian, kata-kata kasar dan level ujaran kebencian, daripada rekayasa fitur khusus dan fitur tekstual. Rata-rata akurasi dari ketiga kelas meningkat dari 69,77 % menjadi 70,48 % untuk komposisi data latih-uji 90:10, dan dari 69,35 % menjadi 69,54 % untuk komposisi 80:20.

Keywords