Analisis Perbandingan Decision Tree dan Random Forest Pada Klasifikasi Teks Data Kesehatan
DOI:
https://doi.org/10.51211/biict.v11i1.2928Kata Kunci:
decision tree, random forest, text classificationAbstrak
Salah satu topik penelitian yang diminati para peneliti adalah klasifikasi teks otomatis. Klasifikasi teks pada saat ini sering digunakan karena semakin banyaknya jumlah dokumen teks yang harus kita tangani maupun kita gunakan setiap hari. Metode pengklasifikasi yang banyak digunakan diantaranya adalah decision tree dan random forest. Decision Tree umumnya dipilih memiliki kesederhanaan visual, konstruksi keputusan yang relatif cepat, dan tidak memerlukan asumsi sebelumnya tentang data. Algoritma Random Forest menggunakan konsep yang sama dengan Decision Tree kemudian melakukan agregasi hasil dari setiap pohon keputusan untuk memperoleh hasil. Algoritma Random Forest juga menggunakan pendekatan perluasan, yang disebut pendekatan bagging, yang mana fitur-fitur berbeda dari kumpulan data akan ditugaskan ke setiap pohon keputusan. Tujuan penelitian ini adalah melakukan kategorisasi dengan menggunakan teknik klasifikasi menggunakan algoritma decision tree dan random forest, yang merupakan algoritma pengklasifikasi yang banyak digunakan. Dengan menggunakan empat buah skenario uji dimana membagi data latih dan data uji dengan kombinasi 10%-90% 15%-85% 20%-80% dan 25%-75% menghasikan informasi bahwa Random Forest memiliki akurasi yang lebih baik. Akurasi Random Forest pada tiap skenario uji selalu lebih baik daripada nilai akurasi Decision Tree. Pada Decision Tree, menunjukkan nilai akurasi cukup stabil pada kisaran 75%, sedangkan pada Random Forest menunjukkan nilai akurasi lebih stabil pada nilai 99%.