Komparasi Model Logistic Regression dan Random Forest pada Prediksi Penyakit Jantung Berdasarkan Analisis Fitur Klinis

Authors

  • Arsenly Realino Universitas Bina Sarana Informatika
  • Wahyu Nugraha Universitas Bina Sarana Informatika
  • Rabiatus Sa’adah Universitas Bina Sarana Informatika

        DOI:

https://doi.org/10.62712/juktisi.v5i2.1400

Keywords:

Logistic Regression,, Random Forest,, Machine learning, Penyakit Jantung,, Feature Importance.

Abstract

Penyakit jantung merupakan salah satu masalah kesehatan serius yang membutuhkan deteksi dini agar risiko keterlambatan penanganan dapat diminimalkan. Pemanfaatan Machine Learning memberikan peluang untuk membangun model prediksi berbasis fitur klinis pasien, namun pemilihan algoritma yang tepat masih menjadi isu penting karena performa model sangat dipengaruhi oleh karakteristik dataset. Penelitian ini bertujuan untuk membandingkan performa Logistic Regression dan Random Forest dalam memprediksi penyakit jantung serta menganalisis fitur klinis yang paling berkontribusi terhadap hasil klasifikasi. Dataset yang digunakan adalah Heart Disease Prediction Dataset berisi 270 data pasien, 13 fitur prediktor, dan 1 atribut target. Tahapan penelitian meliputi Exploratory Data Analysis, preprocessing, label encoding, pembagian data 80:20, standardisasi data pada Logistic Regression, pemodelan klasifikasi, optimasi Random Forest menggunakan GridSearchCV dengan 5-Fold Cross Validation, serta evaluasi menggunakan accuracy, precision, recall, F1-score, dan ROC-AUC. Hasil penelitian menunjukkan bahwa Logistic Regression memperoleh performa terbaik dengan accuracy 85,19%, precision 78,57%, recall 91,67%, F1-score 84,62%, dan ROC-AUC 89,86%. Random Forest memperoleh accuracy 81,48% dan meningkat menjadi 83,33% setelah tuning, tetapi belum mampu melampaui Logistic Regression. Fitur terpenting yang ditemukan adalah Chest Pain Type, Max HR, dan ST Depression. Dengan demikian, Logistic Regression dinilai lebih sesuai sebagai model pendukung deteksi dini penyakit jantung pada dataset klinis berskala terbatas.

Downloads

Download data is not yet available.

References

[1] S. Albahra et al., “Seminars in Diagnostic Pathology Artificial intelligence and machine learning overview in pathology & laboratory medicine : A general review of data preprocessing and basic supervised concepts,” vol. 40, no. February, pp. 71–87, 2023, doi: 10.1053/j.semdp.2023.02.002.

[2] A. M. Hernández and I. Van Nieuwenhuyse, A survey on multi ‑ objective hyperparameter optimization algorithms for machine learning, vol. 56, no. 8. Springer Netherlands, 2023. doi: 10.1007/s10462-022-10359-2.

[3] S. D. Goals, World health statistics 2025. 2025.

[4] A. Cuevas-chávez et al., “A Systematic Review of Machine Learning and IoT Applied to the Prediction and Monitoring of Cardiovascular Diseases,” pp. 1–50, 2023.

[5] S. Hossain, M. K. Hasan, M. O. Faruk, N. Aktar, and R. Hossain, “Machine learning approach for predicting cardiovascular disease in Bangladesh : evidence from a cross ‑ sectional study in 2023,” BMC Cardiovasc. Disord., pp. 1–28, 2024, doi: 10.1186/s12872-024-03883-2.

[6] A. Möller, “Predictive Power of Logistic Regres- sion versus Random Forest : A simu- lation study Matematiska institutionen”.

[7] G. James, D. Witten, T. Hastie, and R. Tibshirani, Springer Texts in Statistics An Introduction to Statistical Learning.

[8] A. P. Jawalkar, P. Swetcha, N. Manasvi, P. Sreekala, and S. Aishwarya, “Early prediction of heart disease with data analysis using supervised learning with stochastic gradient boosting,” J. Eng. Appl. Sci., pp. 1–18, 2023, doi: 10.1186/s44147-023-00280-y.

[9] H. Koffijberg, “Health Economic Research Assessing the Value of Early Detection of Cardiovascular Disease : A Systematic Review,” Pharmacoeconomics, vol. 41, no. 10, pp. 1183–1203, 2023, doi: 10.1007/s40273-023-01287-2.

[10] H. R. Maier et al., “On how data are partitioned in model development and evaluation : Confronting the elephant in the room to enhance model generalization ☆,” Environ. Model. Softw., vol. 167, no. June, p. 105779, 2023, doi: 10.1016/j.envsoft.2023.105779.

[11] Y. Mao, B. Legesse, and T. Belsty, “Current Problems in Cardiology Machine learning algorithms for heart disease diagnosis : A systematic review,” Curr. Probl. Cardiol., vol. 50, no. 8, p. 103082, 2025, doi: 10.1016/j.cpcardiol.2025.103082.

[12] N. Putri et al., “PENERAPAN FEATURE ENGINEERING DAN HYPERPARAMETER TUNING UNTUK MENINGKATKAN AKURASI MODEL RANDOM FOREST PADA APPLICATION OF FEATURE ENGINEERING AND HYPERPARAMETER TUNING TO IMPROVE THE ACCURACY OF RANDOM FOREST MODELS ON CREDIT RISK,” vol. 12, no. 2, pp. 251–262, 2025, doi: 10.25126/jtiik.2025128472.

[13] I. Muhamad and M. Matin, “Hyperparameter Tuning menggunakan GridsearchCV pada Random Forest untuk Deteksi Malware,” vol. 9, no. 1, 2023.

[14] S. Rasheed, G. K. Kumar, D. M. Rani, M. V. V. P. Kantipudi, and M. Anila, “EAI Endorsed Transactions Heart Disease Prediction Using GridSearchCV and Random Forest,” vol. 10, pp. 1–8, 2024, doi: 10.4108/eetpht.10.5523.

[15] L. Techniques, “Enhancing Heart Disease Prediction Accuracy through Machine Learning Techniques and Optimization,” 2023.

Published

2026-07-14

How to Cite

Arsenly Realino, Wahyu Nugraha, & Rabiatus Sa’adah. (2026). Komparasi Model Logistic Regression dan Random Forest pada Prediksi Penyakit Jantung Berdasarkan Analisis Fitur Klinis. Jurnal Komputer Teknologi Informasi Sistem Komputer (JUKTISI), 5(2), 1713–1721. https://doi.org/10.62712/juktisi.v5i2.1400