Machine-learning pipeline for cardiovascular risk prediction from clinical datasets
Karina A. Zhubanazarova1, Irina A. Matveeva1; 1Samara National Research University, Samara, Russia
Abstract
This research presents a complete machine-learning pipeline for cardiovascular risk prediction using classical clinical datasets and modern gradient-boosting models. After exploratory data analysis and cleaning of the Cleveland Heart Disease dataset and supplementary clinical sources, the study compares feature-engineering strategies, scaling, and selection techniques to build robust predictors. Several algorithms are evaluated — Random Forest, XGBoost, LightGBM, CatBoost, SVM, k-NN, and baseline logistic/PLS approaches with hyperparameter tuning and stratified cross-validation to control overfitting. Model performance is assessed using Accuracy, Precision, Recall, F1-score and ROC‑AUC, and feature importance and SHAP analyses are used to interpret risk drivers such as age, cholesterol, resting blood pressure and exercise-induced angina. The work also implements a lightweight Flask API and a Flutter front-end to demonstrate deployment of the best model as a clinical decision support prototype.
Speaker
Karina Zhubanazarova
Samara National Research University
Russia
Discussion
Ask question