SARATOV FALL MEETING SFM 

© 2026 All Rights Reserved

Machine-learning pipeline for cardiovascular risk prediction from clinical datasets

Karina A. Zhubanazarova1, Irina A. Matveeva1; 1Samara National Research University, Samara, Russia

Abstract

This research presents a complete machine-learning pipeline for cardiovascular risk prediction using classical clinical datasets and modern gradient-boosting models. After exploratory data analysis and cleaning of the Cleveland Heart Disease dataset and supplementary clinical sources, the study compares feature-engineering strategies, scaling, and selection techniques to build robust predictors. Several algorithms are evaluated — Random Forest, XGBoost, LightGBM, CatBoost, SVM, k-NN, and baseline logistic/PLS approaches with hyperparameter tuning and stratified cross-validation to control overfitting. Model performance is assessed using Accuracy, Precision, Recall, F1-score and ROC‑AUC, and feature importance and SHAP analyses are used to interpret risk drivers such as age, cholesterol, resting blood pressure and exercise-induced angina. The work also implements a lightweight Flask API and a Flutter front-end to demonstrate deployment of the best model as a clinical decision support prototype.

Speaker

Karina Zhubanazarova
Samara National Research University
Russia

Discussion

Ask question