π§ Diabetes Risk Prediction & Random Projection Analysis π Overview
This project implements a machine learning pipeline for diabetes prediction combined with Random Projection techniques to analyze dimensionality reduction trade-offs. It evaluates multiple models and optimizes performance using GPU-accelerated XGBoost.
π Dataset Samples: 70,692 Features: 22 β 23 (after feature engineering) Balanced dataset: Diabetic: 35,346 Non-diabetic: 35,346 Duplicates removed: 1,635 βοΈ Key Features Advanced feature engineering (HealthScore, RiskFactorCount) Outlier detection & capping Random Projection (Gaussian, Sparse, Achlioptas) GPU-based training using CUDA + XGBoost Statistical validation + SHAP interpretability π Model Performance πΉ Baseline Models Model Accuracy Precision Recall F1 ROC-AUC Logistic Regression 0.7456 0.7384 0.7735 0.7555 0.8182 Random Forest 0.7436 0.7256 0.7967 0.7595 0.8192 XGBoost 0.7498 0.7317 0.8016 0.7651 0.8235
β Best Model: XGBoost
πΉ Final Tuned Model Accuracy: 0.7488 Precision: 0.7307 Recall: 0.8009 F1-Score: 0.7642 ROC-AUC: 0.8246 β‘ Random Projection Results π Dimensionality Reduction Impact Original features: 23 Reduced features: 15 (β34.8%) Memory reduction: 34.8% πΉ XGBoost Comparison Metric Original Projected Accuracy 0.7498 0.7333 ROC-AUC 0.8235 0.8026 Precision 0.7317 0.7151 Recall 0.8016 0.7900
π Only ~1β2% performance drop with significant dimensionality reduction.
πΉ Classification Trade-off (Projection) x=5 β Accuracy: 0.6734 x=15 β Accuracy: 0.7215 x=20 β Accuracy: 0.7457 (β original) πΉ K-Means Cost Reduction Cost ratio improved from 2.56 β 1.69 as dimension increased β‘ Performance Optimization XGBoost training time: 0.41s Logistic Regression: 1.08s Random Forest: 1.23s π§ Hyperparameter Tuning Best CV Score: 0.8266 Strategy: Fine-Tuned Grid Search GPU acceleration used (Tesla T4)