University project for Big Data & Data Mining.
End-to-end machine learning pipeline that detects fraudulent credit card transactions using the Kaggle Credit Card Fraud Detection dataset.
Models: Logistic Regression, Decision Tree Advanced technique: K-Means Clustering Imbalance handling: SMOTE
mkdir credit_card_fraud && cd credit_card_fraud
mkdir data srcpython -m venv venv
source venv/bin/activate # Mac/Linux
venv\Scripts\activate # Windowspip install -r requirements.txtDownload creditcard.csv from:
https://www.kaggle.com/datasets/mlg-ulb/creditcardfraud
Place it in data/creditcard.csv.
python main.pystreamlit run app.py- Dataset: 284,807 transactions, 492 fraud cases (~0.17%)
- Both models trained on SMOTE-balanced training data
- Evaluation on the original (imbalanced) test set
- Clustering summary showing fraud concentration per cluster
- Interactive Streamlit dashboard with all results