Welcome to the Data Science Internship Repository! This space is designed to help you gain real-world experience in applying machine learning and data science across multiple domains, such as HR analytics, NLP summarization, healthcare, and finance.
Each task in this project includes:
- 📁 Dataset access (public or pre-downloaded)
- 📊 EDA & preprocessing notebooks
- 🧠 Model building and tuning
- 🧾 Explainability or interpretability techniques
- 📈 Performance metrics visualization
- 📋 Reports with actionable business/health insights
| Area | Focus | Tools / Libraries |
|---|---|---|
| HR Analytics | Attrition prediction & SHAP analysis | pandas, sklearn, shap |
| NLP | Text summarization (extractive + abstractive) | spaCy, transformers, BERT/GPT |
| Healthcare | Disease classification & risk insights | XGBoost, seaborn, AUC-ROC |
| Finance | Loan default prediction + SMOTE | LightGBM, imbalanced-learn |
Objective: Predict employee attrition and provide actionable retention strategies.
📦 Dataset: IBM HR Analytics Employee Dataset
📈 Algorithms: Random Forest
🔍 Explainability: SHAP
📊 Output: Interactive Dashboard / HR Insights Report
- Data Cleaning & EDA
- Model Training (RF)
- Model Explainability (SHAP, LIME)
- Insight Generation + Report
Objective: Automatically summarize long texts using extractive and abstractive techniques.
📦 Dataset: CNN / Daily Mail
🧰 Tools: spaCy, HuggingFace Transformers (BERT, GPT)
📝 Output: Summary Generator + Model Evaluation
- Preprocessing (Tokenization, Cleaning)
- Extractive Summarization (spaCy)
- Abstractive Summarization (Transformers)
- Model Fine-Tuning
- Summary Evaluation Report
Objective: Predict diabetes likelihood using medical features.
📦 Dataset: PIMA Indians Diabetes Dataset
📈 Models: Gradient Boosting
📊 Metrics: F1 Score, AUC-ROC
🧠 Output: Predictive model + Risk Profile Insights
- EDA & Feature Engineering
- Data Scaling
- Model Training & Evaluation
- AUC Curve + Feature Importance
- Healthcare Recommendations
Objective: Identify high-risk borrowers using financial data.
📦 Dataset: Lending Club Dataset
📈 Models: LightGBM, Logistic Regression
📊 Metrics: Precision, Recall, F1, AUC
📄 Output: Risk Classifier + Lender Report
- Data Preprocessing (Missing Values, Encoding)
- Handle Class Imbalance (SMOTE)
- Model Training (LightGBM)
- Evaluation & Confusion Matrix
- Risk Insights Dashboard
Project Lead: Rubaika Akhtar
Intern Team: Developers Hub