Skip to content

About

This repository is a hands-on learning hub for Data Science Interns, designed to provide real-world exposure to building, evaluating, and explaining machine learning models across various industries.

Resources

Stars

0 stars

Watchers

1 watching

Forks

Repository files navigation

👩‍💻 Data Science Internship Projects (Developers Hub)

Welcome to the Data Science Internship Repository! This space is designed to help you gain real-world experience in applying machine learning and data science across multiple domains, such as HR analytics, NLP summarization, healthcare, and finance.

🧱 Key Components

Each task in this project includes:

  • 📁 Dataset access (public or pre-downloaded)
  • 📊 EDA & preprocessing notebooks
  • 🧠 Model building and tuning
  • 🧾 Explainability or interpretability techniques
  • 📈 Performance metrics visualization
  • 📋 Reports with actionable business/health insights

💡 Project Highlights

Area Focus Tools / Libraries
HR Analytics Attrition prediction & SHAP analysis pandas, sklearn, shap
NLP Text summarization (extractive + abstractive) spaCy, transformers, BERT/GPT
Healthcare Disease classification & risk insights XGBoost, seaborn, AUC-ROC
Finance Loan default prediction + SMOTE LightGBM, imbalanced-learn

🔍 Task-by-Task Breakdown

🧠 Task 1: Employee Attrition Prediction

Objective: Predict employee attrition and provide actionable retention strategies.

📦 Dataset: IBM HR Analytics Employee Dataset
📈 Algorithms: Random Forest
🔍 Explainability: SHAP
📊 Output: Interactive Dashboard / HR Insights Report

✅ Task Checklist

  • Data Cleaning & EDA
  • Model Training (RF)
  • Model Explainability (SHAP, LIME)
  • Insight Generation + Report

📰 Task 2: Text Summarization

Objective: Automatically summarize long texts using extractive and abstractive techniques.

📦 Dataset: CNN / Daily Mail
🧰 Tools: spaCy, HuggingFace Transformers (BERT, GPT)
📝 Output: Summary Generator + Model Evaluation

✅ Task Checklist

  • Preprocessing (Tokenization, Cleaning)
  • Extractive Summarization (spaCy)
  • Abstractive Summarization (Transformers)
  • Model Fine-Tuning
  • Summary Evaluation Report

🩺 Task 3: Disease Diagnosis Prediction

Objective: Predict diabetes likelihood using medical features.

📦 Dataset: PIMA Indians Diabetes Dataset
📈 Models: Gradient Boosting
📊 Metrics: F1 Score, AUC-ROC
🧠 Output: Predictive model + Risk Profile Insights

✅ Task Checklist

  • EDA & Feature Engineering
  • Data Scaling
  • Model Training & Evaluation
  • AUC Curve + Feature Importance
  • Healthcare Recommendations

💰 Task 4: Loan Default Prediction

Objective: Identify high-risk borrowers using financial data.

📦 Dataset: Lending Club Dataset
📈 Models: LightGBM, Logistic Regression
📊 Metrics: Precision, Recall, F1, AUC
📄 Output: Risk Classifier + Lender Report

✅ Task Checklist

  • Data Preprocessing (Missing Values, Encoding)
  • Handle Class Imbalance (SMOTE)
  • Model Training (LightGBM)
  • Evaluation & Confusion Matrix
  • Risk Insights Dashboard

👥 Contributors

Project Lead: Rubaika Akhtar

Intern Team: Developers Hub

About

This repository is a hands-on learning hub for Data Science Interns, designed to provide real-world exposure to building, evaluating, and explaining machine learning models across various industries.

Resources

Stars

0 stars

Watchers

1 watching

Forks

Releases

Packages

Contributors

Languages