Predict survival outcomes on the Titanic using machine learning (XGBoost) and the Kaggle dataset.
- train.csv β Training data with survival labels
- test.csv β Test data without survival labels (Download both from Kaggle Titanic Challenge)
Install required packages:
pip install pandas numpy scikit-learn xgboostπ titanic-survival-classification/
βββ Titanic Survival Classification.ipynb
βββ train.csv
βββ test.csv
βββ submission.csv (generated)
-
Clone this repo:
git clone https://github.com/your-username/titanic-survival-classification.git cd titanic-survival-classification -
Add
train.csvandtest.csvto the folder (from Kaggle). -
Launch the notebook:
jupyter notebook "Titanic Survival Classification.ipynb" -
Run all cells to preprocess data, train the model, and generate
submission.csv.
- Preprocessing: Handle missing values, drop irrelevant columns, encode categoricals
- Feature Engineering:
Title,FamilySize,IsAlone - Model: XGBoost with train-validation split
- Output: Predictions saved to
submission.csv
- Validation Accuracy: ~80.45%
- Submission file ready for Kaggle evaluation