Análisis aplicado de modelos de regresión para variables binarias a través de tres casos de estudio:
- Posesión de vivienda propia: relación entre el ingreso familiar y la probabilidad de ser propietario.
- Titanic: estimación de la probabilidad de supervivencia según edad, sexo y clase del pasaje.
- Rendimiento académico: análisis de la probabilidad de obtener una calificación A según antecedentes académicos y método de enseñanza.
El proyecto fue desarrollado en Python como parte de la materia Modelos de Regresión Generalizados de la Maestría en Métodos Cuantitativos para la Gestión y Análisis de Datos en Organizaciones.
Los casos permiten comparar distintas alternativas para modelar una variable de respuesta binaria:
- Linear Probability Model (LPM): estimación mediante mínimos cuadrados ordinarios.
- Logit model: modelización de la probabilidad a partir de la función logística.
- Probit model: estimación basada en la función de distribución normal acumulada.
- Binary logistic regression: análisis multivariado, pruebas de significación, métricas de ajuste y clasificación.
El trabajo incluye análisis descriptivo, evaluación de significancia global e individual, comparación de coeficientes, medidas de bondad de ajuste, matrices de confusión y curvas ROC.
El análisis utiliza una encuesta a 40 familias para estudiar la relación entre el ingreso familiar y la posesión de vivienda. Se comparan cuatro especificaciones: modelo lineal de probabilidad, Logit, Probit y Logit Link.
Se ajusta un modelo de regresión logística binaria sobre 1.046 pasajeros. Las variables explicativas son la edad, el sexo y la clase del pasaje.
Los resultados muestran que las variables incluidas son globalmente significativas. El modelo alcanza un accuracy de 0,7849, una sensibilidad de 0,7049 y una especificidad de 0,8401.
Se analizan 32 estudiantes y se comparan los modelos Logit, Probit y lineal de probabilidad. Las variables explicativas son:
gpa: promedio académico previo.tuce: resultado de una evaluación diagnóstica.psi: utilización de un nuevo método de enseñanza.
Las variables psi y gpa resultan significativas en los tres modelos, mientras que tuce no presenta significancia estadística. El trabajo selecciona el modelo Probit por su ajuste global levemente superior entre los modelos diseñados para respuestas binarias.
generalized-regression-models/
├── assets/ # Gráficos generados en los notebooks
├── data/ # Datasets completos utilizados en los tres casos
├── notebooks/ # Notebooks originales de los tres casos
├── reports/ # Informe completo en PDF y formato editable
├── results/ # Tablas comparativas y principales resultados
├── .gitignore
├── README.md
└── requirements.txt
La carpeta data/ contiene los tres datasets completos utilizados en el trabajo:
CASO 1 VIVIENDA PROPIA DATA SET.txt: encuesta a 40 familias con la condición de propiedad de vivienda y el ingreso familiar.CASO 2 TITANIC DATA SET.csv: información de pasajeros, supervivencia, clase, sexo y edad.CASO 3 PRUEBAS REND DATA SET.csv: información académica de 32 estudiantes, incluyendo GPA, TUCE, PSI y calificación final.
Los notebooks se conservaron sin modificaciones y mantienen las rutas empleadas durante el desarrollo original. Para ejecutarlos localmente, es necesario reemplazar esas rutas por la ubicación de los archivos dentro de data/.
- Python
- Jupyter Notebook / Google Colab
- pandas
- NumPy
- Matplotlib
- seaborn
- statsmodels
- SciPy
- scikit-learn
pip install -r requirements.txtLuego se pueden abrir los archivos de la carpeta notebooks/ en Jupyter Notebook, JupyterLab o Google Colab.
Lea Lambrecht
- LinkedIn: linkedin.com/in/lealambrecht
- GitHub: github.com/leanlambrecht


