Skip to content

Repository files navigation

Integración Multi-Tabla y Construcción de Tabla Analítica — MovieLens

Python pandas Matplotlib Seaborn

Contenido

Pregunta: ¿se pueden combinar 4 tablas relacionadas de un sistema real (calificaciones, películas, etiquetas, enlaces externos) en una sola tabla analítica, sin perder filas ni introducir duplicados o nulos fantasma?

Resultado en una frase: 100,836 calificaciones sobre 9,742 películas integradas en una tabla analítica única, con cada unión (concat, merge) validada antes/después.

Combinar 4 tablas relacionadas (calificaciones, películas, etiquetas, enlaces externos) en una sola tabla analítica lista para análisis, aplicando concat(), merge() y validación de cada unión.


Dataset

MovieLens ml-latest-small (GroupLens Research, Universidad de Minnesota) — ratings.csv, movies.csv, tags.csv, links.csv (userId/movieId como claves de relación entre tablas). 100,836 calificaciones y 3,683 etiquetas de 610 usuarios sobre 9,742 películas.

Dataset de uso público para fines de investigación/educación bajo la licencia de GroupLens (no comercial, redistribuible bajo las mismas condiciones). Cita oficial: Harper, F.M. & Konstan, J.A. (2015). The MovieLens Datasets: History and Context. ACM TiiS 5(4): 19:1–19:19. DOI: 10.1145/2827872. Fuente: grouplens.org/datasets/movielens

Proceso

  1. Carga y exploración: qué tablas se pueden relacionar y por qué (clave común movieId).
  2. concat(): se divide ratings en dos partes y se reconstruye, verificando que no se pierden filas.
  3. merge(): ratings + movies + links usando movieId como clave.
  4. Validación de la integración: tamaño del dataset antes/después, nulos nuevos, duplicados inesperados, cobertura de claves.
  5. Tabla analítica final: calificación, película, género, fecha, enlaces externos + columnas derivadas (año, mes, género principal).
  6. Análisis final: géneros con mejor rating promedio, películas más calificadas, años con más actividad — con 5 gráficos adicionales (barras, línea, histograma, boxplot).

Hallazgos principales

Rating promedio por género

  • La unión por movieId no introdujo nulos nuevos ni duplicados inesperados — validación exitosa.
  • Se identificó el género principal con mejor rating promedio y las películas con más calificaciones.
  • La actividad de calificaciones varía por año, visible en la tabla analítica exportada.

Herramientas

Python (pandas, NumPy) · Matplotlib/Seaborn

Estructura del repositorio

├── README.md
├── requirements.txt                          # Dependencias Python (pip install -r requirements.txt)
├── integracion_multitabla_movielens.ipynb  # Notebook completo (6 partes: carga, concat, merge, validación, tabla analítica, análisis)
├── ratings.csv / movies.csv / tags.csv / links.csv   # Datos originales MovieLens
├── tabla_analitica_final.csv               # Tabla analítica integrada (salida del proyecto)
└── results/                                 # Gráficos exportados del notebook
    ├── movielens_01.png
    ├── movielens_02.png
    ├── movielens_03.png
    ├── movielens_04.png
    └── movielens_05.png

Autora

Karina Correa — LinkedIn · GitHub

About

Integración de 4 tablas relacionadas (ratings, movies, tags, links) en una tabla analítica única, con validación de cada unión

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages