Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

24 Commits
 
 
 
 
 
 
 
 
 
 

Repository files navigation

¿Qué tan memorable es un video?

Análisis multimodal de texto, color y audio

Python Jupyter TensorFlow scikit-learn

Se analiza si la memorabilidad de un clip de video puede predecirse a partir de tres fuentes de información: descripciones textuales, colores dominantes y audio.

Comparación de accuracy de los modelos

Resumen ejecutivo

Se analizaron 660 fragmentos de video con una etiqueta binaria de memorabilidad. Se evaluaron cinco configuraciones de clasificación: TF-IDF con regresión logística, TF-IDF con XGBoost, una red LSTM sobre embeddings entrenables, una CNN aplicada al color dominante y una CNN 1D aplicada a embeddings de audio YAMNet.

El principal hallazgo es que ninguna modalidad aislada supera de forma consistente la línea base mayoritaria, cercana al 56%. El texto conserva algo de señal, pero las captions presentan una fuerte repetición; el color dominante elimina casi todo el contexto visual y el modelo se vuelca a la clase mayoritaria; y el audio muestra un marcado sobreajuste. El resultado orienta el problema hacia una estrategia multimodal y una evaluación más robusta.

Pregunta de análisis

¿Es posible distinguir videos memorables y no memorables utilizando por separado su descripción textual, su color dominante o sus características de audio?

La variable objetivo se define como:

  • memorable = 1 si memorability_score > 0.5.
  • memorable = 0 en caso contrario.

Datos

Componente Descripción
Muestra 660 fragmentos de video.
Etiquetas Puntaje continuo y clasificación binaria de memorabilidad.
Texto 90 descripciones visuales por secuencia.
Color Color dominante de fondo y de primer plano.
Audio Embeddings YAMNet de forma (20, 1024) por secuencia.
Balance Aproximadamente 56% no memorables y 44% memorables.

Los archivos se descargan desde el repositorio académico de origen. Para evitar duplicaciones y respetar las condiciones del material externo, no se almacenan copias en este repositorio. Ver data/README.md.

Flujo de trabajo

flowchart TD
    A["660 clips etiquetados"] --> B["Texto: captions"]
    A --> C["Visual: colores"]
    A --> D["Audio: YAMNet"]
    B --> E["TF-IDF / Embedding + LSTM"]
    C --> F["CNN 2D"]
    D --> G["CNN 1D"]
    E --> H["Evaluación por clase"]
    F --> H
    G --> H
Loading

1. Texto

Las captions se normalizaron en inglés mediante lematización y eliminación de stopwords. El análisis exploratorio mostró que cada secuencia contiene 90 frases y que predominan estructuras altamente repetitivas como “a man…”, “a woman…” y acciones como holding, standing o sitting. La longitud media de las palabras es de 3,54 caracteres y no aparecen términos emocionales simples como smiling, crying, angry, happy o laugh.

Se compararon:

  • TF-IDF + SVD + regresión logística.
  • TF-IDF + XGBoost.
  • Tokenización + capa Embedding entrenable + LSTM.

2. Color dominante

Se asignó a cada secuencia la moda del color de fondo y del primer plano. A partir del color de primer plano se generaron imágenes sintéticas de 100 × 100 píxeles, usadas para entrenar una CNN 2D con aumentación de datos.

3. Audio

Cada clip se representó mediante embeddings YAMNet con 20 pasos temporales y 1024 características. La clasificación se realizó con una CNN 1D compuesta por bloques convolucionales, normalización, pooling y dropout.

Resultados

Modelo Modalidad Accuracy F1 macro Lectura principal
TF-IDF + regresión logística Texto 55,5% 0,52 Cercano a la línea base; bajo recall de memorables.
TF-IDF + XGBoost Texto 50,9% 0,49 No mejora al modelo lineal.
Embedding + LSTM Texto 55,0% 0,55 Distribución de F1 más equilibrada.
Color dominante + CNN 2D Visual 55,6% 0,37 Predice casi todo como no memorable.
YAMNet + CNN 1D Audio 51,0% 0,49 Sobreajuste y numerosos falsos negativos.

Nota: las métricas son orientativas porque los enfoques no usan exactamente el mismo conjunto de evaluación. La tabla reproduce las salidas guardadas en el notebook. Se utiliza F1 macro porque el generador visual reasigna internamente 0 = memorable y 1 = no memorable.

Hallazgos principales

  1. Las captions tienen señal limitada. Su vocabulario es concreto y visual, pero la repetición reduce la capacidad discriminante.
  2. El color aislado no captura la escena. La CNN obtiene 56% de accuracy, pero clasifica 119 de 121 clips no memorables y solo 1 de 95 memorables.
  3. El audio sobreajusta. La accuracy de entrenamiento llega a cerca de 97%, mientras que la evaluación final permanece en 51%.
  4. La accuracy sola es insuficiente. El análisis por clase y las matrices de confusión revelan fallas que el valor agregado oculta.
  5. El siguiente paso natural es multimodal. La memorabilidad parece depender de una combinación de contenido visual, lenguaje, sonido y contexto.

Próximas mejoras

  • Validación cruzada estratificada y estimación de variabilidad.
  • Ajuste de pesos de clase, umbral y early stopping.
  • Fusión multimodal de texto, imagen y audio.
  • Representaciones visuales preentrenadas que conserven objetos y contexto.
  • Análisis de errores por película, escena y tipo de contenido.
  • Refactorización del notebook en módulos reproducibles.

About

Analysis of video memorability using computer vision and machine learning techniques.

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages