Se analiza si la memorabilidad de un clip de video puede predecirse a partir de tres fuentes de información: descripciones textuales, colores dominantes y audio.
Se analizaron 660 fragmentos de video con una etiqueta binaria de memorabilidad. Se evaluaron cinco configuraciones de clasificación: TF-IDF con regresión logística, TF-IDF con XGBoost, una red LSTM sobre embeddings entrenables, una CNN aplicada al color dominante y una CNN 1D aplicada a embeddings de audio YAMNet.
El principal hallazgo es que ninguna modalidad aislada supera de forma consistente la línea base mayoritaria, cercana al 56%. El texto conserva algo de señal, pero las captions presentan una fuerte repetición; el color dominante elimina casi todo el contexto visual y el modelo se vuelca a la clase mayoritaria; y el audio muestra un marcado sobreajuste. El resultado orienta el problema hacia una estrategia multimodal y una evaluación más robusta.
¿Es posible distinguir videos memorables y no memorables utilizando por separado su descripción textual, su color dominante o sus características de audio?
La variable objetivo se define como:
memorable = 1simemorability_score > 0.5.memorable = 0en caso contrario.
| Componente | Descripción |
|---|---|
| Muestra | 660 fragmentos de video. |
| Etiquetas | Puntaje continuo y clasificación binaria de memorabilidad. |
| Texto | 90 descripciones visuales por secuencia. |
| Color | Color dominante de fondo y de primer plano. |
| Audio | Embeddings YAMNet de forma (20, 1024) por secuencia. |
| Balance | Aproximadamente 56% no memorables y 44% memorables. |
Los archivos se descargan desde el repositorio académico de origen. Para evitar
duplicaciones y respetar las condiciones del material externo, no se almacenan
copias en este repositorio. Ver data/README.md.
flowchart TD
A["660 clips etiquetados"] --> B["Texto: captions"]
A --> C["Visual: colores"]
A --> D["Audio: YAMNet"]
B --> E["TF-IDF / Embedding + LSTM"]
C --> F["CNN 2D"]
D --> G["CNN 1D"]
E --> H["Evaluación por clase"]
F --> H
G --> H
Las captions se normalizaron en inglés mediante lematización y eliminación de
stopwords. El análisis exploratorio mostró que cada secuencia contiene 90
frases y que predominan estructuras altamente repetitivas como “a man…”, “a
woman…” y acciones como holding, standing o sitting. La longitud media de
las palabras es de 3,54 caracteres y no aparecen términos emocionales simples
como smiling, crying, angry, happy o laugh.
Se compararon:
- TF-IDF + SVD + regresión logística.
- TF-IDF + XGBoost.
- Tokenización + capa
Embeddingentrenable + LSTM.
Se asignó a cada secuencia la moda del color de fondo y del primer plano. A partir del color de primer plano se generaron imágenes sintéticas de 100 × 100 píxeles, usadas para entrenar una CNN 2D con aumentación de datos.
Cada clip se representó mediante embeddings YAMNet con 20 pasos temporales y 1024 características. La clasificación se realizó con una CNN 1D compuesta por bloques convolucionales, normalización, pooling y dropout.
| Modelo | Modalidad | Accuracy | F1 macro | Lectura principal |
|---|---|---|---|---|
| TF-IDF + regresión logística | Texto | 55,5% | 0,52 | Cercano a la línea base; bajo recall de memorables. |
| TF-IDF + XGBoost | Texto | 50,9% | 0,49 | No mejora al modelo lineal. |
| Embedding + LSTM | Texto | 55,0% | 0,55 | Distribución de F1 más equilibrada. |
| Color dominante + CNN 2D | Visual | 55,6% | 0,37 | Predice casi todo como no memorable. |
| YAMNet + CNN 1D | Audio | 51,0% | 0,49 | Sobreajuste y numerosos falsos negativos. |
Nota: las métricas son orientativas porque los enfoques no usan exactamente el mismo conjunto de evaluación. La tabla reproduce las salidas guardadas en el notebook. Se utiliza F1 macro porque el generador visual reasigna internamente
0 = memorabley1 = no memorable.
- Las captions tienen señal limitada. Su vocabulario es concreto y visual, pero la repetición reduce la capacidad discriminante.
- El color aislado no captura la escena. La CNN obtiene 56% de accuracy, pero clasifica 119 de 121 clips no memorables y solo 1 de 95 memorables.
- El audio sobreajusta. La accuracy de entrenamiento llega a cerca de 97%, mientras que la evaluación final permanece en 51%.
- La accuracy sola es insuficiente. El análisis por clase y las matrices de confusión revelan fallas que el valor agregado oculta.
- El siguiente paso natural es multimodal. La memorabilidad parece depender de una combinación de contenido visual, lenguaje, sonido y contexto.
- Validación cruzada estratificada y estimación de variabilidad.
- Ajuste de pesos de clase, umbral y
early stopping. - Fusión multimodal de texto, imagen y audio.
- Representaciones visuales preentrenadas que conserven objetos y contexto.
- Análisis de errores por película, escena y tipo de contenido.
- Refactorización del notebook en módulos reproducibles.
