Do video models actually use the video? A modality-ablation, contribution and robustness diagnostic for multimodal VideoQA (vision/audio/subtitles). Offline-testable + Colab VLM backend.
python video evaluation vlm interpretability robustness multimodal video-question-answering llm modality-bias
-
Updated
Jun 20, 2026 - Jupyter Notebook