1 paper · 1 filter
Qing Yang, Pengcheng Huang, Xinze Li +6
Long-video question answering remains challenging for Vision-Language Models (VLMs), as answer-relevant evidence is often sparse, transient, and temporally dispersed across lengthy…