1 paper
Shanqing Xu, Meng Luo, Mengchen Qian +7
Long videos contain far more visual content than Large Vision-Language Models (LVLMs) can process under a fixed visual-token budget, making frame selection essential. Existing quer…