1 paper
Bo Zhang, Wenxin Wang, Feng Chen +4
Recent advancements in MLLM-based long-form video understanding have mitigated inference-time computational cost and limited context lengths by selecting query-relevant frames. How…