1 paper
Alkesh Patel, Melis Ozyildirim, Ying-Chang Cheng +1
Long video summarization presents significant challenges for multimodal large language models (MLLMs), particularly in maintaining temporal fidelity over extended durations and pro…