Showing cs.CVShow all
2 papers · 1 filter
cs.CV2026
LVSum: A Benchmark for Timestamp-Aware Long Video Summarization
Alkesh Patel, Melis Ozyildirim, Ying-Chang Cheng +1
Long video summarization presents significant challenges for multimodal large language models (MLLMs), particularly in maintaining temporal fidelity over extended durations and pro…
cs.CV2025
Advancing Egocentric Video Question Answering with Multimodal Large Language Models
Alkesh Patel, Vibhav Chitalia, Yinfei Yang
Egocentric Video Question Answering (QA) requires models to handle long-horizon temporal reasoning, first-person perspectives, and specialized challenges like frequent camera movem…