1 paper
Seng Nam Chen, Hao Chen, Chenglam Ho +4
Long video understanding (LVU) remains a core challenge in multimodal learning. Although recent vision-language models (VLMs) have made notable progress, existing benchmarks mainly…