1 paper · 1 filter
Yinsong Xu, Wei Jing, Liuxin Zhang +2
Understanding long-form egocentric videos remains challenging for multimodal large language models (MLLMs) due to limited context length and insufficient grounding of fine-grained…