1 paper
Carlos Plou, Cesar Borja, Ruben Martinez-Cantin +1
Finding information in hour-long videos is a challenging task even for top-performing Vision Language Models (VLMs), as encoding visual content quickly exceeds available context wi…