1 paper · 1 filter
Hsin-Ying Lee, Hung-Ting Su, Bing-Chen Tsai +3
While recent large-scale video-language pre-training made great progress in video question answering, the design of spatial modeling of video-language models is less fine-grained t…