1 paper · 2 filters
Yumeng Shi, Quanyu Long, Yin Wu +1
Seeing frames in order does not mean representing time. Modern VideoLMs receive ordered video streams, yet their main supervision acts on generated text rather than video-token rep…