1 paper
Lianying Chao, Linfeng Yin, Peiyu Ren +8
Video captioning models convert frames into visual tokens and generate descriptions with large language models (LLMs). Since encoding all frames is prohibitively expensive, uniform…