1 paper · 1 filter
Manan Suri, Sarvesh Baskar, Dinesh Manocha
Processing video in vision-language models is expensive: each frame occupies hundreds of tokens, and inference cost scales with every frame and every repeated query. We introduce F…