1 paper · 1 filter
Chen Zhong, Xiao An, Zijie Wang +3
Visual inputs in vision-language models (VLMs) are often encoded into substantially longer token sequences than text, making visual tokens a major bottleneck for efficient inferenc…