1 paper
Hyeonyu Kim, Sehwan Lim, Youngwon Choi +2
Vision-language models (VLMs) process an image as a sequence of visual tokens, which creates a substantial computational bottleneck during inference. Recent visual token pruning me…