1 paper
Shiyu Li, Zi-Yuan Hu, Shijia Huang +3
Despite their strong multimodal understanding ability, multimodal large language models (MLLMs) incur substantial computational overhead when processing long visual token sequences…