1 paper
Wenjie Liu, Hao Wu, Xin Qiu +6
Modern multimodal large language models (MLLMs) adopt a unified self-attention design that processes visual and textual tokens at every Transformer layer, incurring substantial com…