1 paper
Chenchen Lin, Sanbao Su, Rachel Luo +4
Multimodal large language models (MLLMs) typically rely on a single late-layer feature from a frozen vision encoder, leaving the encoder's rich hierarchy of visual cues under-utili…