1 paper · 1 filter
Junfei Wu, Jian Guan, Qiang Liu +4
Current large vision-language models (LVLMs) typically rely on text-only reasoning based on a single-pass visual encoding, which often leads to loss of fine-grained visual informat…