1 paper
Wenhao Zhou, Hao Zheng, Rong Zhao
Large Vision-Language Models (LVLMs) typically align visual features from an encoder with a pre-trained Large Language Model (LLM). However, this makes the visual perception module…