Hongyu Zhu, Sichu Liang, Wenwen Wang +5
With the surge of large language models (LLMs), Large Vision-Language Models (VLMs)--which integrate vision encoders with LLMs for accurate visual grounding--have shown great poten…