1 paper · 1 filter
Shin'ya Yamaguchi, Kosuke Nishida, Daiki Chijiwa
Large vision-language models (LVLMs) have demonstrated remarkable capabilities by integrating pre-trained vision encoders with large language models (LLMs). Similar to single-modal…