1 paper · 1 filter
Yaqi Sun, Kyohei Atarashi, Koh Takeuchi +1
Large Vision-Language Models (LVLMs) integrate image encoders with Large Language Models (LLMs) to process multi-modal inputs and perform complex visual tasks. However, they often…