1 paper
Sohee Kim, Soohyun Ryu, Joonhyung Park +1
Large Vision-Language Models (LVLMs) generate contextually relevant responses by jointly interpreting visual and textual inputs. However, our finding reveals they often mistakenly…